{"as_of":"2026-08-10T01:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6553d4b2fc11dc5900b2b6f29d7f8ce1243a6e11d987ffb3107a53e71cc126f4","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:39:48.043254Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:39:41.644202Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:39:49.151368Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"cited_work":{"arxiv_id":"2505.24059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24059","snapshot_observed_at":"2026-08-07T12:39:49.151368Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","venue":"cs.LG","work_id":"9814cbdb-b33d-4922-b097-46d70125e24e","year":2025},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:41.644202Z"},"links":{"cited_paper":"/paper/2505.24059","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:b10ea7b47ba6c5133e4a72baf8065a2b64f99641b5a864009b4294ec422935eb","observation_id":"4b43e443-4b31-4fb0-aec0-873a25c92896","resolution":{"observed_at":"2026-08-07T12:39:49.286208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24059/citation-record","integrity":"/paper/2505.24059/integrity","json":"/paper/2505.24059/citation-record.json","paper":"/paper/2505.24059"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:56.794208Z","title":"In speech production, individ- ual variability in both articulation and its consequent acoustics is robust [4, 5]","venue":null,"work_id":"6e37f2cd-046c-4dc3-ae98-4d021031c41f","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:41.558755Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:9a7cf6c4dee61a703cd90400c56342953e95e675a15b8af51c1132989728dd1c","observation_id":"a03eef48-8f97-425e-931d-ecfed85ff136","resolution":{"observed_at":"2026-08-07T12:39:56.910034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"cited_work":{"arxiv_id":"2505.24059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24059","snapshot_observed_at":"2026-08-07T12:39:49.151368Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","venue":"cs.LG","work_id":"9814cbdb-b33d-4922-b097-46d70125e24e","year":2025},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:41.644202Z"},"links":{"cited_paper":"/paper/2505.24059","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:b10ea7b47ba6c5133e4a72baf8065a2b64f99641b5a864009b4294ec422935eb","observation_id":"4b43e443-4b31-4fb0-aec0-873a25c92896","resolution":{"observed_at":"2026-08-07T12:39:49.286208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:56.338307Z","title":"Dataset We use a new single speaker rtMRI corpus with simultaneously recorded audio and video","venue":null,"work_id":"9155fcd8-75d4-43e2-a67f-1db93fcf075b","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:41.990420Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:5673bb7e20c6fa989ad3212d924650191350d00aad9e4d4cbc9c4936534ffd98","observation_id":"19660cb0-be24-429e-ab9b-effb73b85fca","resolution":{"observed_at":"2026-08-07T12:39:56.432731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.907314Z","title":"Phoneme error rate (PER) The overall PER results on the held-out test set are presented in Table 1","venue":null,"work_id":"dc4a7ea4-146f-43a3-a0b0-c18bf13feeee","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.226483Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:64ebb640a317dd2b64b5d60bc2a4340e4358c401d53bb36dc565a8ffbd2f4616","observation_id":"303e5974-c565-4d3d-aa47-6264830f8626","resolution":{"observed_at":"2026-08-07T12:39:56.067956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.633071Z","title":null,"venue":null,"work_id":"373ebbf8-79db-44a8-84f4-ae77003835a1","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.386227Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:c753330d1617bd2cf12741611b0defb18eba4b3150fc889b85c426a6afd7aac7","observation_id":"8bdbaa1d-acef-4eb8-a05f-8f629f3b9610","resolution":{"observed_at":"2026-08-07T12:39:55.692447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.485999Z","title":null,"venue":null,"work_id":"0ddddc54-6c5f-4155-95c0-03c6a955e74c","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.468817Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:0cb477a55a514a13c72bbf46e6817b21b64ca98a3d6a487d13be10b1a3de24e3","observation_id":"4f9464f1-031f-4df4-aa14-49e5721d453c","resolution":{"observed_at":"2026-08-07T12:39:55.539004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:54.346091Z","title":"The architecture of speech production and the role of the phoneme in speech processing,","venue":null,"work_id":"6180a0fc-f41f-422e-a0c8-747849c1623f","year":2014},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:43.937557Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:30fc678d57c281b64f3b24c8ae7e500a2971eac7d212517cd7b268276d5b350d","observation_id":"b55612bd-f444-4527-91c0-4121046af81d","resolution":{"observed_at":"2026-08-07T12:39:54.456393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:54.074109Z","title":null,"venue":null,"work_id":"cbf91f90-8aed-47d6-8914-112f72121087","year":2018},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:44.133282Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:08ea4a92f05c381356a28d0a8d44111a229d4b4c231d35b842479c61466b5233","observation_id":"02634c6e-5d51-4923-8e6b-70a56bd6e2f3","resolution":{"observed_at":"2026-08-07T12:39:54.199624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.282571Z","title":"Sensorimotor integration in speech processing: computational basis and neural organization,","venue":null,"work_id":"65051903-2a08-412c-9842-78dcf329042d","year":2011},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.627165Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:b62281ea06ca3c9f0dd3796e36924bedde9cf31e8e9784aaabcca38e757847d8","observation_id":"ad08ce4c-bade-4fbb-9f2a-e86bc7862945","resolution":{"observed_at":"2026-08-07T12:39:55.388476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.117113Z","title":"Perception drives production across sensory modalities: A network for sensorimotor integration of visual speech,","venue":null,"work_id":"1225f11a-78a9-480b-96c3-77c925055610","year":2016},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.893417Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:09836824bb5f864581c4d719f460d0ca10a1cf6f957b80812a1262732e04cf97","observation_id":"cefcdd35-e84e-47e7-83a3-67e13141c8a9","resolution":{"observed_at":"2026-08-07T12:39:55.193380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:54.912559Z","title":"The role of temporal modulation in sensorimotor interaction,","venue":null,"work_id":"74c0e0d0-4bc5-4d27-911e-d488b85d8ff6","year":2019},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:43.106505Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:609dd556f05bd011941dc94ad76c9261d626ebb16278ce7cd7f12aba7dec09cd","observation_id":"ba572b53-d737-4711-b1dc-fc85b808dfda","resolution":{"observed_at":"2026-08-07T12:39:54.996114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:54.715404Z","title":"Variability of articulator positions and formants across nine english vowels,","venue":null,"work_id":"cf562888-7688-42d7-8855-0f49a908905a","year":2018},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:43.308671Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:587566234f95d1cc55db3d5518cbad0fd925f22f06880a9fdbf39177b1b5e46d","observation_id":"85e5706b-555a-4ae0-bd48-ce09cd3fa621","resolution":{"observed_at":"2026-08-07T12:39:54.823327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:54.539345Z","title":null,"venue":null,"work_id":"12a95bb6-da6a-45cb-a9b1-ce6e3de8fe66","year":2021},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:43.525990Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:a1a7294db32c7763a533554f3a4e286e02ee633bb527d9c4a0203488593aacf5","observation_id":"28164159-cfd1-489b-9d53-4391d0aed9db","resolution":{"observed_at":"2026-08-07T12:39:54.596321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:43.714834Z","title":"Articulatory phonology: An overview,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:43.714834Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:82af88b688fa42b427489e9ce99f6ad2d1f672f128e65f73c744a25d62397bd1","observation_id":"3583cc3e-bcdd-47fe-a774-a655e5c0234e","resolution":{"observed_at":"2026-08-07T12:39:43.714834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:52.941347Z","title":"Multimodal representations for syn- chronized speech and real-time mri video processing,","venue":null,"work_id":"351db2a4-e9d4-4f1e-b2cf-77fde042a2a4","year":1912},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.396716Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:7182fe86aaf635d84c53c126f5c5ff59405e4f4e2fe323058780be9378db0c8f","observation_id":"1db0d81e-9b23-4164-93c8-43726580f67d","resolution":{"observed_at":"2026-08-07T12:39:53.064691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:52.792117Z","title":"Towards speech classification from acous- tic and vocal tract data in real-time mri,","venue":null,"work_id":"469c1cea-b408-47af-969b-604fa1532783","year":2024},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.545477Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:e237e7c1b8952a42d179a4eb59a156e4d366a7079c2859cce29990ab07132e6c","observation_id":"2e3d5334-098b-416f-8c84-7c5c79b3c398","resolution":{"observed_at":"2026-08-07T12:39:52.867621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-07T00:15:34.035413Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-07T12:39:44.345646Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:44.345646Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:78021ab3c1922852bfceb71252d84189cd7421f0d5b97ca017da72113d7dd8f2","observation_id":"e7a1966a-fbb3-4274-88fc-a3c1116e54fb","resolution":{"observed_at":"2026-08-07T12:39:44.345646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12370","last_updated":"2024-09-19T00:08:28Z","snapshot_observed_at":"2026-08-05T14:02:40.654161Z","submitted_at":"2024-09-19T00:08:28Z","title":"Robust Audiovisual Speech Recognition Models with Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2409.12370","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12370","snapshot_observed_at":"2026-08-07T12:39:48.852053Z","title":"Robust Audiovisual Speech Recognition Models with Mixture-of-Experts","venue":"eess.AS","work_id":"fa13d460-f3d2-44bb-b585-6a8f4e1c12ef","year":2024},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:44.552105Z"},"links":{"cited_paper":"/paper/2409.12370","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:62e872dfe0aa82d8141990462b5c3f1587a47f4923cfecb86324a0e8d6e45a3e","observation_id":"f2a4bde9-cf0a-4d2d-8385-60c6cee01e8c","resolution":{"observed_at":"2026-08-07T12:39:48.950065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:53.775584Z","title":"Speech production real-time mri at 0.55 t,","venue":null,"work_id":"a8882ad9-e8dc-43e4-a552-e7903b8a0cad","year":2024},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:44.741094Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:24053ffdbbe8d30a20c1bea25bb83d8954dd7265e6b2ae8820e135ebdbeaf2f2","observation_id":"002a3ab1-5feb-492e-a620-76fbaab3bf76","resolution":{"observed_at":"2026-08-07T12:39:53.935947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:53.405719Z","title":"A multispeaker dataset of raw and reconstructed speech production real-time mri video and 3d volumetric images,","venue":null,"work_id":"df14e203-21f6-42a1-8773-ec24537a7b0f","year":2021},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:44.921151Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:271f10d372ec3fc235b56a38eecc88fdd2e2aa1949d26f6a8bf36e65eda65abd","observation_id":"84caf0c9-50a7-4904-89ba-54b5dbe728e1","resolution":{"observed_at":"2026-08-07T12:39:53.599113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:56.578917Z","title":"The output of the Conformer is decoded by a single LSTM layer, with a final linear layer used for prediction","venue":null,"work_id":"ba5635b9-dd7b-4f88-9cc5-0aa6118a21dc","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:41.818246Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:dec105135580585fe1fecdd4cc4d1f19daee40968378dda418a0a4dd441908e5","observation_id":"943031f2-54a5-4935-baf7-120ab28b8497","resolution":{"observed_at":"2026-08-07T12:39:56.668434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.11089","last_updated":"2018-07-29T17:36:08Z","snapshot_observed_at":"2026-07-06T06:52:56.132722Z","submitted_at":"2018-07-29T17:36:08Z","title":"Towards Automatic Speech Identification from Vocal Tract Shape Dynamics in Real-time MRI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.11089","snapshot_observed_at":"2026-08-07T12:39:45.026461Z","title":"Towards automatic speech identification from vocal tract shape dynamics in real-time mri,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.026461Z"},"links":{"cited_paper":"/paper/1807.11089","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:a803fa6753f1ffa9b7076e6dc2de94c96c851ae084b475ec1ac07194fb3c3243","observation_id":"53f86a46-9a4c-4b2a-b685-81efa2cfa5ac","resolution":{"observed_at":"2026-08-07T12:39:45.026461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:53.170814Z","title":"Cnn-based phoneme classifier from vocal tract mri learns embed- ding consistent with articulatory topology","venue":null,"work_id":"687eec15-8032-44a0-a442-077ad7a96a71","year":2019},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.220360Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:4fdae42957ed85d8413787a48ec3b8c0a8143133658d7d4f8b510e811ec6b99d","observation_id":"8f0f584e-2244-427e-894a-e5164b58361b","resolution":{"observed_at":"2026-08-07T12:39:53.277765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:50.376872Z","title":"Eval- uation of a novel 8-channel rx coil for speech production mri at 0.55 t,","venue":null,"work_id":"81686591-cf10-4c1f-b969-8f9fdcfa6b7c","year":2023},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.700802Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:94daa2dc49c74c86b28a140b71cd98ea814ead23935500097bc40cd4bde9b359","observation_id":"c7435ec9-7a19-48f8-8a38-cca29cc75173","resolution":{"observed_at":"2026-08-07T12:39:50.456383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:52.528968Z","title":"Direct articulatory observa- tion reveals phoneme recognition performance characteristics of a self-supervised speech model,","venue":null,"work_id":"62c344c6-c712-4e64-bdce-acb88b677761","year":2024},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.684601Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:37018ac011d0552ffe6b3428671e3dadcb752af18327b25f230317904178e5b1","observation_id":"3d723bf9-a38a-4dce-b296-52a9c168af75","resolution":{"observed_at":"2026-08-07T12:39:52.651440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:52.280326Z","title":"Usc-timit: A database of multimodal speech production data,","venue":null,"work_id":"37401be6-3910-47ed-9f04-9fc018288ee6","year":2013},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.838539Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:6643f5a9ccc5a92be5ce6d1eac5254f7098f265fe4835eabca5c395aebbd748a","observation_id":"4a4267c1-21c3-48f6-8d48-5aa5897810fa","resolution":{"observed_at":"2026-08-07T12:39:52.392791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:52.032512Z","title":"Database of volumetric and real-time vocal tract mri for speech science","venue":null,"work_id":"81beca22-0562-438e-b535-3542351b89b7","year":2017},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.054670Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:3e7f0703f95e95b76413134e2ea1e568dfa65906d8b4d3a18161ebd8ea63bd18","observation_id":"4a5597dc-eb9f-4ab4-835b-3445f4b1a323","resolution":{"observed_at":"2026-08-07T12:39:52.163254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:50.535481Z","title":"Characterization of inter-speaker articulatory variability: A two- level multi-speaker modelling approach based on mri data,","venue":null,"work_id":"4bb619b1-36b2-4820-b987-43a9fd6eea45","year":2019},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.187469Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:44bb5b2c4340f28310507f0fe8213bb919d184e57719ad6c5ad1ef1a058a5397","observation_id":"93f597cf-99dd-42af-a453-18d0d01513ef","resolution":{"observed_at":"2026-08-07T12:39:50.879504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T12:39:46.387249Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.387249Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:b8ba0b0b6f04eea8d0c7a128c8a2b0dfd6ec801438d0909c76986125ae6f96f4","observation_id":"61506fae-6150-4f64-9c98-12aa2c30bd3e","resolution":{"observed_at":"2026-08-07T12:39:46.387249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:46.480237Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.480237Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:5787dbda2e124ba1c5a423a7123303f5543cf1b4f6e92e2a0b713dc51524cde7","observation_id":"871471fd-e05a-40c1-99e4-0a104d85efe2","resolution":{"observed_at":"2026-08-07T12:39:46.480237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11680","last_updated":"2021-09-23T22:50:32Z","snapshot_observed_at":"2026-08-02T00:37:53.191869Z","submitted_at":"2021-09-23T22:50:32Z","title":"Simple and Effective Zero-shot Cross-lingual Phoneme Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11680","snapshot_observed_at":"2026-08-07T12:39:46.592923Z","title":"Simple and effective zero-shot cross-lingual phoneme recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.592923Z"},"links":{"cited_paper":"/paper/2109.11680","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:1376094baf4c3b7f76bad6d1c342a890e3027427e1cabf2591cff4f48d921888","observation_id":"6f715e8c-6636-4581-b5c9-a3e2626e3e08","resolution":{"observed_at":"2026-08-07T12:39:46.592923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09723","last_updated":"2022-07-03T19:28:10Z","snapshot_observed_at":"2026-07-06T13:11:46.425668Z","submitted_at":"2022-05-19T17:34:18Z","title":"Robust and Efficient Medical Imaging with Self-Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09723","snapshot_observed_at":"2026-08-07T12:39:47.585835Z","title":"Ro- bust and efficient medical imaging with self-supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.585835Z"},"links":{"cited_paper":"/paper/2205.09723","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:1ee544cf2b20a8d4a4652ab995a955cd47d0d5acd29d1073ec94a3fdee6bd6e1","observation_id":"e9410a79-ce06-4001-8534-f1eba9e98040","resolution":{"observed_at":"2026-08-07T12:39:47.585835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:50.079450Z","title":"State-of-the-art speech production mri protocol for new 0.55 tesla scanners,","venue":null,"work_id":"50dffc89-ab90-45ed-bd07-e1bff620ee80","year":2024},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.766700Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:c2431263b3306724ff696509c60d87ce6819536d096501a860e713f674221bad","observation_id":"445e246d-f9f9-4650-8dd7-e3230c14340d","resolution":{"observed_at":"2026-08-07T12:39:50.243216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:49.721838Z","title":"Announcing the electro- magnetic articulography (day 1) subset of the mngu0 articulatory corpus,","venue":null,"work_id":"8fb18e43-caf3-42f5-ab51-6fbe6cbb78eb","year":2011},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.910754Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:4ea39a78dbf9e3780a14cb44842001f49f4004c73a29d308ea5924acbbcc96e2","observation_id":"93c1d063-cc4a-4c4c-88a2-c60ffcfbd0fb","resolution":{"observed_at":"2026-08-07T12:39:49.890156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12847","last_updated":"2020-09-06T14:32:59Z","snapshot_observed_at":"2026-07-06T09:31:50.012114Z","submitted_at":"2020-06-23T09:19:13Z","title":"Real Time Speech Enhancement in the Waveform Domain","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.12847","snapshot_observed_at":"2026-08-07T12:39:47.014834Z","title":"Real time speech enhancement in the waveform domain,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.014834Z"},"links":{"cited_paper":"/paper/2006.12847","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:4694cf70aa9dc73bc3fef0780bb0fbe0dceaef3df535a588698e29000c98ba0e","observation_id":"75c526be-bcfc-442f-bfee-473c2513d850","resolution":{"observed_at":"2026-08-07T12:39:47.014834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:47.089969Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.089969Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:4def870c0a54cd522c5fe68fa2ecef887e25d2f7fa94e72c685b39c2c1dab100","observation_id":"1808e0f1-00ca-4fce-bb7b-e83a42107629","resolution":{"observed_at":"2026-08-07T12:39:47.089969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11723","last_updated":"2023-07-21T03:12:13Z","snapshot_observed_at":"2026-08-05T09:22:50.877435Z","submitted_at":"2022-10-21T04:24:29Z","title":"Evidence of Vocal Tract Articulation in Self-Supervised Learning of Speech","version":3},"cited_work":{"arxiv_id":"2210.11723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.11723","snapshot_observed_at":"2026-08-07T12:39:48.320375Z","title":"Evidence of Vocal Tract Articulation in Self-Supervised Learning of Speech","venue":"eess.AS","work_id":"233886fd-fc65-470d-80d6-ca680c557c9a","year":2022},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.199046Z"},"links":{"cited_paper":"/paper/2210.11723","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:03ef84bfc159ec57dd9589021b00b0b874a5784ef03d32930519d7014b7a210e","observation_id":"951f1270-1d31-4711-90cc-71a59945f422","resolution":{"observed_at":"2026-08-07T12:39:48.383512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T12:39:47.361459Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.361459Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:23dbf186cf5f2ae9a477b2fbc930fec1373c9175a899589938bce253c45e7dab","observation_id":"4d4b0c77-17ab-4de1-82bb-8b7beb2f3203","resolution":{"observed_at":"2026-08-07T12:39:47.361459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05709","last_updated":"2020-07-01T00:09:08Z","snapshot_observed_at":"2026-08-02T19:54:26.138356Z","submitted_at":"2020-02-13T18:50:45Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05709","snapshot_observed_at":"2026-08-07T12:39:47.436332Z","title":"A sim- ple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.436332Z"},"links":{"cited_paper":"/paper/2002.05709","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:9bae96e2dd81cf09603ddcb387e05aed07226a3d3654854ac4c3093c849ac5a2","observation_id":"f2bc14b2-647d-4a89-8c33-86c79e04dbc2","resolution":{"observed_at":"2026-08-07T12:39:47.436332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:47.724939Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.724939Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:ad4d4549e49a9d79308e7873f7bf5aca5aa5949d633f129b4de2bf9381397ae5","observation_id":"8a6cf77d-0e33-4af0-8982-9e0ea2a20e6d","resolution":{"observed_at":"2026-08-07T12:39:47.724939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:49.449288Z","title":"Toward articulatory- acoustic models for liquid approximants based on mri and epg data. part ii. the rhotics,","venue":null,"work_id":"7033e8f5-92b1-4e19-ad6f-9636114b67c5","year":1997},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.898973Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:1c02199d70872404ecf6fc11cbd560fdd7e750cdfa020adaa36279bbc0727204","observation_id":"c9039109-fc06-40f7-9e0d-fc49b769315d","resolution":{"observed_at":"2026-08-07T12:39:49.529579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:48.043254Z","title":"Articulatory characterization of english liquid- final rimes,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:48.043254Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:e7252c0b9c053deddf453cd00595e4e11b60fa126fce6e42b089dc8074096e85","observation_id":"1251a66c-05b6-4b09-ad8a-62368c93a71e","resolution":{"observed_at":"2026-08-07T12:39:48.043254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:56.160843Z","title":"The number of Conformer layers was set to 3","venue":null,"work_id":"ee9b1b5b-ffcb-481f-80c5-215423f046fa","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.111215Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:9cd3e7eaf273c60fe6686925605ad9d0f6327a16c96b7fe0a440534c4121ba6a","observation_id":"c6434ec6-3f83-45d8-b41f-4669a6b8313b","resolution":{"observed_at":"2026-08-07T12:39:56.210483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T23:07:57.090230Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2505.24059."}