{"as_of":"2026-08-16T00:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea3a0525410c4dff78368e7d289bb2d864325261c685227094c336438672587c","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:53:51.803073Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:53:48.450553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T22:53:52.505268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"cited_work":{"arxiv_id":"2506.20361","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.20361","snapshot_observed_at":"2026-08-06T22:53:52.505268Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","venue":"eess.AS","work_id":"e04ced98-4047-4248-ae87-691a2ff8ea83","year":2025},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:48.450553Z"},"links":{"cited_paper":"/paper/2506.20361","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:4d2540a48695fcf72fc7cb5bbe5d00979cb335ff4d7b70b5d01f40ae67177e95","observation_id":"29e31935-0a1a-4314-8027-bc8c1e01f636","resolution":{"observed_at":"2026-08-06T22:53:52.613791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20361/citation-record","integrity":"/paper/2506.20361/integrity","json":"/paper/2506.20361/citation-record.json","paper":"/paper/2506.20361"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:56.354039Z","title":null,"venue":null,"work_id":"04a1ab9c-9bdc-4128-b149-e994f291eaf3","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:48.237549Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:c9b93eab2748aa930c3e0230fefa4f14573360f4a51c4b144173af73ef5a79c3","observation_id":"cae30958-580b-4a12-898d-bb35d334a24c","resolution":{"observed_at":"2026-08-06T22:53:56.440542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:56.195118Z","title":null,"venue":null,"work_id":"c9961182-7624-433e-8a34-0bab5273159e","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:48.651613Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:e0eb737301545eaea2f65a81d5e66c124d620bdedd7516288e4cd8b32fac2a61","observation_id":"24f8d8b4-f788-404d-b227-2091412a59d3","resolution":{"observed_at":"2026-08-06T22:53:56.252196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.995974Z","title":"Dataset We analyzed the phonetic decodability window on two datasets separately","venue":null,"work_id":"3c427723-5f1b-4329-a6d1-453a90a2fe31","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:48.823441Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:feea4fa55b55081d0b3f4152c033fa9d0c1ff9102da2a3241b09b0900f2823ed","observation_id":"c0134223-de03-4e42-b025-6ce6f5285cbb","resolution":{"observed_at":"2026-08-06T22:53:56.095836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.830597Z","title":null,"venue":null,"work_id":"28db9d78-6b58-43e8-9112-606ac7712e3d","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.013333Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:6e225378db2c4d4aead8e99b49c68420e914299e4b52164ae3f3a1301155bdcb","observation_id":"61bea0c4-4e63-4d3f-b9ac-cf73c541fca9","resolution":{"observed_at":"2026-08-06T22:53:55.892928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.682661Z","title":"We found that A V-HuBERT’s encoding of speech temporal dynam- ics is dominated by its audio input","venue":null,"work_id":"78bad618-9805-4949-8da7-7426c962970a","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.188316Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:e7e45791bb48697ea112e000b498f8c5af31bfae2243b54ccf51a919f2e71de7","observation_id":"7eae74aa-131c-4dc9-8a0f-c363e80322ef","resolution":{"observed_at":"2026-08-06T22:53:55.743362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"cited_work":{"arxiv_id":"2506.20361","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.20361","snapshot_observed_at":"2026-08-06T22:53:52.505268Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","venue":"eess.AS","work_id":"e04ced98-4047-4248-ae87-691a2ff8ea83","year":2025},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:48.450553Z"},"links":{"cited_paper":"/paper/2506.20361","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:4d2540a48695fcf72fc7cb5bbe5d00979cb335ff4d7b70b5d01f40ae67177e95","observation_id":"29e31935-0a1a-4314-8027-bc8c1e01f636","resolution":{"observed_at":"2026-08-06T22:53:52.613791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.499586Z","title":"We would like to thank Biao Zeng from University of South Wales and Hao Tang, Sharon Goldwater from ILCC, Univer- sity of Edinburgh for useful discussion","venue":null,"work_id":"348f7440-b51d-486d-90bb-588ca9a1a5ac","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.377704Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:b761e5383ccfe50b171cb3ca4f256279b5c89733d2506044a65b91c694418a5b","observation_id":"dc7c5188-171b-4f40-886a-d53c5020da7c","resolution":{"observed_at":"2026-08-06T22:53:55.556123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.330325Z","title":"Using artificial neural networks to ask ‘why’ questions of minds and brains,","venue":null,"work_id":"193cb1a9-285b-4587-bcec-fcde556b8c37","year":2023},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.498398Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:05cfc9e21bb8e78442470dfcd453fee1abf157204d84b64c5b4fa98886d1f003","observation_id":"64abd8f1-82eb-4fbe-abb1-9639bad530a5","resolution":{"observed_at":"2026-08-06T22:53:55.394127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.150878Z","title":"Parallel hierarchical encoding of linguistic representations in the human auditory cortex and recur- rent automatic speech recognition systems,","venue":null,"work_id":"24108fd9-dcd0-4abd-b051-b805e6ce40d9","year":2025},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.674523Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:74d17978dc0d17812dcca9b90a8d39711a2ba094a95d116deee754174f34b60a","observation_id":"b48a8210-51ec-4cc5-9f5f-21253ce644b2","resolution":{"observed_at":"2026-08-06T22:53:55.241297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:49.888090Z","title":"Hearing lips and seeing voices,","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.888090Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:76c124a82a4156f0437f946852830b613dbbeb8bf299aa066676e8780ae02346","observation_id":"8ec8c1a4-95b3-4bb8-a244-04ffd366196b","resolution":{"observed_at":"2026-08-06T22:53:49.888090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:54.942015Z","title":"Multisensory integration: current issues from the perspective of the single neuron,","venue":null,"work_id":"ee0050bf-08aa-4cc8-904c-262d46dd6d9b","year":2008},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.029945Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:4af15f3fd83fa8cf9329db8c8e05e7039e73e455bff9601d22b278df26c9cb40","observation_id":"8cc38be9-dce2-4cfe-aa45-8ac763842dd8","resolution":{"observed_at":"2026-08-06T22:53:55.026324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:54.762398Z","title":"Multimodal deep learning","venue":null,"work_id":"e1d16821-af4d-42a1-97a5-98822951643e","year":2011},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.185624Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:ac98c2a1633d7ad4fefd841a1e9f8f32e7a1cb300351365c64ebcaf87e10a668","observation_id":"0059e289-68da-490d-b5e5-6050a2e55bba","resolution":{"observed_at":"2026-08-06T22:53:54.856937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.05715","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:52.272668Z","title":"On the role of noise in audiovisual integration: Evidence from artificial neural networks that exhibit the McGurk effect,","venue":null,"work_id":"302375f1-1abf-4208-880b-da435a8f4b92","year":2024},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.297411Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:c0d34ff7772fe46e9880d38be30c703e5797161500be55929048606e55652399","observation_id":"b6c4587a-83bb-48dc-a28a-7e80954ebd17","resolution":{"observed_at":"2026-08-06T22:53:52.389153Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-13T17:03:44.084494Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-06T22:53:50.391701Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.391701Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:4f1a1daef75cb4f4268a495622cd7f43bc371a06512e105ea4ac6fc81cc79c23","observation_id":"fd50aea4-84af-4bc9-8022-d12eb1547d04","resolution":{"observed_at":"2026-08-06T22:53:50.391701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:54.533184Z","title":"The natural statistics of audiovisual speech,","venue":null,"work_id":"5d966b08-7fca-4ad2-a62e-60205863cdd3","year":2009},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.483547Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:4c66880a0a9acbb11aa7bea0db6896e74df898413cf8b9d4c97f21b991736cbe","observation_id":"28fdc799-899e-4acf-b4c6-6a96d44263e6","resolution":{"observed_at":"2026-08-06T22:53:54.662843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:54.282872Z","title":"Bimodal speech: early suppressive visual effects in human auditory cor- tex,","venue":null,"work_id":"a761a636-5de8-41b9-9bca-ea907d7b8c08","year":2004},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.593870Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:ee22d3f568563a0c46b96879860d2e2ced0b33745e2b95e78438c829d0c0773f","observation_id":"71710634-2011-40e9-a40e-26b6ceaf68bf","resolution":{"observed_at":"2026-08-06T22:53:54.377216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:54.098964Z","title":"Visual speech speeds up the neural processing of auditory speech,","venue":null,"work_id":"6dc7c2d4-a804-4e77-9043-c2c569db28cc","year":2005},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.668168Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:e3df43b24a6dd90c18650ffb488578635f7278a77e61817a3e92a6ebfdaf42fb","observation_id":"7fd2bde6-cde9-4a31-bc63-52dfa385c0da","resolution":{"observed_at":"2026-08-06T22:53:54.175482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:53.833977Z","title":"Asynchronicity between visual and auditory information in audiovisual speech: Evidence from four types of consonant- words/b/,/t/,/k/and/g,","venue":null,"work_id":"8b778702-9051-4a76-8f63-c0df079d9519","year":2024},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.739263Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:f52586418c9997213c85488f1488c61a6c1a875376292188284181a39e775c05","observation_id":"d470de32-c3e2-4f2a-9d10-d283a1e640c9","resolution":{"observed_at":"2026-08-06T22:53:53.994140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08237","last_updated":"2024-05-13T23:36:19Z","snapshot_observed_at":"2026-08-13T00:08:25.564001Z","submitted_at":"2024-05-13T23:36:19Z","title":"A predictive learning model can simulate temporal dynamics and context effects found in neural representations of continuous speech","version":1},"cited_work":{"arxiv_id":"2405.08237","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.08237","snapshot_observed_at":"2026-08-06T22:53:51.979127Z","title":"A predictive learning model can simulate temporal dynamics and context effects found in neural representations of continuous speech","venue":"cs.CL","work_id":"b3a994aa-8473-4821-8d67-fd018cb751d4","year":2024},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.840056Z"},"links":{"cited_paper":"/paper/2405.08237","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:20d318e6fad8b359ba4b9864e135bbeb5ebc826f5dd8aa028bb939d308e6b69d","observation_id":"e307496b-1ff3-4266-ad1e-6a2c3f165244","resolution":{"observed_at":"2026-08-06T22:53:52.083800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:53.599151Z","title":"Neural dynamics of phoneme sequences reveal position-invariant code for content and order,","venue":null,"work_id":"07db2f25-8e78-4eb9-bc06-78004344c186","year":2022},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.949106Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:54f7a65a0cca068e2d6e710d5d4b69b73e3025a449b3c83ce450666c68da8d6f","observation_id":"38ebd5c8-3751-4a3f-8bd7-7411414dde71","resolution":{"observed_at":"2026-08-06T22:53:53.724658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:51.030814Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.030814Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:fecaa57ef3c4b1ebfa35843e232d6ae04070bf88fd764e0823e2159a6a879c62","observation_id":"123861fc-64e1-40ad-9645-3e6dc382826e","resolution":{"observed_at":"2026-08-06T22:53:51.030814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:51.105709Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.105709Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:5abb16a3900c429ef5f698ea741ada0225f6b6cb6b56cae84fe8b351f823851d","observation_id":"d15b4bb8-4347-45bc-9b1a-8b7614b2d6f7","resolution":{"observed_at":"2026-08-06T22:53:51.105709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:53.324273Z","title":"Dynamic encoding of acoustic features in neural responses to continuous speech,","venue":null,"work_id":"54e43892-40fa-43d1-8988-61d82ab4c86e","year":2017},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.187054Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:ea38b7e8e9f64c0e36bad3be41efce26a8412d23ee5abf857be7d93f8d0db0f7","observation_id":"22583bb2-f733-4bba-b601-d0c22e9abf22","resolution":{"observed_at":"2026-08-06T22:53:53.448903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T22:53:51.262919Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.262919Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:7031c24694812e8309f313bfd767a4ada00fa715218ecb2fbc99f4a501c0185e","observation_id":"e5c540e0-211b-4e72-91e0-98f4ac694089","resolution":{"observed_at":"2026-08-06T22:53:51.262919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:53.108301Z","title":"Montreal forced aligner: Trainable text-speech align- ment using Kaldi","venue":null,"work_id":"d46a3334-b592-444f-9ea2-232805d4e19c","year":2017},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.369421Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:2ddb0a3bd6f6512373b2276c66a45c1c3dc6cc01e12efb99389f1ab119c23fcf","observation_id":"f4d1bdad-7f83-49d2-89a1-2787d06aa1af","resolution":{"observed_at":"2026-08-06T22:53:53.205875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:52.912100Z","title":"Prosodylab-aligner: A tool for forced alignment of laboratory speech,","venue":null,"work_id":"5b28a33a-57fb-4f54-b54d-309c8f5064ed","year":2011},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.485127Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:83d833dd4ff1976be6328a79262e72351a0d25ddcf88e9fc08abe927152c43e1","observation_id":"1fb8ac9e-8336-43ee-b842-f7e5a04fb035","resolution":{"observed_at":"2026-08-06T22:53:52.994338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:52.716573Z","title":"An audio- visual corpus for speech perception and automatic speech recog- nition,","venue":null,"work_id":"91af5793-8aa9-4a41-a823-bf7e1c94db3a","year":2006},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.637293Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:bbdbdd3412dd880cb2120f5ba129fa8bf087b1277ae15e97723975eedbcb74d2","observation_id":"216414d2-5e51-46c8-94e4-9dcd976e5bcb","resolution":{"observed_at":"2026-08-06T22:53:52.804935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-08-14T18:33:50.882150Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-06T22:53:51.803073Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.803073Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:43a5e37a83e4f29aed4bf2de2b3ba64743419148d4fc3a53849cf68b9a8135b1","observation_id":"a70d74ae-21d5-4051-92ac-96d592074ef8","resolution":{"observed_at":"2026-08-06T22:53:51.803073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T17:41:10.545130Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":3,"verified_fuzzy":16},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2506.20361."}