{"as_of":"2026-08-09T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1964170b0ea6089978d58de34e64a5f51670567decea434864845b7c6d8b326","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T01:06:45.040464Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09001/citation-record","integrity":"/paper/2607.09001/integrity","json":"/paper/2607.09001/citation-record.json","paper":"/paper/2607.09001"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"MIR-GAN: Refining Frame- Level Modality-Invariant Representations with Adversarial Network for Audio-Visual Speech Recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:937253d32af4049a485f604035adc24a4e740e1b6d6dd3101c9abfde6c6661cd","observation_id":"f167546c-c4c0-4744-8f5b-c3335d7a8a7f","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Learning Video Temporal Dynamics With Cross-Modal Attention For Robust Audio-Visual Speech Recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:16b128bcbbb61dde7ba9fe450c21e8884ba6bd2608edf504ae7ede738daafb3f","observation_id":"ee31fcdd-2cb7-416a-a5d6-16690ac91733","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"End-to-end audio-visual speech recognition with conformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:fbf7fddcefc018997629274e038e9193cda94a70f8b711395151e81ebba19aeb","observation_id":"9ea3be42-e637-48cb-a791-32a2aa241084","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:b7fc9dcdda09a296bb410f62d1bb708029389efc5c3639a872c3e642e221c9a9","observation_id":"fe724f70-47e9-427d-92b7-4e43ce0213ee","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Large language models are strong audiovisual speech recognition learners,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:0dfe8b328c0d24deb56d2ef3ff93d9ffff60712efcd26fbb3c94ea0945c01c98","observation_id":"0ae49249-600a-4e0d-8ea2-3e0b35093492","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech Processing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:565bce101de97ea183debb3afe64638b7b233030573b33e8e7f527e46708f48c","observation_id":"23212bc8-22d4-45e4-80f3-af8260d6fefb","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Hy- brid ctc/attention architecture for end-to-end speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:f29315ccdc914b076e3fae2aff5daf4b6771aa4d5b0d76316f203f6931bcd027","observation_id":"291ffc70-7eab-4919-b2c7-de4b54986607","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:8778d891ce105ac71db9c60249a19fd128b128340568c54ffacb90e8f9eb4811","observation_id":"673897b2-02c6-412b-b42f-f4c665320f70","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:a16814a7287df505bcc6bfba7aeae9ee81d5d0455757780c9ba5dce2e85a3778","observation_id":"f81a4102-2ed0-4100-9ae5-2354867d036e","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Omni- avsr: Towards unified multimodal speech recognition with large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:a7aeafcb355044ec30b6934578dd2465115d6b5e9dc1de29648cab04a2ef073f","observation_id":"0226e612-bd6c-4df4-903e-ef63eaf8ea25","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"V ALLR: Visual ASR Language Model for Lip Reading,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:493e9f77b79837392dd5b512ba955696753559bb8e4488ed8e479bb9eff11141","observation_id":"c8ab230c-6502-4938-bf79-13b7ddaffdc0","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06273","last_updated":"2025-07-21T06:53:55Z","snapshot_observed_at":"2026-08-07T17:20:01.268652Z","submitted_at":"2025-03-08T16:40:13Z","title":"Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06273","snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Zero-A VSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language- Agnostic Speech Representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"cited_paper":"/paper/2503.06273","citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:e5df2309574c89202c9ee64f1f5bb1e987ab9dec933f8e7b1de7888a14b40e6e","observation_id":"668c63e2-7d92-4074-b494-02f17cbfc5f8","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Uncovering the Visual Contribution in Audio-Visual Speech Recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:6d8f173d3b08bb444f9695c14c02c148d05690a3276b7021d44c3c3325b4c287","observation_id":"49c009b2-7cc0-4e81-b4a5-35bae2155dce","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Align before Fuse: Vision and Language Representation Learning with Mo- mentum Distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:0aa5aca99f5e127bd22cab728f4192e5e5aa2b7835eeb5850f8bacd3f130d594","observation_id":"759b8958-2b69-44fa-9a63-7f3147880e0d","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Optimal Transport for Domain Adaptation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:26cdb2f69afb9f8b10939ccf2ce83dfe57a1934d7f37b16af322ab8ae3aeeaec","observation_id":"8dd1ee1b-61a5-4cb7-b8ee-3eaa177c761b","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"From Word Embeddings To Document Distances,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:5d0d88c0bf70beb77a52d05519b0c1ab7925fbf2b21a2a2ed2028ecdfa0eb983","observation_id":"18bfb088-1db6-4d63-9a6c-01e7a1e78bc3","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Word rotator’s distance,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:2a5d530204d8e299770b8be44c4c0de82b396fe91a467fc0e25cb8fa98fe2d85","observation_id":"17b7f7c9-49ab-4608-aaa4-163cc74b5f90","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Cross-modal Alignment with Optimal Transport for CTC-based ASR,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:00e97c44ae2ce2c07f73d76dae1d8e8c2cdcb5ed95fb804bf81462a3aa00e2d7","observation_id":"87b16424-c484-4fa8-af63-9c1fce9f8658","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Hierarchical Cross-Modality Knowledge Transfer with Sinkhorn Attention for CTC-based ASR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:42598b5d68ec0377c885db72e41ebcf071e60a0fe34f3551a5b93be564460b29","observation_id":"8dd54962-a21f-4501-9935-ec3d23e66a78","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-09T18:53:22.800809Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09291","snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"LA VCap: LLM-based Audio-Visual Captioning using Optimal Transport,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"cited_paper":"/paper/2501.09291","citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:6a58e2e048481ac09c6ff3b4fb468ead1d0fe85ca211fcaab2f5dfa07110fc3d","observation_id":"840821bc-8bd9-41ef-9568-2393b100d7b9","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Computational Optimal Transport: With Applications to Data Science,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:dfe267029ae5098c1abb20f94210d3eb43da4d3e60ef2d289130038a9663e934","observation_id":"02ea7ab5-8b32-4ecd-87cd-e36a2972ea81","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:6a193bf9a1f26775046bd9d9196fe3d401437e3827d55807932b36ae85018f0d","observation_id":"fb8549c9-6419-4b36-83d1-811e9f558410","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:49f743d76237fb9a08e07be9e158b52597adcf840ab469ce36a3d8bf89a9c31e","observation_id":"7ae23e11-dee8-4f97-8007-8e035b9a828d","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:4afe116e360c6efc15bcc9bd5cab7d581b84abae36ce90eaa6ea8bb1b4e3e38f","observation_id":"c18c4004-6f20-4d08-8545-99bfc3bcb489","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:53dc247f44ada06bdc6d2645ef1e9015fe0c9bf9fecf3c3bd62f1c04e2824943","observation_id":"a4ba792a-fcd2-43b9-a129-43962eb8f5ea","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:deec00ce3d227aa550abe406a530a0528ada21efaa6e30c75cd5e257adb0cac3","observation_id":"721de74e-a0fd-40ab-b581-4d492f6e6f44","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:58dc34f6bdbff3cac72837dd1d269d4b424951b9a67c754b0e3bc266174e1f46","observation_id":"a4d297d3-40a8-43b8-89f8-9a7267209ea1","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"LoRA: Low-Rank Adaptation of Large Language Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:f92e362d29807e06c72e3f2804c22fd30d1b941bf9a87f173a0cf7eb60efc834","observation_id":"6e3d52b0-2307-442b-9c7e-7e91157c637f","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Sinkhorn Distances: Lightspeed Computation of Optimal Transport,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:2b911f638e08bedaffc7dabfda9a909aa30a1a85a31c36c13ee301f49b0d2fb3","observation_id":"f6235595-e86e-49db-85aa-5954e299820c","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Learning to Align Sequential Actions in the Wild,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:8bcd382dc16117cbe913191971c503c8edda90d4eeaf8d973202adffc647409d","observation_id":"629c3cf9-fa5f-42be-98c5-2796cc3f325c","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"SuperGlue: Learning Feature Matching With Graph Neural Networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:3414858a16499da2469886e983658d6bd31f4020f99ffea89b1789b2d8baf731","observation_id":"225752e4-744c-478d-91d2-12f97720001a","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Unsupervised Learning of Visual Features by Contrasting Cluster Assignments,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:14db3ce76daf2547a0b5631d5153355e06efa0be04af2fe819ff25a1f5c6d681","observation_id":"b5253427-f5e2-4868-9c27-cfbf49652fb2","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Cross-Modal Global Interaction and Local Alignment for Audio-Visual Speech Recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:03c1aafc1e2d7ad031f02636bab17fd7d6eb0a5abdb8b82b9d8ac64c28a8416f","observation_id":"74db1391-9cae-403b-a9a2-634eee850db8","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:915774384fdadfaaa62c377b170cb8a9a06d5587eab0174762521062e5790b4a","observation_id":"4cfd9cb0-553a-4bef-8919-9b2a8056e3bd","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"Lrs3-ted: a large-scale dataset for visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:501906fd71e1159da16c198c54d4bfa1dfcb065cdd8f6427f3a15a3d9dc122c9","observation_id":"b556f8d9-397e-47ee-8ffc-7169f4dd0125","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09001","last_updated":"2026-07-10T00:07:25Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T00:10:11.041744Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2607.09001."}