{"as_of":"2026-08-09T16:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be4631eb57c8cf429972d263c358c333af3444ca117ff3f09f43e82e79d18c54","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:26:54.187906Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T15:16:18.164748Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10082","last_updated":"2024-11-19T21:19:43Z","snapshot_observed_at":"2026-08-06T10:43:10.885641Z","submitted_at":"2024-06-14T14:36:54Z","title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10082","snapshot_observed_at":"2026-08-06T19:26:54.187906Z","title":"Whisper-ﬂamingo: Integrating visual features into whisper for audio-visual speech recogni- tion and translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05609","last_updated":"2025-07-08T02:37:20Z","snapshot_observed_at":"2026-08-09T15:13:20.154557Z","submitted_at":"2025-07-08T02:37:20Z","title":"MMW: Side Talk Rejection Multi-Microphone Whisper on Smart Glasses","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:54.187906Z"},"links":{"cited_paper":"/paper/2406.10082","citing_paper":"/paper/2507.05609"},"observation_digest":"sha256:04d8fcaa3af69380110bde6615b5a6de235c145777359546c6c53607703d171e","observation_id":"282af02d-6efd-4ae8-acd3-9cbcfad85f63","resolution":{"observed_at":"2026-08-06T19:26:54.187906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10082","last_updated":"2024-11-19T21:19:43Z","snapshot_observed_at":"2026-08-06T10:43:10.885641Z","submitted_at":"2024-06-14T14:36:54Z","title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10082","snapshot_observed_at":"2026-08-05T22:04:12.049729Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07608","last_updated":"2025-08-11T04:23:08Z","snapshot_observed_at":"2026-08-09T03:37:21.312258Z","submitted_at":"2025-08-11T04:23:08Z","title":"AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:04:12.049729Z"},"links":{"cited_paper":"/paper/2406.10082","citing_paper":"/paper/2508.07608"},"observation_digest":"sha256:7ff29aa71f673f0ee768a58a5875ad8e8d25e077a49b11e9cbe6218e74d75e3e","observation_id":"a334828b-cd9f-4cb2-a8e6-a0c0914eb90d","resolution":{"observed_at":"2026-08-05T22:04:12.049729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10082","last_updated":"2024-11-19T21:19:43Z","snapshot_observed_at":"2026-08-06T10:43:10.885641Z","submitted_at":"2024-06-14T14:36:54Z","title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation","version":3},"cited_work":{"arxiv_id":"2406.10082","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.10082","snapshot_observed_at":"2026-07-09T15:16:18.164748Z","title":"Whisper-flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation","venue":"eess.AS","work_id":"ec617c61-bff7-4e12-9684-b5312ec20fd0","year":2024},"citing_paper":{"arxiv_id":"2603.21664","last_updated":"2026-04-29T08:13:36Z","snapshot_observed_at":"2026-07-06T22:50:05.914888Z","submitted_at":"2026-03-23T07:42:40Z","title":"HumanOmni-Speaker: Identifying Who said What and When","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T00:57:12.239390Z"},"links":{"cited_paper":"/paper/2406.10082","citing_paper":"/paper/2603.21664"},"observation_digest":"sha256:738667db32fba1d35a735a9dd2eb8649cb6231879427b4b6c278688f043c9e52","observation_id":"ac1134e4-820d-41c1-8371-fd135c4d2cd0","resolution":{"observed_at":"2026-05-15T00:58:25.527913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10082","last_updated":"2024-11-19T21:19:43Z","snapshot_observed_at":"2026-08-06T10:43:10.885641Z","submitted_at":"2024-06-14T14:36:54Z","title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation","version":3},"cited_work":{"arxiv_id":"2406.10082","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.10082","snapshot_observed_at":"2026-07-09T15:16:18.164748Z","title":"Whisper-flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation","venue":"eess.AS","work_id":"ec617c61-bff7-4e12-9684-b5312ec20fd0","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2406.10082","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:ed583e7099daa2df839f01cf6f9a13348e2df51ae7e92a8ea7f283747ddd6bff","observation_id":"f39153ad-0790-4acc-a295-d007ff5aaa2a","resolution":{"observed_at":"2026-07-09T15:16:18.166295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10082","last_updated":"2024-11-19T21:19:43Z","snapshot_observed_at":"2026-08-06T10:43:10.885641Z","submitted_at":"2024-06-14T14:36:54Z","title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10082","snapshot_observed_at":"2026-08-01T07:12:17.598277Z","title":"arXiv preprint arXiv:2406.10082 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-08T08:48:36.880078Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.598277Z"},"links":{"cited_paper":"/paper/2406.10082","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:83bb12f7793f5c08ee6e4f06c6dbfc8b32579f35ce7ba8e0bb0f1ab09c014509","observation_id":"7331b4a1-1972-4a67-badd-7c70241832a2","resolution":{"observed_at":"2026-08-01T07:12:17.598277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10082/citation-record","integrity":"/paper/2406.10082/integrity","json":"/paper/2406.10082/citation-record.json","paper":"/paper/2406.10082"},"outbound":[],"paper":{"arxiv_id":"2406.10082","last_updated":"2024-11-19T21:19:43Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T10:43:10.885641Z","submitted_at":"2024-06-14T14:36:54Z","title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2406.10082."}