{"as_of":"2026-08-21T15:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca5330a4c53d61015724c661fc20dd70f1004d488f4e835e6dced680210e575e","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T10:13:16.605795Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.11618/citation-record","integrity":"/paper/1908.11618/integrity","json":"/paper/1908.11618/citation-record.json","paper":"/paper/1908.11618"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.334354Z","title":"Improved speaker independent lipreading using speaker adaptive training and deep neural networks","venue":null,"work_id":"753f5557-fe6c-4dfb-b4df-ac4045a55755","year":2016},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.330178Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:1e91d64d265a3dea8c80648dc4e4dcc971346ea0a7cdc4200ada75695668434b","observation_id":"e1fb123a-b994-4db9-a1cf-6d279826eff5","resolution":{"observed_at":"2026-08-14T10:13:17.342047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01599","last_updated":"2016-12-16T16:09:34Z","snapshot_observed_at":"2026-08-19T05:41:15.283549Z","submitted_at":"2016-11-05T04:05:18Z","title":"LipNet: End-to-End Sentence-level Lipreading","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01599","snapshot_observed_at":"2026-08-14T10:13:16.335704Z","title":"Lip- net: End-to-end sentence-level lipreading","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.335704Z"},"links":{"cited_paper":"/paper/1611.01599","citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:970c4f54243904e730ef234c0575bc622ac395fcbfd4bf3a55f0eb183d4aafcc","observation_id":"d10a5ed7-5bf3-4b64-be67-3f884ee3769a","resolution":{"observed_at":"2026-08-14T10:13:16.335704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.308619Z","title":"The natural statistics of audiovisual speech","venue":null,"work_id":"84a7c60a-3d5f-4096-b5aa-5bdee9ab0541","year":2009},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.344748Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:be18bcdd9e3ffff03535b7913fdfe36ebbb126309f243c032bb704e01234db4d","observation_id":"2c8c86ec-206a-47fb-bc35-314d54824ab0","resolution":{"observed_at":"2026-08-14T10:13:17.322733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.289886Z","title":"Lipreading from color video","venue":null,"work_id":"4e00732d-4898-4a65-803f-302913164566","year":1997},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.350281Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:462e8ca6fea35204c4f2a3b5fd78e3d0f1dfb867a1c94a271f4f62211b596552","observation_id":"de53de35-197b-4c63-8a7d-5751cf81757a","resolution":{"observed_at":"2026-08-14T10:13:17.296347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.269201Z","title":"Lip reading in the wild","venue":null,"work_id":"0dac890e-7c08-49d1-8498-ac4972056812","year":2016},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.356484Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:248bda2a7ffd3c579eea90470a216dc79d946b0df219d0cb9788f61fad3be969","observation_id":"eb7f2d26-0ca4-4fd3-8b24-4795f649d1c4","resolution":{"observed_at":"2026-08-14T10:13:17.274433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.252365Z","title":"Learning to lip read words by watching videos","venue":null,"work_id":"7e040bd1-7661-479a-9836-9e1aa79dafd1","year":2018},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.364587Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:9b880b259d2ec1a8c1027a53373dca373a00ab29372f6f59c396fb68af9bbd90","observation_id":"9000b87c-7555-479f-968c-6449428a50ca","resolution":{"observed_at":"2026-08-14T10:13:17.257495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.229901Z","title":"Lip reading sentences in the wild","venue":null,"work_id":"77ad836a-5ba8-4d69-994b-15a633acb165","year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.379468Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:ae6673a75ac67547a8475e403be9ba17dd993155333d907be71f3be602c3f579","observation_id":"0c9c0936-ef40-4e83-bb45-22f82e3bfaa0","resolution":{"observed_at":"2026-08-14T10:13:17.235879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.205878Z","title":"Toward movement-invariant automatic lip-reading and speech recognition","venue":null,"work_id":"3dca4934-c9fe-4f08-8a5e-3cc94cfd2a0e","year":1995},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.389161Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:da3f2ffbc5f5892185dbcccd098c60a8a3d18af94b4a34a9a65bdbdf81230511","observation_id":"2ddffe38-9e90-4bc1-a26d-c7ac4cb618c1","resolution":{"observed_at":"2026-08-14T10:13:17.214393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.189930Z","title":"Long short-term memory","venue":null,"work_id":"37fc2aea-180e-4c9d-b2b0-204fd4cd351e","year":1997},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.400542Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:c23b305ddf9bdd0947bf26c6fa8d7c806d07c435fe9d907d0e3e9eb1319a4af4","observation_id":"8b9c4c94-bd7f-4e58-b953-fa399ad559db","resolution":{"observed_at":"2026-08-14T10:13:17.195559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.166663Z","title":"Videolstm convolves, attends and ﬂows for action recognition","venue":null,"work_id":"2b8898e4-6b0e-4f1b-8149-4243bb2fbafd","year":2018},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.410492Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:1af5dd86394330c04b6597e88e45bd997b40cfc3685064854d30c1c281d75716","observation_id":"9b155bce-615d-4481-b1ab-5d229fe6e8d1","resolution":{"observed_at":"2026-08-14T10:13:17.175556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.141179Z","title":"Audio-visual speech recognition using deep learning","venue":null,"work_id":"b0297bbf-cd7b-4e1c-a6f1-1fda82773202","year":2015},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.428574Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:19741d4cf3d154124e9eaf4ba1b8c7379054270f812314941df3fd9b11c02060","observation_id":"d19605dc-49ba-43c6-b0b8-7fbccaffdc84","resolution":{"observed_at":"2026-08-14T10:13:17.152173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.117963Z","title":"End-to-end audiovisual speech recognition","venue":null,"work_id":"ed46fcf8-5a18-4aa5-9df7-7f117660f23d","year":2018},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.442214Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:0ce104de2e8e7149812a79ee3f0bf1b5536d49cca1fbc399025e23d5707c9560","observation_id":"430d9fb0-6be7-45d2-b500-6afb1d0bcfdf","resolution":{"observed_at":"2026-08-14T10:13:17.126325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.092675Z","title":"An image transform ap- proach for hmm based automatic lipreading","venue":null,"work_id":"e6272bbd-98d6-48bf-bed2-9b879c3da66f","year":1998},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.454167Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:f53fc93ceda98b4db8996157d67f2aa86f08415290396907decab201e784f910","observation_id":"3cca9545-f18b-461f-950d-d45d147dd8f0","resolution":{"observed_at":"2026-08-14T10:13:17.100644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.068932Z","title":"Recent advances in the automatic recognition of audiovisual speech","venue":null,"work_id":"4f087eea-7097-49d2-9c25-0f00e8f0b89d","year":2003},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.470890Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:0259aa1b6b4e7cfcdc2511262eebe2bd53f323cce235b6a1c7419c9f959330dc","observation_id":"55ce54b8-4f7a-4136-9cd7-ace573e3b85f","resolution":{"observed_at":"2026-08-14T10:13:17.076930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.037125Z","title":"Lip reading using optical ﬂow and support vector machines","venue":null,"work_id":"0aef4bad-3be0-4c56-b68e-d3582e836f40","year":2010},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.479365Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:9285bfc61a5793e2e0d1a5fff5416bc55ffd7351d805be98d6a431ae4c2ea7ec","observation_id":"f1760879-f233-41ba-aa87-02b2c93af2cb","resolution":{"observed_at":"2026-08-14T10:13:17.044818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.007564Z","title":"Convolutional lstm network: A machine learning approach for pre- cipitation nowcasting","venue":null,"work_id":"bda2a182-d887-4a05-9dbf-1dbbc525d980","year":2015},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.490705Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:7288b52c35a762d86cd3c92d239f641dee74c7aa338c57034c2078c41c01fde2","observation_id":"f94d5605-5501-4d93-882f-a11482410d74","resolution":{"observed_at":"2026-08-14T10:13:17.016990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.505615Z","title":"Two-stream convolutional networks for ac- tion recognition in videos","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.505615Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:19160e8048ae8fdb25a0af977061ac59eddf2e8a9944c5bbd55f6a9585799bd6","observation_id":"49763019-c3b6-4b02-892b-9d8d8c2749d1","resolution":{"observed_at":"2026-08-14T10:13:16.505615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.04105","last_updated":"2017-09-08T10:08:34Z","snapshot_observed_at":"2026-08-18T10:22:24.078790Z","submitted_at":"2017-03-12T12:06:04Z","title":"Combining Residual Networks with LSTMs for Lipreading","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.04105","snapshot_observed_at":"2026-08-14T10:13:16.519177Z","title":"Combining residual networks with lstms for lipreading","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.519177Z"},"links":{"cited_paper":"/paper/1703.04105","citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:5c0bc717068e0c22929bd486e0bb175d403d66c45660172de77ff4f16978c273","observation_id":"693dd69f-c76b-4e51-832c-a69fa585f26f","resolution":{"observed_at":"2026-08-14T10:13:16.519177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.953291Z","title":"Convolutional long short-term memory networks for recognizing ﬁrst person interactions","venue":null,"work_id":"9e7a9469-e3f6-4026-98c1-7f224ade3199","year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.526459Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:0483bd96cb25e122944ac097d818f172f98486970334cd02b696598aa12b09f3","observation_id":"bd126973-8fec-48e2-b45e-918140376801","resolution":{"observed_at":"2026-08-14T10:13:16.961031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.924289Z","title":"Improving lip-reading performance for robust audiovisual speech recognition using dnns","venue":null,"work_id":"7680aa63-ea54-4b8e-9f9c-8a3828293931","year":2015},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.536979Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:e2efeadcdbb79cdea85d2b0008b8e6e456c63e0c58e20b370a766ab1775318d5","observation_id":"994ea864-7e38-4e17-9fcb-6afa9de28a89","resolution":{"observed_at":"2026-08-14T10:13:16.937044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.898771Z","title":"Hu- man action recognition by learning spatio-temporal features with deep neural networks","venue":null,"work_id":"c56869d0-bfa0-490b-ab29-5acb06595ddf","year":2018},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.542441Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:f0be30d1b7f12d40f3aed49a44eaa0df1ede0fd6666e020492dd01a773ae9d9b","observation_id":"604defd1-f3de-4f81-a1c6-cf891aee9a19","resolution":{"observed_at":"2026-08-14T10:13:16.905106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.870414Z","title":"Pre- drnn: Recurrent neural networks for predictive learning using spatiotemporal lstms","venue":null,"work_id":"cc98e80e-ea20-4c98-a997-735786ddb1d2","year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.552535Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:2c33a751479afd11e64ba71615424608dcca21da8a48088e5cc2b71974ad31e6","observation_id":"20992fce-8a4c-495f-bc42-f9a5cf4453e1","resolution":{"observed_at":"2026-08-14T10:13:16.876930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.851530Z","title":"Lrw-1000: A naturally-distributed large-scale benchmark for lip reading in the wild","venue":null,"work_id":"80bccbff-cd72-47a3-a8ee-a0194e64d402","year":2019},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.564273Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:5df1086caec02ddb1c3a1b188c41ef7c40f1d27764e2ce254c1dc00ce43bd0aa","observation_id":"44855688-7a4f-4c2b-9651-06b751e2e4f1","resolution":{"observed_at":"2026-08-14T10:13:16.856778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.832720Z","title":"Learning spatiotemporal features using 3dcnn and convolutional lstm for gesture recognition","venue":null,"work_id":"baa4030f-5b27-4b31-b455-09e745b406e0","year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.576389Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:24038a6cd6cbd4ebf46974139444322a677b3f31a92f8c73ebf2d97e211b3305","observation_id":"a62bb90f-2ddb-45aa-a245-6e0022ff9150","resolution":{"observed_at":"2026-08-14T10:13:16.839284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.805352Z","title":"Adding attentiveness to the neurons in recurrent neural networks","venue":null,"work_id":"0111c0fd-4c0e-4a3f-8155-b8b0cd114425","year":2018},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.584649Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:cc19122100f3bdce72951ee42881e4a602ebf7fb9c6297602ff681bcc0c68107","observation_id":"c3836fe0-acb8-4f34-9fd1-e27c4d14bfdd","resolution":{"observed_at":"2026-08-14T10:13:16.812779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.774031Z","title":"Lipreading with local spatiotem- poral descriptors","venue":null,"work_id":"17208440-12b1-4030-9dc1-73544f2e0f5d","year":2009},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.593574Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:c5c9a2e2916ab3a8bf5d0f2f0d964e07371359033be395f7ba69338002b2f413","observation_id":"7f9febc2-6774-4a98-8fde-8869dee38b18","resolution":{"observed_at":"2026-08-14T10:13:16.781772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.742155Z","title":"Multimodal gesture recog- nition using 3-d convolution and convolutional lstm.IEEE Access, 5:4517–4524, 2017","venue":null,"work_id":"b80bb266-0c26-4515-943d-a1f96cc37e87","year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.605795Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:1ee1dc9ff2b03e09e83deae07c9675858434a7d39c0c5a6183f717adb593d7f1","observation_id":"3b50c32d-886b-4b2b-bd68-df5501fe7d0f","resolution":{"observed_at":"2026-08-14T10:13:16.753235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-21T03:32:44.031725Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:1908.11618."}