{"as_of":"2026-08-22T13:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:98ac7f0805d517c3aee7013a7bf199ffe4df878ed622171539ae66651addef8a","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:03:04.755177Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08294/citation-record","integrity":"/paper/2505.08294/integrity","json":"/paper/2505.08294/citation-record.json","paper":"/paper/2505.08294"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.334127Z","title":"You look stressed: A pilot study on facial action unit activity in the con- text of psychosocial stress,","venue":null,"work_id":"137b95e7-c211-4ded-b65a-98058be2f8bd","year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.566786Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:cae056132e2af3ebd9a4eaaf2ee24c18b7be10b5c670e93a0a619e5d824639a1","observation_id":"3b9e7aae-8173-45ed-8c5a-8f9f93a00b23","resolution":{"observed_at":"2026-08-15T22:03:05.337583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.324605Z","title":"Not made for each other-audio-visual dissonance-based deepfake detection and lo- calization,","venue":null,"work_id":"890f7981-e0ff-4dac-ac11-97118c39239b","year":2020},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.570494Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:ac669dc3788575d0b5ce67e900c7bd9a2f141501ac19f0b145f459a009f9605f","observation_id":"268e5623-ffe1-468f-811e-8b9a07ec7e07","resolution":{"observed_at":"2026-08-15T22:03:05.327917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.314890Z","title":"Multimodal forgery detection using ensemble learning,","venue":null,"work_id":"9969c8d0-ee7a-46d5-9c39-5252e013a210","year":2022},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.574565Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:f63ad5389b7ac9c6121af713502c589095607197a22f155faa198abd97b025e2","observation_id":"7a5a36ab-e620-4abc-b138-245c2d754273","resolution":{"observed_at":"2026-08-15T22:03:05.318352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.304374Z","title":"Avtenet: A human-cognition-inspired audio-visual transformer-based ensemble network for video deepfake detection,","venue":null,"work_id":"509f240b-c8b0-4583-a195-13df57d9c115","year":2025},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.577821Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:c0dae5521e0151317d908c3980f427f7c9e385a813616299e85fe6294dba8756","observation_id":"b4246b5c-27b7-43cb-bc01-0e0503c7a69a","resolution":{"observed_at":"2026-08-15T22:03:05.308159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.294204Z","title":"Pvass- mdd: predictive visual-audio alignment self-supervision for multimodal deepfake detection,","venue":null,"work_id":"a0428830-f079-4ac6-92fc-9fe22a946c40","year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.581424Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:62603a1a031c9849f425fdfdefc66dd991efd844003186ed3122dba494ff8cec","observation_id":"b7735aa4-960a-40f4-9713-2314309c3adb","resolution":{"observed_at":"2026-08-15T22:03:05.297761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.284270Z","title":"Mcl: multimodal contrastive learning for deepfake detection,","venue":null,"work_id":"42f5a146-9573-4d93-9fa5-5c8b60ac7a8f","year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.585024Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:3b11b72a3b0a304ac8f98d2e6e3023c1744dbea964eb7971c70583d976737048","observation_id":"79bab764-4b68-429b-b4d6-270067893fbb","resolution":{"observed_at":"2026-08-15T22:03:05.287619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.274527Z","title":"Cross- modality and within-modality regularization for audio-visual deepfake detection,","venue":null,"work_id":"90ac1d5b-fceb-4119-abf6-25e57d7b04bd","year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.588683Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:de70d44ac3eecc40656e5965d80bab826fb27843e6a22e1afec5c1a0bf4f823c","observation_id":"43739a8c-cbd5-469f-881e-515739945be7","resolution":{"observed_at":"2026-08-15T22:03:05.278039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.264322Z","title":"Avff: Audio-visual feature fusion for video deepfake detection,","venue":null,"work_id":"14a00709-d4c2-42d3-b374-734c3260803b","year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.591709Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:7c8990a958920713b0509dc61625d0fda3ae945232282cbffa0e2a5a9c4e5a44","observation_id":"7dec6c88-c13c-4b86-8c9e-64ad1bc2b23a","resolution":{"observed_at":"2026-08-15T22:03:05.268243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.254021Z","title":"Joint audio-visual attention with con- trastive learning for more general deepfake detection,","venue":null,"work_id":"de850e86-8a00-4091-b836-bf76ae2ac141","year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.594774Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:e4fe6083190e7bd32708748040da917800bab682ca0a32f16d56a40fb8de7a4f","observation_id":"c43254a2-dd36-4e85-94e5-8aa1a4006bb3","resolution":{"observed_at":"2026-08-15T22:03:05.257649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.597670Z","title":"Fine- grained multimodal deepfake classification via heterogeneous graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.597670Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:60ce6137243014d9142add50d35d015b32b3ef0d354f32395d8d618bacd2911e","observation_id":"9a4791fa-500e-43ce-a467-c852fc23875a","resolution":{"observed_at":"2026-08-15T22:03:04.597670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.238088Z","title":"Emotions don’t lie: An audio-visual deepfake detection method using affective cues,","venue":null,"work_id":"7568a63a-5640-4623-9b6a-329ebf7accd9","year":2020},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.600990Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:921016a3006f0b61f2ce7d003ce7fa4e94aa6aa81bde8942c459d0275fdcfe2f","observation_id":"f6606ef6-7397-40ff-a6f8-bebf7bc76f1a","resolution":{"observed_at":"2026-08-15T22:03:05.241718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.604108Z","title":"Face x-ray for more general face forgery detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.604108Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:9683be29bdd286177bb3843d38d078069aade5976eb4f484d08b4a2b4e690434","observation_id":"8713949a-9060-4f64-a227-251e58baee20","resolution":{"observed_at":"2026-08-15T22:03:04.604108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.222539Z","title":"Detect and locate: Exposing face manipulation by semantic-and noise-level telltales,","venue":null,"work_id":"fdaa0a81-a21c-4914-9eed-a9dde4e2b8f9","year":2022},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.607329Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:24621787ce575d93055346302ee852e99d107d2ba54bcbb661a99c87540f004e","observation_id":"f5d19f96-b2c5-4d7d-aee4-702037ddaf89","resolution":{"observed_at":"2026-08-15T22:03:05.226173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.212753Z","title":"Lisiam: Localization invariance siamese network for deepfake detection,","venue":null,"work_id":"08fbac26-6ae3-461e-b9ee-e93f35090df0","year":2022},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.610361Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:bea0769f06879c337323e8bd27e6136baa82cc040b1f2d9fb7f76d3a084f923d","observation_id":"93f99101-22e0-467b-9cb7-eb535fd5dac1","resolution":{"observed_at":"2026-08-15T22:03:05.216364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.613398Z","title":"Masked relation learning for deepfake detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.613398Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:c49a948fd39d942131a692ebd930bcfb3ce8a7a98bb9c0c6ae4f4e0641cd1398","observation_id":"006a7a7c-bb0b-4ad9-a453-ef7e5e00f9b7","resolution":{"observed_at":"2026-08-15T22:03:04.613398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.616371Z","title":"Ucf: Uncovering common features for generalizable deepfake detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.616371Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:3b25070ba336c5fdf9bf2abb622713add04488d0a3051dbf27eb6a786c58a1af","observation_id":"ef25dcb5-a2db-4377-9d47-59023d37a7a5","resolution":{"observed_at":"2026-08-15T22:03:04.616371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.619336Z","title":"Robust ai- synthesized speech detection using feature decomposition learning and synthesizer feature augmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.619336Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:50c4c42edc5e61eae7cb48f443d24842aea7adf5abc0a8d5ce9be5ccc1f5680e","observation_id":"23ebbc89-9a6f-439d-ab8b-c5f17de953a2","resolution":{"observed_at":"2026-08-15T22:03:04.619336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.185361Z","title":"Preventing deepfake attacks on speaker authentication by dynamic lip movement analysis,","venue":null,"work_id":"2a4f832c-5b22-4aec-88a0-bfe9f2f6720a","year":2020},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.622475Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:004922cb566e963b7f8ac76d7aa02b49a3ab83f669040cf0074bfa1dee9405be","observation_id":"a1790d95-ce9a-4a7e-a886-6d25bf3def30","resolution":{"observed_at":"2026-08-15T22:03:05.188888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.175317Z","title":"Diff2lip: Audio conditioned diffusion models for lip-synchronization,","venue":null,"work_id":"322bdf85-3f51-4dd5-99dc-190ff74235ae","year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.625538Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:d578b56993e3779e9040a2026e7dd478b23d0b96a457067efed50e0edb6101e9","observation_id":"2096d94e-c1f0-43cd-aa62-9455f34fd626","resolution":{"observed_at":"2026-08-15T22:03:05.178828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-16T20:23:00.161927Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-15T22:03:04.628502Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.628502Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:7571e642a3f044e782aba88e04e7ecbb0994de3804b9b9207abecb64890793b2","observation_id":"b0f32144-cd4f-45b4-8c26-5c5f2264eb01","resolution":{"observed_at":"2026-08-15T22:03:04.628502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.165690Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency,","venue":null,"work_id":"36374920-f9d5-4bdc-8e00-ab1a2ccf3def","year":2025},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.632246Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:c849c9184866c14ea09e45ac47758bb2de889d481b5a65bcbca5bde6b6b73786","observation_id":"ef25c3b4-62aa-474a-97c8-7d65821970c4","resolution":{"observed_at":"2026-08-15T22:03:05.169260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.635157Z","title":"Joint audio-visual deepfake detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.635157Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:c4a8840f1caf51ad7568467310e4d4008d37c819f5c01eda903491fb051947bd","observation_id":"b7f32515-66ee-41e5-a126-d04c7363765d","resolution":{"observed_at":"2026-08-15T22:03:04.635157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.149561Z","title":"Lip sync matters: A novel multimodal forgery detector,","venue":null,"work_id":"fc2f7a89-bf8b-4fc0-87d7-eb36468d2485","year":2022},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.638508Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:b1062e53322921060923ce3f017d9d3d8a35c9242bae79614386f2d3e7f32367","observation_id":"af49a0d0-185a-46eb-b61c-925a798d3783","resolution":{"observed_at":"2026-08-15T22:03:05.152902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00773","last_updated":"2024-02-07T22:55:29Z","snapshot_observed_at":"2026-08-20T09:53:34.263092Z","submitted_at":"2022-12-01T18:56:31Z","title":"FakeOut: Leveraging Out-of-domain Self-supervision for Multi-modal Video Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00773","snapshot_observed_at":"2026-08-15T22:03:04.641507Z","title":"Fakeout: Leveraging out-of-domain self- supervision for multi-modal video deepfake detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.641507Z"},"links":{"cited_paper":"/paper/2212.00773","citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:31873fd60eb60046a95319e28cf9f1486b6f12cde9a48e0cee495a0aaf8a635f","observation_id":"583f5f2f-d35b-4c67-bebc-7edfd2f9edef","resolution":{"observed_at":"2026-08-15T22:03:04.641507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.139386Z","title":"Audio-visual person-of-interest deepfake detection,","venue":null,"work_id":"d9ff99e7-02c3-4b11-a5df-59658299414e","year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.644887Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:94bccc34087f1e15434f7875be2dda6c65f5ddfa43fbc82905bd2bb1b15c1a4f","observation_id":"c8d0705e-c21c-4900-8afd-7ca3b686e5e8","resolution":{"observed_at":"2026-08-15T22:03:05.143144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.128959Z","title":"Avfakenet: A unified end-to-end dense swin transformer deep learning model for audio–visual deepfakes detection,","venue":null,"work_id":"a787abc5-b3c0-40ac-91ce-7fc699644a6a","year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.648255Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:d4c9c8d1a27cf0383744cd8f54e4e32bec95a73c364807913f3cdd1f33bae000","observation_id":"92a31de1-9012-419b-8180-dd0a4a365014","resolution":{"observed_at":"2026-08-15T22:03:05.132774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.119272Z","title":"Multimodaltrace: Deepfake detec- tion using audiovisual representation learning,","venue":null,"work_id":"8f087770-83b9-4de4-8aab-0a1df1cb6a6f","year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.651491Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:b8036a8eba5f5651a7b232f213934b8daf67e3e4cd351b913746904cacb67576","observation_id":"f9654820-ab84-4a29-b355-f92d14cb88db","resolution":{"observed_at":"2026-08-15T22:03:05.122934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.109054Z","title":"Detecting deep- fake videos from phoneme-viseme mismatches,","venue":null,"work_id":"769ef7e3-4b75-49a1-a839-9db859489e10","year":2020},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.654691Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:2796b502e85fb9d34d64a75e8efd937c5b67ccd3c83fa90fb3826edf361e3430","observation_id":"9934479c-46ef-43a4-9aa6-de4253c7155a","resolution":{"observed_at":"2026-08-15T22:03:05.112545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.657839Z","title":"Leveraging real talking faces via self-supervision for robust forgery detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.657839Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:e285bb000e7d813aec912eefea891cc1e4b9929017d5c58c9516db9bb7f73155","observation_id":"b62e5c8b-4388-4c9e-bdc5-2b1392b6c7bd","resolution":{"observed_at":"2026-08-15T22:03:04.657839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.092510Z","title":"Audio-visual contrastive pre-train for face forgery detection,","venue":null,"work_id":"dc8ffedb-c431-4666-9aa8-cadbb40acd76","year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.660963Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:afa3923df228132442f187013c56b39eb8806784704edd80163e4badee32177d","observation_id":"9e016df5-0bdd-4d37-8106-4779fc056ddb","resolution":{"observed_at":"2026-08-15T22:03:05.096000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.082426Z","title":"Lips are lying: Spotting the temporal inconsistency between audio and visual in lip- syncing deepfakes,","venue":null,"work_id":"02b9fd9b-5f2f-44c4-8f1c-9b5792b18e9a","year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.663952Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:06f100e207cb5389c11dd0880eb7c0f708f8a7ea0d68662aade236e0def04ae0","observation_id":"d7ad8d2e-1e0d-49bd-b19c-015760620daa","resolution":{"observed_at":"2026-08-15T22:03:05.085985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.071745Z","title":"Where deepfakes gaze at? spatial-temporal gaze inconsistency analysis for video face forgery detection,","venue":null,"work_id":"5010ee03-ce53-467d-a57a-4f5d67c2b1b0","year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.667217Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:593e930ea3020394f7ca8016ad28305163ef6e2fe478e6b34a6a0302e9c29650","observation_id":"26bc6e87-4bc0-4742-80eb-0545daaf5403","resolution":{"observed_at":"2026-08-15T22:03:05.075304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.062004Z","title":"Protecting world leader using facial speaking pattern against deepfakes,","venue":null,"work_id":"7f46a693-ca91-464b-b782-32b6d42f5965","year":2022},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.670375Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:e39559c9de613a90f0b0d97f4b17733e78e389d89a4d3744b61f23b71473b611","observation_id":"9166e36c-1d09-452c-9e51-3f69f144f223","resolution":{"observed_at":"2026-08-15T22:03:05.065225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.051941Z","title":"Aunet: Learning relations between action units for face forgery detection,","venue":null,"work_id":"07415f77-4604-4e32-a98c-5b3df889464b","year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.673365Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:bf8ecfc67625e61345239e0e5c570066ca5b3d0df8d4e77973217611376dbe44","observation_id":"fc1b9ba9-fd77-4d42-81d7-433bb1c782eb","resolution":{"observed_at":"2026-08-15T22:03:05.055582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.042038Z","title":"Listen to your face: Inferring facial action units from audio channel,","venue":null,"work_id":"088209ca-c242-4afc-97b9-fc0b34855406","year":2017},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.677327Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:c9f21cd23541628b84a90c37ad9f337dd02433607e1928efd0f32b3a312d96d7","observation_id":"2efae5b9-1796-41bd-985c-8194e5aeff10","resolution":{"observed_at":"2026-08-15T22:03:05.045527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.031983Z","title":"Lips don’t lie: A generalisable and robust approach to face forgery detection,","venue":null,"work_id":"fcf9c6e9-402d-472c-a717-04da4dc93f59","year":2021},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.680367Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:32573b0af4751830173cfe6884984b0dd9d632704cfaf515b88369cabc24cf8e","observation_id":"4063f500-9c70-48e5-8588-5cc43d444506","resolution":{"observed_at":"2026-08-15T22:03:05.035510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.021613Z","title":"Spatiotemporal inconsistency learning for deepfake video detection,","venue":null,"work_id":"298486f8-0278-4710-8b5d-47d58356ff6f","year":2021},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.683610Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:ef60a2ba90d750b99b0dcf973351d8a38576f13fdcd68c9119bfd0e9415344db","observation_id":"b30809a2-38e1-43d2-b6b3-53ee787975fa","resolution":{"observed_at":"2026-08-15T22:03:05.025455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.686628Z","title":"Istvt: interpretable spatial-temporal video transformer for deepfake detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.686628Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:1f63b6583a8a287704bd0df4222731cf167593b918258550e4ada9c71a1a5b8d","observation_id":"81dd975e-fb7c-4ffb-b965-5addfda0dc14","resolution":{"observed_at":"2026-08-15T22:03:04.686628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:05.005419Z","title":"Mintime: multi-identity size-invariant video deepfake detection,","venue":null,"work_id":"75985787-83bb-4917-9518-e5f7e5823f49","year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.689716Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:9d696fb9524934a7b6b0ba0bea06816e0a78877b3b1cac332b00dcbebf20bbc7","observation_id":"3537acda-4b18-44c8-a7f4-9100373db9c6","resolution":{"observed_at":"2026-08-15T22:03:05.009038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.994767Z","title":"Deepfake video detection using audio-visual consistency,","venue":null,"work_id":"5865ffea-0815-4f0d-b13a-cb1cfb94f796","year":2021},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.692829Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:50f550d6f8c6276a99cacd9cc4fca2ac42efa8d7ecaba826de0584f59ba83606","observation_id":"858acb07-7f55-445d-9871-6c9a202e5dbc","resolution":{"observed_at":"2026-08-15T22:03:04.998101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.983584Z","title":"Self-supervised video forensics by audio-visual anomaly detection,","venue":null,"work_id":"a4503e25-bae6-435a-b1fe-994a7e298aca","year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.695820Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:71eed83e8096b496e40f5eb501983b1f9f747eea83ee111df03b52a2358ef7f7","observation_id":"a5f647c9-1d70-49dd-a815-e41a29ac33fa","resolution":{"observed_at":"2026-08-15T22:03:04.987941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.972524Z","title":"V oice- face homogeneity tells deepfake,","venue":null,"work_id":"ce435a77-883b-493a-a9eb-ae6b342799b6","year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.698928Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:d6bffac5c615f9e8c7154c60a08c93a3c808a15f61b28cfe4ccf5840695e20f6","observation_id":"a925fb53-1c99-4585-a66c-c05b641fa9a7","resolution":{"observed_at":"2026-08-15T22:03:04.976104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.963035Z","title":"Lost in translation: Lip-sync deepfake detection from audio-video mismatch,","venue":null,"work_id":"9012eff0-3760-4099-8325-c5ad1e90356a","year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.701748Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:c5802600b0079613745d0a122edbf5c611b8b2a91de21235fc85fafd604b5c4b","observation_id":"4f1f307b-8a21-4c6c-8b6f-3d0f0acc3fde","resolution":{"observed_at":"2026-08-15T22:03:04.966409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.953304Z","title":"Avoid-df: Audio-visual joint learning for detecting deepfake,","venue":null,"work_id":"82aa4c06-6c59-4e7f-829f-2abb5eed247e","year":2015},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.704726Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:94d1f3986e6ac4e6a3611ed7a6d1059d979887a767b2fe44c94f64d40a8a0a1d","observation_id":"4884cc5e-60f3-415f-8cff-9fda2eb16db7","resolution":{"observed_at":"2026-08-15T22:03:04.956817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.943652Z","title":"Speechforensics: Audio-visual speech representation learning for face forgery detection,","venue":null,"work_id":"30f782da-ad63-4f0e-a851-c8fe843ef82f","year":2024},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.708178Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:7a8f2690db686fc19639e85b5961e83a298f5dbbbbf8dca9a655941d787d3b13","observation_id":"cfe4e35a-8d7a-46a3-997d-6538774bb520","resolution":{"observed_at":"2026-08-15T22:03:04.946833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.934106Z","title":"Glcf: A global- local multimodal coherence analysis framework for talking face gener- ation detection,","venue":null,"work_id":"856a1819-494b-4262-8a15-174d8cd70786","year":2025},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.711014Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:cfb81a6a89761aff6f56d2add2d7ed939fca53edec29ccfcea43e3611fac731f","observation_id":"814633ce-f743-4d2d-a52d-0fa1e1206a22","resolution":{"observed_at":"2026-08-15T22:03:04.937582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.713970Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.713970Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:a204bb252568e0f45f05f25b715f19be412f333452e107701eede08303a3eef6","observation_id":"88a94b57-49f4-41e3-9a20-f1434b508660","resolution":{"observed_at":"2026-08-15T22:03:04.713970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.716933Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.716933Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:2c2f0a911b0c7c62049d9e86e1ee602e0cc2e9af3270c4dc3bb6bd81c9ce3b1f","observation_id":"bbd281f2-1b76-45e3-801a-5b3ee26c9c79","resolution":{"observed_at":"2026-08-15T22:03:04.716933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.912219Z","title":"Video classification with channel-separated convolutional networks,","venue":null,"work_id":"13c3ff6c-ac18-4fb8-b422-0cb715b779ec","year":2019},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.719994Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:2a25c52e13238f263f04c7a06c188f7c141e4cef5a1d270a60e3f8978a16befe","observation_id":"cd868510-c94b-4184-82b3-ccc01c00767f","resolution":{"observed_at":"2026-08-15T22:03:04.915810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.902094Z","title":"Learning multi- dimensional edge feature-based AU relation graph for facial action unit recognition,","venue":null,"work_id":"e422192b-aa31-4183-af00-465441b37d2f","year":2022},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.723163Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:85db530348f90cf9deb458b49caf4d8eb37b2ef56296dcfec387c8936fcd3214","observation_id":"5750d4e0-d1a8-4287-adc9-7aba5911011d","resolution":{"observed_at":"2026-08-15T22:03:04.905848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.726268Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.726268Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:725454092e79687b6d78f89738d82feec0df953073d950b69203cacce29c9d7c","observation_id":"e0cbc688-6121-4f1e-ac19-334a6c8654c1","resolution":{"observed_at":"2026-08-15T22:03:04.726268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.885723Z","title":"Disfa: A spontaneous facial action intensity database,","venue":null,"work_id":"ad8b3d08-7d7b-4ebf-b6d8-1858c77c8064","year":2013},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.729289Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:2e47759584742866d7bc81cb51369a6fe0ff04b419f2500fbde159dcaf7a5f00","observation_id":"5e59edb0-f672-4e0a-a01b-4a8758e8a598","resolution":{"observed_at":"2026-08-15T22:03:04.889797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.875360Z","title":"Do you really mean that? content driven audio-visual deepfake dataset and multimodal method for temporal forgery localization,","venue":null,"work_id":"6cfff207-cf4b-4376-ba22-60a0441d4fb9","year":2022},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.732733Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:2fa373e5641118524cffeea6cf3d303974ab6fc8d941c1ac04e961cf366cec09","observation_id":"7d3a034b-c3ff-4646-9e32-044eecbd36a8","resolution":{"observed_at":"2026-08-15T22:03:04.879062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05080","last_updated":"2022-03-01T10:38:07Z","snapshot_observed_at":"2026-08-21T10:32:07.720653Z","submitted_at":"2021-08-11T07:49:36Z","title":"FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05080","snapshot_observed_at":"2026-08-15T22:03:04.735976Z","title":"Fakeavceleb: A novel audio-video multimodal deepfake dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.735976Z"},"links":{"cited_paper":"/paper/2108.05080","citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:87c341cd22d66922cebac7bae146c6cca52d49ae1feeb423d226c616e352a51e","observation_id":"8035a6a3-4318-4012-955e-648292e3cd87","resolution":{"observed_at":"2026-08-15T22:03:04.735976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.865085Z","title":"End-to-end spectro-temporal graph attention networks for speaker ver- ification anti-spoofing and speech deepfake detection,","venue":null,"work_id":"3fd206fb-b577-41ac-a7d0-435112a6ba26","year":2021},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.739503Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:0d8c563163ccf2c2767047f76db936d9ea6477c70d8e24ebbb98c7c296fc85f1","observation_id":"8b3d3957-2071-4dbb-86c7-27f3914f3989","resolution":{"observed_at":"2026-08-15T22:03:04.868558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.854459Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation,","venue":null,"work_id":"416a8eb3-166f-4b1e-ad88-072e3bd7778f","year":2022},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.742565Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:e7fa0800b33ec4bfbd86d7f35f241b11e0abc41349b23d628d7e598a1a3696a8","observation_id":"5189f6af-6f07-43e7-9967-1186937ae62d","resolution":{"observed_at":"2026-08-15T22:03:04.858124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.843221Z","title":"Hearing and seeing abnormal- ity: Self-supervised audio-visual mutual learning for deepfake detection,","venue":null,"work_id":"a90a0902-1e84-4796-9f1c-155506b65f11","year":2023},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.745669Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:b67354f15663bae69423ec0e3056de69d99d03b609c3d90b23eda109edd7941a","observation_id":"4860fe32-1109-4f1c-8fac-78e61fb4041e","resolution":{"observed_at":"2026-08-15T22:03:04.846979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.08217","last_updated":"2021-01-18T14:36:15Z","snapshot_observed_at":"2026-08-16T14:43:47.181737Z","submitted_at":"2020-06-15T08:35:15Z","title":"AdamP: Slowing Down the Slowdown for Momentum Optimizers on Scale-invariant Weights","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.08217","snapshot_observed_at":"2026-08-15T22:03:04.748868Z","title":"Adamp: Slowing down the slowdown for momentum optimizers on scale-invariant weights,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.748868Z"},"links":{"cited_paper":"/paper/2006.08217","citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:720d4af2223da84bd8d003a79a24151e03c266f9a45c0b17f06748df8528a840","observation_id":"c8542e66-7e22-4a6b-bc69-bd1f296964f9","resolution":{"observed_at":"2026-08-15T22:03:04.748868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.831423Z","title":"Deeperforensics- 1.0: A large-scale dataset for real-world face forgery detection,","venue":null,"work_id":"7bfaa161-91ac-48e3-977e-95308704e37e","year":2020},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.752061Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:99f3fac594a6446d1ca940b800ce41bfa21b0ec6b32cd3c8b4ba12f19b940d32","observation_id":"9d0824ab-2f3a-45e8-8c3b-a8da9c4ce73a","resolution":{"observed_at":"2026-08-15T22:03:04.835778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:03:04.819145Z","title":"Visualizing data using t-sne","venue":null,"work_id":"e6d75444-cb08-41a2-8365-f4abdad5b916","year":2008},"citing_paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:04.755177Z"},"links":{"citing_paper":"/paper/2505.08294"},"observation_digest":"sha256:bea3a40c9685a3a338fff1d1b6902ef1a7b3a811dbf6a28715270d68bd40e4dd","observation_id":"536378a0-0ad4-4f86-b740-5c328fcaa503","resolution":{"observed_at":"2026-08-15T22:03:04.823539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.08294","last_updated":"2025-06-14T04:13:20Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T10:31:13.339603Z","submitted_at":"2025-05-13T07:18:07Z","title":"FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2505.08294."}