{"as_of":"2026-08-09T13:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a08ff3e63ffb69c3e21397a1c1753655281c9bde6edd1f91cc7b6ddfc237faee","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T18:55:21.867598Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04472/citation-record","integrity":"/paper/2607.04472/integrity","json":"/paper/2607.04472/citation-record.json","paper":"/paper/2607.04472"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2025.Drifting A way from Truth: GenAI-Driven News Diversity Challenges LVLM- Based Misinformation Detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:0a1c9c70757381db638674e5047517c8af4083e77b1833d8e5737c313baa278d","observation_id":"33d20f8d-bbea-4610-80a3-5d3d38e313a6","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2025.Zooming In on Fakes: A Novel Dataset for Localized AI- Generated Image Detection with Forgery Amplification Approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:6606609922f6ca583c030d42c7ffa42773a83accdd9402e28fa04b73d0916891","observation_id":"c3e63054-ec9b-422c-912f-4caf3af4b213","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.335681","doi":"10.1109/tpami.2024.3356814","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"6ee3cc77-60b8-4622-aae4-2f17a937f44f","year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:4e8360432f82c61b46485b0ee3f53eba27dcd87d7fa4d421ceb2e92006603779","observation_id":"bb644b91-cb7c-41b8-b9e1-be37bca4f3f0","resolution":{"observed_at":"2026-07-11T18:58:11.230423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:25.448858+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:25.448858+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2015.Going deeper with convolutions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:d8fe8bcacd881f7e3334d45962c81e241b5e792f0f0385317d76ff1e50fbf13a","observation_id":"87ab28e0-b3e6-4d3d-99db-88a588ca0534","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2018.Cascade R-CNN: Delving into High Quality Object Detection","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:e633bfb1162a54bf308938f8950db8790a84e2be487cb94c0281c8fa1e3f7695","observation_id":"3adb4922-09c0-479b-987d-2ce47a1f995b","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2022.Do You Really Mean That? Content Driven Audio-Visual Deepfake Dataset and Multimodal Method for Temporal Forgery Localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:ed737d614530d75813079fb4d5cd825070151286c86da6bc5a2ba6733a3154e3","observation_id":"f70e452c-64b6-4813-9ab2-fc3f2be61ab3","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2016.Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:3bb5d43a737659c2df4d908e8e63c5fe476e1f8f4ef885a80c7785687c5a0200","observation_id":"e9c224e1-a57e-4d82-ad7c-75e6859257c0","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"Rojas, Ali Thabet, Bernard Ghanem","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:7a4e475a1c52c0c8bedd5d75d47373fbc54ba86e636f859b1714dd6f9fa1252e","observation_id":"c46fd08f-133a-4261-9db6-5a34feb485fc","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00656","last_updated":"2019-05-22T15:06:39Z","snapshot_observed_at":"2026-07-06T07:12:10.424336Z","submitted_at":"2018-11-01T22:13:55Z","title":"Exposing DeepFake Videos By Detecting Face Warping Artifacts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00656","snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2019.Exposing DeepFake Videos By Detecting Face Warping Artifacts","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"cited_paper":"/paper/1811.00656","citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:6be6fa3618b0320f95d571e5e24719822415daab76acd3628fb898184e5c6e2b","observation_id":"d68ba9a9-4716-4ce8-9efe-1c29659c2906","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05856","last_updated":"2019-09-05T17:59:09Z","snapshot_observed_at":"2026-07-06T08:00:11.162659Z","submitted_at":"2019-06-13T17:59:02Z","title":"Detecting Photoshopped Faces by Scripting Photoshop","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05856","snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"cited_paper":"/paper/1906.05856","citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:185926d0d696e2efb3c2ded24a136ecfe5aafcb1b26156c8b61ab3e162917146","observation_id":"be15f5d4-b99e-47c9-86aa-fa498afe596b","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.298866","doi":"10.1109/access.2020.2988660","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2020.DeepFake Detection via Facial Landmark Analysis","venue":"IEEE Access","work_id":"92fe3ea2-c940-4a1f-86ca-0ab44a843114","year":2020},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:1d193af820915ce94825c0c4304d7a7db064042f535f1b839df2f6554768269a","observation_id":"12cf2aef-8320-4950-983a-254336ecfe52","resolution":{"observed_at":"2026-07-11T18:58:11.332483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:26.702434+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:26.702434+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2020.FakeCatcher: Detection of Syn- thetic Portrait Videos using Biological Signals","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:aa314033fe67a920af2f384abecf6ff12300c855fcccfbe3200e12188cc0f62d","observation_id":"6930d8a9-9a23-4c8f-aa20-1ddab8330d75","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2019.FaceForensics++: Learning to Detect Manipulated Facial Images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:c2c16f1b5578319fed753c8c17c44c40a9c70c7dd211327df9bda4f2ab7b800e","observation_id":"dddb188e-5706-4a78-b528-084fc20b811d","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/wifs","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:58:11.338242Z","title":"2018.MesoNet: a Compact Facial Video Forgery Detection Network","venue":null,"work_id":"d6bc979f-2e86-4157-ab85-4c42bf9de3a4","year":2018},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:c35477277c79d178e238747f7e61a9bb99a16d68db241e217d958631b654dc22","observation_id":"b0c6b79d-de08-4416-baee-46078164b3be","resolution":{"observed_at":"2026-07-11T18:58:11.340052Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.311700","doi":"10.1109/tkde.2021.3117003","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023.Dis- criminative Feature Mining Based on Frequency Information and Metric Learning for Face Forgery Detection","venue":"IEEE Transactions on Knowledge and Data Engineering","work_id":"6d71c83a-9e18-4221-81c9-3c936b7c053c","year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:40ecdceeb36af39f97b0cacfd6cd0ae2c2eec5cff7102386cb39d0d0586ec929","observation_id":"6d57ef51-6bcc-4c49-a051-13981d8aa660","resolution":{"observed_at":"2026-07-11T18:58:11.216298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:27.445473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:27.445473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-19830-4_27","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2022.Adaptive Face Forgery Detection in Cross Domain","venue":"Lecture notes in computer science","work_id":"41903ee9-6a70-40fe-9a94-7ac318da0f35","year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:2d75e6e3cef5efde5788cc40ca957b64cc8e7a77023a44a5c201da2ee8ef1889","observation_id":"b519d600-af5f-4508-a642-853e578bd6ca","resolution":{"observed_at":"2026-07-11T18:58:11.330101Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:27.764092+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:27.764092+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.Learning Self-Consistency for Deepfake Detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:cdfaf0452d040b18759cad200b5508422af4af5cfcd5581c0bc7a6165e082829","observation_id":"88f8aafe-f030-4286-9b2e-30edb6810dd5","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.319361","doi":"10.1109/tpami.2022.3193611","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023.Deep Learning-Based Action Detection in Untrimmed Videos: A Survey","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"8a002635-1a4f-4486-ba04-86c358acbe46","year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:73561d406e4cc70938cbaf01e9a2fa016acba4ff2d15e740eb5c711ec2c232e9","observation_id":"3bcae84b-aa1a-44ba-99bd-1c0009ce260d","resolution":{"observed_at":"2026-07-11T18:58:11.282948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:28.061003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:28.061003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2023.PivoTAL: Prior-Driven Supervision for Weakly- Supervised Temporal Action Localization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:512754cb13ab522e128aa0e82f730d4b7e68aeabe3082ac9d9f857265f133b59","observation_id":"788e5cd4-4d47-4a4b-8f99-8d9bbc2cb28f","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.Blind and Low Vision Individuals’ Detec- tion of Audio Deepfakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:24e9714f00eb83ba52901021aa8e3a1ac1c8ad2975f833c14a2da05aabf6ff1b","observation_id":"6e231910-19e1-4ec5-bb16-7f17d12630d4","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:3d74e0cb9e39f31075cb1879922cb88aba6e62a8cb0e19319df07dcf6a80d9f0","observation_id":"021dbd0e-3cd1-48c3-aba5-5d65fb18fd58","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:c4cfc17d6cab118bfc48d1ac0a9fc0937e2e5ae6782bd690f1266cbe6f57d6c7","observation_id":"39ae174d-d740-40ec-924a-d91c2e544339","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.End-to- End Temporal Action Detection with 1B Parameters Across 1000 Frames","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:068abd4716b2ad378207aac38b2e782cfd81ce89e4cdf57f0d7b0d5118ec5dac","observation_id":"0d3165fc-7253-4019-9478-8af76b40d921","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.BYOL for Audio: Self-Supervised Learning for General-Purpose Audio Representation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:2ee8645168e1fa35286fb798090a3976e46ec387f3bd0bc9d1ceed9e470f7ca1","observation_id":"35667870-73d3-48a3-b0f0-1da29570bdf0","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:e0e2a8f6358c9f502d980edd17db4c2da22d11bcfa78585f8a2ed9a01023177b","observation_id":"9dd1b3d6-814c-4489-b11e-7c4b468d898a","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.Cross- Attentional Audio-Visual Fusion for Weakly-Supervised Action Localization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:f3977e35faa5b7d82ddae7cb247946fbfafcb9f708d58a00e92c5f6862cd1d8d","observation_id":"88c41a1e-67dc-4cba-bcf8-936df28417e6","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.MLCA-A VSR: Multi-Layer Cross Attention Fusion Based Audio-Visual Speech Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:cf75d90c78bfbf217f945035d6e2859873e5f84e898d978339aba243e8ed145a","observation_id":"ebfa1847-6807-4a3a-9bae-08b53016159a","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4171.341370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:58:11.258875Z","title":null,"venue":null,"work_id":"8b8a4fba-1d3e-44de-b044-6268427a25b6","year":2020},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:dfb37f71f655addfd28888c66d1390c4840bb93b510e67682f52978f2b846272","observation_id":"15bf82fb-ac2c-4377-acf5-ef1a6ac7d2dc","resolution":{"observed_at":"2026-07-11T18:58:11.261026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08540","last_updated":"2021-01-28T12:14:19Z","snapshot_observed_at":"2026-07-06T10:34:19.340163Z","submitted_at":"2021-01-21T10:42:48Z","title":"Activity Graph Transformer for Temporal Action Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08540","snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.Activity Graph Transformer for Temporal Action Localization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"cited_paper":"/paper/2101.08540","citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:1a88199a9adda1269e525c85304c2972f7d4d2faebe0fabc2df434702dc73a14","observation_id":"a93729f1-c023-4fb0-af58-a81d251471e6","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2019.BMN: Boundary- Matching Network for Temporal Action Proposal Generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:41850bda12238b7fb1614063350a54500be59bc9d345feffb059f0ea19069b83","observation_id":"a4690baf-f505-454d-9227-1485eb4a8dbb","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14118","last_updated":"2021-10-17T17:41:25Z","snapshot_observed_at":"2026-08-09T10:58:35.886126Z","submitted_at":"2021-06-27T00:49:02Z","title":"Hear Me Out: Fusional Approaches for Audio Augmented Temporal Action Localization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.14118","snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2022.Hear Me Out: Fusional Approaches for Audio Augmented Temporal Action Localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"cited_paper":"/paper/2106.14118","citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:2f13d40163669634fba8f4fafb37bca861780f7bef1adebeca7ae8f31bd2e6ce","observation_id":"e41b3593-35a3-4b72-a444-6de7b14357d7","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.SOFT: Softmax-free Transformer with Linear Complexity.https://proceedings.neurips.cc/paper_files/paper/2021/file/ b1d10e7bafa4421218a51b1e1f1b0ba2-Paper.pdf","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:e81776378dac8704fbaf5baa798ea32648b65fe5fa5e7ff92956f32966d3a41f","observation_id":"7ab3e9d9-8097-49a8-8939-c78f6e2d82fd","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-19772-7_29","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2022.ActionFormer: Localizing Moments of Actions with Transformers","venue":"Lecture notes in computer science","work_id":"1ffcb687-82ac-4b34-b0b0-238e3172e0d1","year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:d13255ccf086a16bc08cb446f26e6f68a10341ed3d2f33f9ace383ad8709cb2b","observation_id":"82796cb5-d708-49da-9a60-7d4d7b1fb03f","resolution":{"observed_at":"2026-07-11T18:58:11.235015Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:29.85834+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:29.85834+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2023.Ummaformer: A Universal Multimodal-Adaptive Transformer Framework for Temporal Forgery Localization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:54150cc6d8cad8e70f7c9a4c04f0b89f11419ae3d57530cc33f2ab34b0833d71","observation_id":"9473a0fc-d8a2-45aa-a4e9-49fc6af0a029","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10193","last_updated":"2025-04-11T06:56:20Z","snapshot_observed_at":"2026-08-09T10:59:48.740594Z","submitted_at":"2024-11-15T13:47:33Z","title":"DiMoDif: Discourse Modality-information Differentiation for Audio-visual Deepfake Detection and Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10193","snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.DiModiF: Discourse Modality- Information Differentiation for Audio-Visual Deepfake Detection and Localization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"cited_paper":"/paper/2411.10193","citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:555761f5add5a603a69bd730f3749c83bb7ebac74c178f9d9ab339fa08baa992","observation_id":"37442a88-3105-480f-9aa7-a64e3f0ae0ed","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2018.Mesonet: a compact facial video forgery detection network","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:86492c238e65445ce13ac0c891763e514e7bebdad74041b087fc509a0ff43e67","observation_id":"2e2f0860-e15e-4a3e-a80d-c0b22a3616fd","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.103818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:58:11.240818Z","title":"2023.Glitch in the matrix: A large scale benchmark for content driven audio-visual forgery detection and localization","venue":null,"work_id":"33335269-d4cf-43ca-a958-20e5329bc88e","year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:b4e4937da6b331d071be83dca809e4b4f7d3f89316882e28f26e7dc830fa4acd","observation_id":"ed8c428b-127a-4ea4-bc89-1141ab7f9c61","resolution":{"observed_at":"2026-07-11T18:58:11.243035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2023.Tridet: Temporal Action Detection with Relative Boundary Modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:5a68597a79304250a5df29217659a864736d17d059365f0d9f8bdae529f606d2","observation_id":"6e393692-de00-4337-af65-61fa7b6bfaff","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"Zhang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:19cd9221663e8b2bbafb7e9aab77ecbf53d9c5c1ce60c7f6c02c4223900dd606","observation_id":"ebbebc9d-117b-4eb9-a4c6-c760c820041b","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2017.Attention Is All You Need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:4b96f6d24f0cfdb15816f5a129ddc3aa6e080152ba0dbcf891ff26d4ba3d8edc","observation_id":"fff92487-6a1c-45d4-a746-5c07a06c878e","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.MetaFormer Baselines for Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:94a6a220c63888595b476eb4bf04e404e41fd956cee318553799e259621d407a","observation_id":"76151fdd-2049-495f-98a8-c3618ab35f7d","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2020.Distance-IoU Loss: Faster and Better Learning for Bounding Box Regression","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:7845107a48e8810fa4570731ab073924d393bcda1dfcc0bd5e687e3cb380697a","observation_id":"3f5ba93c-7d89-4714-97c0-9c13fc1f9bbf","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2017.Focal Loss for Dense Object Detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:af500af6717ef5e8a664efad13481f7431db02bf0195ec04b03dfaa8d44fd6a4","observation_id":"5c75c3d5-4813-4835-835c-87eaff1c070a","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2025.Face Forgery Video Detection via Temporal Forgery Cue Unraveling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:d8bc2fa17fe846cea6ec78e1b6bf4341f66426a08362b0431e019af585c866b2","observation_id":"8189c48c-bac5-432c-9517-41d9982a4231","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.A VFF: Audio-Visual Feature Fusion for Video Deepfake Detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:810357c0d334f7ea9d6b0a73ddfeb950d73b8ee4734d7f1b3fbedd87741579bf","observation_id":"6075bbb9-e5f9-460c-b486-5a13bf6c055f","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.Delocate: Detection and Localization for Deepfake Videos with Randomly-Located Tampered Traces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:76ad7b2dcdd0daeadaeb208c0ddf20a2a0fae61413862aefcb249cdaa897c14c","observation_id":"9664f815-11c6-4108-9e80-1fb5160e6ec3","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.359596","doi":"10.1109/tdsc.2025.3595960","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.Trusted Video Inpainting Localization via Deep Attentive Noise Learning","venue":"IEEE Transactions on Dependable and Secure Computing","work_id":"a82ee138-cf15-45dd-b03b-c1c598c09d02","year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:0ddab76ab28653f29b22cededfea311279c6bccc43a362b7b69283286b5c32de","observation_id":"9b92cbf2-f075-4e26-8eb2-d496aa908954","resolution":{"observed_at":"2026-07-11T18:58:11.254250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:32.117484+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:32.117484+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2025.Bridge the Gap: From Weak to Full Supervision for Temporal Action Localization with PseudoFormer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:e7c79c60810d8e8fe63a665e996ef1b841a09416ba0cb0f6db95d5e61ba2643c","observation_id":"ec8d9b4d-aea8-44e9-8c94-9bd53255974f","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:a008f9679570a506652f1767a91cf13944e5e9b2694af1cbf44b0db3d4c4c01a","observation_id":"d9cef25f-7d7f-4a6c-b001-ba53856cd170","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.SafeEar: Content Privacy-Preserving Audio Deepfake Detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:cfb271548ec6fde185ddf905d203ee5ecf063e7846a143fc51d46b54ea8f1c35","observation_id":"a3afda54-d727-4e6f-a610-81d334a4b627","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2022.Localizing Fake Segments in Speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:c97e7e4ae9ecb6786f8568e7845b744ca5bb740bfc766433de29d6a362a0bf4a","observation_id":"b2adb45a-2029-4eec-9dfa-dc971d4f2625","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-20062-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:58:11.222512Z","title":"2022.Proposal-Free Temporal Action Detection via Global Segmentation Mask Learning","venue":null,"work_id":"cbdfcaac-a4c2-412b-9d9d-02fc8f71df6e","year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:8122b06881ee9cfa4cd58500d1c31e2fe5ec70a262f7c05f2ca9a10c317ad0da","observation_id":"80e034b7-fa8b-4b7c-8c1f-d8781d5a88bb","resolution":{"observed_at":"2026-07-11T18:58:11.224232Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2022.DCAN: Improving Temporal Action Detection via Dual Context Aggregation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:287b326c1fe262ce35ee1b314ce43c74f15bb411cce9eb3f011bafd5e435364e","observation_id":"bef61c61-5bde-41ab-b8ab-445df0dde0c6","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4647.368079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:58:11.233335Z","title":"2024.A V-Deepfake1M: A Large-Scale LLM-Driven Audio-Visual Deepfake Dataset","venue":null,"work_id":"cb23eeb9-a24d-430f-82d1-6cf8d89237a4","year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:d72964a9c10133c7b7528ba98eddacfda5d8c27867706311b9c4ca4474c383e3","observation_id":"d0979a33-24b1-430b-a11f-7b8ed3c479ce","resolution":{"observed_at":"2026-07-11T18:58:11.236002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T22:27:28.932513Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":9,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":10,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2607.04472."}