{"as_of":"2026-08-10T05:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf8ef92fcd74c2c372dfb533251c33830da391bc3516696d395fb73d06841993","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:22:11.094770Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22781/citation-record","integrity":"/paper/2507.22781/integrity","json":"/paper/2507.22781/citation-record.json","paper":"/paper/2507.22781"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T11:22:05.411665Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.411665Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:8d92acb249e01f98332541af01df5076e441ff3cd982ca374c7aee429a3a4139","observation_id":"effd9037-0481-4087-af1f-a8d58e086193","resolution":{"observed_at":"2026-08-06T11:22:05.411665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T11:22:05.477912Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.477912Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:ccadcb630a6956c9a5d81c183fb0a7daeb12c22c4d6dce82ffa1b99ce7ef6b30","observation_id":"0747430c-e929-4d4b-bce4-1dd373c9ef16","resolution":{"observed_at":"2026-08-06T11:22:05.477912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:05.573195Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.573195Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:f7a6dfbf6d9d406890de54dea786d55edff39a787e999079e6677818a06d5f0f","observation_id":"ad31c558-72e1-46b5-bcc5-adb8ac9b5e32","resolution":{"observed_at":"2026-08-06T11:22:05.573195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.473510Z","title":null,"venue":null,"work_id":"0a22e277-d833-4833-8f89-fbeab25bbb81","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.641843Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:1195a7b1ed25dcdb65bd1711d041efb7cf5b9e756b72370ffcad0a3c7dd69067","observation_id":"f2d51abc-683e-4a18-ba05-5ca05c79365d","resolution":{"observed_at":"2026-08-06T11:22:13.477087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.463844Z","title":null,"venue":null,"work_id":"6ed16dd3-71da-48c2-b0c0-98bb4161e5eb","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.745938Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:7383ec5d66b5baacd39ede623901ea1c66b7e9caf68b46df25809c60ab75911e","observation_id":"ab54ee9f-25ef-417d-8411-9d7fae8c0eb0","resolution":{"observed_at":"2026-08-06T11:22:13.467168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20579","last_updated":"2025-07-28T07:27:42Z","snapshot_observed_at":"2026-08-07T04:58:34.763057Z","submitted_at":"2025-07-28T07:27:42Z","title":"AV-Deepfake1M++: A Large-Scale Audio-Visual Deepfake Benchmark with Real-World Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20579","snapshot_observed_at":"2026-08-06T11:22:05.863936Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.863936Z"},"links":{"cited_paper":"/paper/2507.20579","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:24bb41c736920fdd75092480424bf345ca15307dd77224c1dd63e77bb8993720","observation_id":"c85ce3f1-f6e2-463a-8fcd-c8df423c9f91","resolution":{"observed_at":"2026-08-06T11:22:05.863936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.452977Z","title":null,"venue":null,"work_id":"253168a4-e904-4ba5-b93f-37bbc4038dec","year":2022},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.896128Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:d202e63630989e6ebf72758a7e392a55c8a647e59e6863eda6d915b49d73e37a","observation_id":"6e5fbcac-e2cb-42b6-9d64-27246ed549d7","resolution":{"observed_at":"2026-08-06T11:22:13.456470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.440632Z","title":null,"venue":null,"work_id":"b7392c90-8adb-4a29-ae6b-06c97b2de4cc","year":2017},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.947834Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:223c1875d003c4b3eff96c16ec6f0a9c805eeb4e9df572705e5f9f0ccb2ef5a9","observation_id":"a5491269-5b38-4986-91db-026a580beefb","resolution":{"observed_at":"2026-08-06T11:22:13.445155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.430015Z","title":null,"venue":null,"work_id":"93204c1d-4598-48c7-96ea-904a5361da2a","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.036307Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:09109a27a2d7787cea99a64236ead763f302e9ba71295af064d2f82d6881b49a","observation_id":"be9b7e5e-a7f2-4308-a71a-347824d9cc69","resolution":{"observed_at":"2026-08-06T11:22:13.433466Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-06T11:22:06.232168Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.232168Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:c815ffa2bc08cc97c4cd970456de529db1005beb78c55e926e71cb0f4bef8537","observation_id":"e1a4e95e-0f2c-42cc-bc94-d6fcf5b3ce6d","resolution":{"observed_at":"2026-08-06T11:22:06.232168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.410164Z","title":null,"venue":null,"work_id":"72da19b6-bcd4-4243-9958-3fb066bf8651","year":2020},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.325533Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:2309051992e15392d044bc483717d3c8ec44356169c3b947c219bf54491572f6","observation_id":"b3ee7575-72e5-4b64-9a61-379af7054532","resolution":{"observed_at":"2026-08-06T11:22:13.413407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.399227Z","title":null,"venue":null,"work_id":"1d0878ec-34a9-4f75-99f8-ccddd33540d9","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.418755Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:3bfbc91479418074f76381c3436e6f80f694f5f9735786a8f680b7d4eef40411","observation_id":"951a740e-9443-47d1-b60e-ca3cce531441","resolution":{"observed_at":"2026-08-06T11:22:13.402949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.387670Z","title":null,"venue":null,"work_id":"47840f99-6662-4d2d-a151-4372bada9b3d","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.477914Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:ada7dc99ccc529254f5ab727eadc6eae6d21d1e8666183e0e16acb0b9ce20c4c","observation_id":"83199327-1f1c-43ce-b2e5-83f959260212","resolution":{"observed_at":"2026-08-06T11:22:13.391508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.367172Z","title":null,"venue":null,"work_id":"a21e7b82-c4e0-4ce6-baeb-fb637bc00b52","year":2019},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.662146Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:6653bf5a5013914eac0178368c411b8156ae7ea22f24776a718e36ce26a51d4b","observation_id":"bc871ed8-fa1d-4bea-8be2-fe007dfce378","resolution":{"observed_at":"2026-08-06T11:22:13.370167Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.355930Z","title":null,"venue":null,"work_id":"10ad374f-f8c8-4f2f-a1b4-872dd080f718","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.770868Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:52632647f5a84192cf546ae8ffaa00c321b65b8e32eaef47c7fdeafe3bceb831","observation_id":"1ab97031-acef-4f9e-ad8d-c56aaaabeb64","resolution":{"observed_at":"2026-08-06T11:22:13.358812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.343975Z","title":null,"venue":null,"work_id":"ade258d0-2e16-4840-8c12-36040082ccd5","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.990439Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:57d826e952b25d9c0e577d8e9f983d0ace6346f6da923fdf550eb525f39439a4","observation_id":"2b7a913f-8324-4b44-9b1e-1b9e3f5b7820","resolution":{"observed_at":"2026-08-06T11:22:13.347515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.331964Z","title":null,"venue":null,"work_id":"d4474fdf-1eba-4038-9384-35f9bec161d1","year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.137170Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:64480f88f277bab1ac1541f7498284fc3e267c01319293d00c45f40e3857ca56","observation_id":"cd284ad0-8c6d-44a8-8089-e4fe71e5290b","resolution":{"observed_at":"2026-08-06T11:22:13.335767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:07.192945Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.192945Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:bfe24caf8007220034bc79173e2fa74ec20459d9cdd62abadaed06269ecb86bc","observation_id":"9611d3b2-7769-4130-9ec5-359f6276a384","resolution":{"observed_at":"2026-08-06T11:22:07.192945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:07.239818Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.239818Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:e51ebe3eb4b2f0b9af12fe327dc491c3fa739bafd951469cac9c89b0c0111d18","observation_id":"ef17a6f6-5b3b-4eed-a1fd-b7145d65b926","resolution":{"observed_at":"2026-08-06T11:22:07.239818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05080","last_updated":"2022-03-01T10:38:07Z","snapshot_observed_at":"2026-08-06T06:30:26.873321Z","submitted_at":"2021-08-11T07:49:36Z","title":"FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05080","snapshot_observed_at":"2026-08-06T11:22:07.367992Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.367992Z"},"links":{"cited_paper":"/paper/2108.05080","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:ae820f6d3c7b2898dd6ac3c47633a23ec7436d40a0fa6d6edf6dabf516ddfb36","observation_id":"4200f296-1d42-43ed-b819-ecd860d9a56a","resolution":{"observed_at":"2026-08-06T11:22:07.367992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:07.450675Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.450675Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:c77ad4fe706025bb5b33bd18513d33f9694cca57a25649dedd9d89e820499c1b","observation_id":"70d7e93e-960b-4341-aa21-9ae7c69c9739","resolution":{"observed_at":"2026-08-06T11:22:07.450675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T11:22:07.629431Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.629431Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:a873768daa63f5e243e97c8a12fb531b72879f5bb85507117a3f761bbd8e7cac","observation_id":"9e81d721-8450-46f8-8ee6-f1a21ce056e0","resolution":{"observed_at":"2026-08-06T11:22:07.629431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.301036Z","title":null,"venue":null,"work_id":"361eec48-ba49-4f8e-978f-e277eac05640","year":2020},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.745701Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:f9e95a22c799f84db7463e99d99328abce494a842020b9a8d0d835b59fee97f0","observation_id":"9c729d69-5cf2-4e11-a5d6-6a17c1349d08","resolution":{"observed_at":"2026-08-06T11:22:13.305056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.290403Z","title":null,"venue":null,"work_id":"7325379e-cbc6-4f89-b22c-639b8d7ed2a7","year":2022},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.841615Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:6559026e3f014bf1e5a2f100c968119459caa756131fe5013a1b26460c32e083","observation_id":"83e6d246-856a-459c-a113-a803222f8168","resolution":{"observed_at":"2026-08-06T11:22:13.293319Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:07.958818Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.958818Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:f0bc8674d4afa06c6d74e0de2d4ec853d36b9ba628fa35fae03ea4949db8fe0a","observation_id":"967b6b02-e4b3-42d3-82d9-8529ca70ce21","resolution":{"observed_at":"2026-08-06T11:22:07.958818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T11:22:08.150028Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.150028Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:e027199faaedb7ad983ab67291f6d318eb27a94d1f0a0e9ab40bed37f0c60217","observation_id":"7a6f3d12-8ea7-4a62-a844-66cdb26152bb","resolution":{"observed_at":"2026-08-06T11:22:08.150028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3437880","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:11.705855Z","title":null,"venue":null,"work_id":"0075cf70-80da-41ad-a86f-093611c5ae40","year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.282021Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:c056b99cf8dcfcd71c6785fa30af07d6be75451876052c5410121de73d938ef2","observation_id":"e30bebd7-02f5-4476-921a-def0d6d8376b","resolution":{"observed_at":"2026-08-06T11:22:11.786336Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:08.369036Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.369036Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:b68f9dd82421b8c02daff792712256d01760fd9b7625983c2679fba44b2217e0","observation_id":"cb39c92b-bd58-4f6f-ad10-092f0a1893ef","resolution":{"observed_at":"2026-08-06T11:22:08.369036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:08.500385Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.500385Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:defecf5ad6ff548acc4c470b62212e260ee16b0e136faa478c86a84744aae7b4","observation_id":"37c58238-42ff-4bf9-953b-4bed40a2e803","resolution":{"observed_at":"2026-08-06T11:22:08.500385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.274420Z","title":"In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"40ecfc89-6c5a-4d41-829e-de8253665104","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.066644Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:b3dd053f43aa9cbdd39e9acec2ee52c96c6a03e437586cbf0c2ea0b5492e3d93","observation_id":"1b3d9346-d2f6-4cd7-b211-1a9415148ae3","resolution":{"observed_at":"2026-08-06T11:22:13.277858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.254270Z","title":null,"venue":null,"work_id":"7d5bdee8-71b9-4998-99ed-471bf5dcd653","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.744453Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:6425b507b0c91b18c7190492174c63e4724bc7029fca4237120325fe93d2e934","observation_id":"a1931f7f-fb2e-4e03-a7c1-f53aa8c2a5ca","resolution":{"observed_at":"2026-08-06T11:22:13.257452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.243284Z","title":null,"venue":null,"work_id":"82f6f975-aada-4fcc-ae39-d65d6844f9fc","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.879157Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:e1fc818035c8c8244118c8850a683bbac0e3cc44a92b0776f0df88980bd00fe8","observation_id":"c7509f94-6061-400e-a3ab-c688ac59ffe7","resolution":{"observed_at":"2026-08-06T11:22:13.246457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:09.036940Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.036940Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:badc58779711b0719453fd334404a686ee491dc3d8ba85f99ec422c8ee047435","observation_id":"e50fe659-5e26-497c-971d-a732af370509","resolution":{"observed_at":"2026-08-06T11:22:09.036940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.226374Z","title":null,"venue":null,"work_id":"be55f4c2-c503-4443-97d3-2d61ec505973","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.171661Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:d129671f7a84c90e1ac717649489ced8d9dbb4f6fb82dec2df4b26a86e43efef","observation_id":"aed89379-dbe6-4ca4-84f2-23e2fba0b7cc","resolution":{"observed_at":"2026-08-06T11:22:13.229217Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.265082Z","title":null,"venue":null,"work_id":"641c12c6-8935-4e97-8d97-f7e09c358ba2","year":2023},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.634729Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:b73dc5eba4451b5f9d5ef32179b892177a5c932d0c49f3586d923c2b0fb5c727","observation_id":"950af699-33d2-4395-a2a1-eb8434b832ca","resolution":{"observed_at":"2026-08-06T11:22:13.268243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.210683Z","title":null,"venue":null,"work_id":"fad5a4b5-4ed4-4611-b24b-f6d346ee2dee","year":2023},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.397609Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:b29dcbc79caf8e8c0d6945e1d2131fb4d8a6699efb79413967eec4abfbf4b491","observation_id":"c6c5c237-94e7-4014-9c08-2d56396cf76f","resolution":{"observed_at":"2026-08-06T11:22:13.213411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.200420Z","title":null,"venue":null,"work_id":"482d84aa-6c41-4b21-b15c-c6f7cd53667b","year":2019},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.470703Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:376033eec4ee2ccf1fae68fcaf8da29d5dcf4dfc5ceb3a52d84631fc4f850db8","observation_id":"a0647a3f-c126-49dc-baa4-efa1791696ea","resolution":{"observed_at":"2026-08-06T11:22:13.204296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2358.2021","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:12.025083Z","title":null,"venue":null,"work_id":"d98e53fd-a5bc-455d-aa1b-03671e37fde3","year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.527545Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:4114a21781cf323fb53acfb9e7801c8213e856d4e008de09cef4de4a9233b84d","observation_id":"d28d1515-0ce5-4446-99ca-2500ef15e566","resolution":{"observed_at":"2026-08-06T11:22:12.106579Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21227/67x4-9g14","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:11.538212Z","title":null,"venue":null,"work_id":"f5b19753-bd31-45b0-9e1b-7c7f77d0c77a","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.564187Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:3445097acfe6a7f6db64ef58370541c536754753414a4aa4256b244d7e4e7b8a","observation_id":"eff0526c-e9e6-4ba3-991b-9c7ef0626f98","resolution":{"observed_at":"2026-08-06T11:22:11.616681Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:09.313558Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.313558Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:e63b5090bb3af34f78b0b19c30619b07190466b1da97ef0054769eb994e4deaa","observation_id":"21685015-2d51-4f6e-827e-06f166f1b562","resolution":{"observed_at":"2026-08-06T11:22:09.313558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.180665Z","title":null,"venue":null,"work_id":"1e6a2aa6-b57a-4ae8-a284-bd2eeed80321","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.723169Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:b336242099b2b6eb4f21aee3b7ad31cb83cb671d8ec256ac28ed79fce65a5fa2","observation_id":"f6e54fc4-3801-41d8-90dd-2a439f743eb6","resolution":{"observed_at":"2026-08-06T11:22:13.183491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.171137Z","title":null,"venue":null,"work_id":"8bfb0d35-bdde-491f-94fc-88756eece37c","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.753390Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:79e3d6aa76160d5eaae21042262403706731f0263f83597a03fe4f76dc8ef247","observation_id":"69ecbad6-15f3-4c3e-b905-19afa07a3021","resolution":{"observed_at":"2026-08-06T11:22:13.174336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.161418Z","title":null,"venue":null,"work_id":"53ea34d5-196c-40a6-8fa6-0c1b91db17c9","year":2015},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.841458Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:076c14ec30f348f7ced59a469e1f8218cd25fe89f2fca675df75aa566b66d665","observation_id":"550cf1ac-bb23-4821-b51c-c87adf33cdb1","resolution":{"observed_at":"2026-08-06T11:22:13.164644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ins.2022.03.026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:11.382991Z","title":null,"venue":null,"work_id":"4af993be-623e-4e2f-9f7a-db301b4f72e1","year":2022},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.925918Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:a4626a9dfc5dcdcabf16090213a575a9c32875b6dad3c3560f3eef383c0012cd","observation_id":"67a6ee80-0852-4adb-9752-93e8c9d8ef55","resolution":{"observed_at":"2026-08-06T11:22:11.459447Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.190401Z","title":null,"venue":null,"work_id":"f06fd0f6-80d2-4ab4-a484-8eab492af731","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.652357Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:5bf7e2815f3bc025107032ae1f78bd803ae2d5608a72b576d0e05b6adc67749b","observation_id":"22cc9f4b-dd66-4b1d-9dc2-f81a0c8f42b5","resolution":{"observed_at":"2026-08-06T11:22:13.193431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.151250Z","title":null,"venue":null,"work_id":"f4bc1833-816b-4cfe-81ff-6a7c400efccd","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.171917Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:6f04230611532604fec5fff695ce50f4d09cda84165bb8db1fba2e48710fcad5","observation_id":"aa3a5a36-b428-4ce8-b9ae-39384141ac51","resolution":{"observed_at":"2026-08-06T11:22:13.154808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:10.252632Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.252632Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:69f98a5c02be9e081131c01059b33bf52cf02eee3150173b7ccb63ee7ab96791","observation_id":"4ac61163-a401-4056-a125-e57f5f5d7156","resolution":{"observed_at":"2026-08-06T11:22:10.252632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.141156Z","title":null,"venue":null,"work_id":"0909956b-9cc2-477b-96d9-bfde4583a746","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.334837Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:e8f47c2bee59ab3043ff5a0824c1706a183f85697c30b932cfa187be71a4de66","observation_id":"0de8c958-c5e2-4b57-982b-ef280b189337","resolution":{"observed_at":"2026-08-06T11:22:13.144085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.130809Z","title":null,"venue":null,"work_id":"17961ca3-a696-426a-a511-29f13617e2ed","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.411765Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:c2a79141c607be301d47be66c463eee135dc0301e800366d3669c1f38fe79e05","observation_id":"8768b146-5d26-4721-b7fb-5b8611c43ba7","resolution":{"observed_at":"2026-08-06T11:22:13.134274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-06T11:22:10.032757Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.032757Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:666d59a5cf306a28622d8071bd0096e99b8dfe3116ded38bf3cf25f1ad85fbca","observation_id":"1171e4f6-1351-435f-ae4e-ac3f5ac56389","resolution":{"observed_at":"2026-08-06T11:22:10.032757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.110105Z","title":null,"venue":null,"work_id":"472bb29f-4987-4a85-b539-7cbbbb60d224","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.600580Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:2de057752d3fdf8ecf6203e50c7e79e6db777e5bf2d9c2b0e3f4324c55f02288","observation_id":"f4053ef7-be47-4908-be0b-255e067d5932","resolution":{"observed_at":"2026-08-06T11:22:13.113630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3625100","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:11.230444Z","title":null,"venue":null,"work_id":"e853b048-396a-48f1-866f-bf41cb6b270e","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.642109Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:2fed49cb5c4ef8e0044c4b868537efe1c74c232ab35d3d388942f533e0d276e3","observation_id":"0fa8b4b3-86be-4b42-b828-3ba73d142268","resolution":{"observed_at":"2026-08-06T11:22:11.289869Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:10.727452Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.727452Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:c184ceee5b6ab2fc593b67c55af196b28c9c99345a56edf40bbd538941cfe88b","observation_id":"06a8dfcf-bfd4-46a4-8af0-f84c57d4259c","resolution":{"observed_at":"2026-08-06T11:22:10.727452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.092549Z","title":null,"venue":null,"work_id":"94bafc02-3000-4d32-bde6-3bc5c135e1a1","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.821908Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:beae17002bab5d510d27b6bf8653a0422c09bbbb928ceca114ccf59909145ec3","observation_id":"b942b722-472b-4e67-bf01-648e65d2b7a8","resolution":{"observed_at":"2026-08-06T11:22:13.095957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.121315Z","title":null,"venue":null,"work_id":"7085575a-58e2-45c1-b674-93db1929007e","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.511071Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:b14663db62372b84697f947d1c8d426b49d319b68bb4431cfb61a38e5f1f5b7e","observation_id":"e0b9dcc3-b21a-44a0-a7ba-60578e7b11f5","resolution":{"observed_at":"2026-08-06T11:22:13.124121Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:11.003082Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:11.003082Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:ea54727f7211c961a492ac786fda181c8b113efd1f4a69449e2d8009b9b48ad8","observation_id":"64682249-b972-4a9f-89aa-cf6e4eb7dae2","resolution":{"observed_at":"2026-08-06T11:22:11.003082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:12.879250Z","title":null,"venue":null,"work_id":"be7f669c-12c5-4fe8-b66a-8265d3f56dd6","year":2022},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:11.094770Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:7cc34a5aae60bdfbd28af19002463ce4cb4cceee6b1e65865fa87886339ef2bf","observation_id":"bf2b3cec-c6b8-4b10-b4dd-de27c27bcd7b","resolution":{"observed_at":"2026-08-06T11:22:12.967277Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.074336Z","title":null,"venue":null,"work_id":"b578a786-0c85-4525-a18f-0b3d0bd0b620","year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.908903Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:facd3a58a5d620b9d67ce80e7752317bde576f6000d783bf30b7b32a8a547cc8","observation_id":"d2f5310c-e3d0-4be9-801b-ded63e567e65","resolution":{"observed_at":"2026-08-06T11:22:13.083669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.377169Z","title":"Pattern Analysis and Applications 25, 4 (2022), 981–992","venue":null,"work_id":"d2703682-2ed1-4140-aa01-09e3a7544637","year":2022},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.573227Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:23de451463656517a11d9591f54d5a204b901d16785c19ee22bb12797463eda9","observation_id":"8a192271-f78a-483e-b291-d47b09b5462c","resolution":{"observed_at":"2026-08-06T11:22:13.380191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.419750Z","title":"In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"bc2a2caf-4b07-42de-8d90-7d2f324d323e","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.137860Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:7280a11052cac70027deeeb2941c22449d880ea8566a1d4428461d4f2d8b90e6","observation_id":"413f7d4f-1e0c-4756-a4dd-e455d85535a7","resolution":{"observed_at":"2026-08-06T11:22:13.423278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1884.2024","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:12.609777Z","title":"In 2024 International Conference on Signal Processing, Computation, Electronics, Power and Telecommunication (IConSCEPT)","venue":null,"work_id":"28efc07c-7ce3-4bb2-b8a6-36af9ca9e806","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.880564Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:7010c3e88ffd554c79ceb7f8c3c00075114bf0c3baba97807efd68b100853a31","observation_id":"1b457127-83af-4786-8a86-36ed0d4483e1","resolution":{"observed_at":"2026-08-06T11:22:12.712624Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07803","last_updated":"2025-07-13T01:40:13Z","snapshot_observed_at":"2026-08-10T04:40:05.024874Z","submitted_at":"2025-07-10T14:28:39Z","title":"StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model","version":2},"cited_work":{"arxiv_id":"2507.07803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07803","snapshot_observed_at":"2026-08-06T11:22:12.357828Z","title":"StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model","venue":"cs.CL","work_id":"fb27e0c2-7066-43bf-b6be-ff66ec7f08b7","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.063747Z"},"links":{"cited_paper":"/paper/2507.07803","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:e3ad6fc9220fc13a904168e7568805b8507f78dda8f262b340d1691bd83cd324","observation_id":"e5348dba-3fe9-4ea4-a7fc-2ebc60caace8","resolution":{"observed_at":"2026-08-06T11:22:12.420970Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":52,"verified_exact":6,"verified_fuzzy":3},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2507.22781."}