{"as_of":"2026-08-10T22:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93a72bde21e97f5a14da2a7d967480891aec9af406e6fb3b997be301e257f397","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:42:04.276221Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07358/citation-record","integrity":"/paper/2506.07358/integrity","json":"/paper/2506.07358/citation-record.json","paper":"/paper/2506.07358"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:05.207417Z","title":null,"venue":null,"work_id":"f4d6583c-8ae7-4501-aa9d-1f5d015cd9e1","year":2018},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.029926Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:b28a4680ba82a487408fa8e8a2dd574cfd86ea58d533443a2b6893e423944f15","observation_id":"d932c7ed-4ca3-4368-8ab5-c4001ae4f8f8","resolution":{"observed_at":"2026-08-07T05:42:05.213542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:05.186800Z","title":null,"venue":null,"work_id":"31f6aa53-8105-4fad-a312-9819c8e1fbd1","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.035372Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:41d67eeda878974ceb64d00588b169a62837cf7ab60be53f3c54128240fa011b","observation_id":"82f9062f-70ba-4552-a3a2-a6ccc8d4823f","resolution":{"observed_at":"2026-08-07T05:42:05.192476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:05.170097Z","title":"D.; Junior, A","venue":null,"work_id":"e3479da8-540b-4403-91e7-44c4953b0319","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.040660Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:5411377f4da471d235411cd1fb3749e39e2457fa46e04f0a737252d0261d61e1","observation_id":"477f9f35-e939-4510-8703-2cef79e37f96","resolution":{"observed_at":"2026-08-07T05:42:05.175277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02195","last_updated":"2022-06-13T06:49:17Z","snapshot_observed_at":"2026-08-09T05:32:01.296126Z","submitted_at":"2022-03-04T09:08:50Z","title":"Voice-Face Homogeneity Tells Deepfake","version":3},"cited_work":{"arxiv_id":"2203.02195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.02195","snapshot_observed_at":"2026-08-07T05:42:04.489034Z","title":"Voice-Face Homogeneity Tells Deepfake","venue":"cs.CV","work_id":"4cf8b13d-1006-4f58-a4fa-183e951e6797","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.045983Z"},"links":{"cited_paper":"/paper/2203.02195","citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:f5774296ebd624754e9f4255b894ab4bf06602b68b6942b2421530889f7a21ca","observation_id":"5179a6b0-ace7-42ff-a490-04386f60718d","resolution":{"observed_at":"2026-08-07T05:42:04.494537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:05.150979Z","title":null,"venue":null,"work_id":"8ea6cdbf-591f-4b7e-84c8-912289b96a3c","year":2017},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.051439Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:6d48048b0dee3c2d981c241d9e7c5d249b2e37362b1b5eb1b4b883f61414a30b","observation_id":"dfe00bdd-68d6-42cf-aaf0-9d32c5e636d6","resolution":{"observed_at":"2026-08-07T05:42:05.156901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:05.133317Z","title":null,"venue":null,"work_id":"06ad4fdd-9008-489e-b5a2-5296ed7ee605","year":2020},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.056461Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:8c839832dfdc23f62cd790b14825efb21778fc1accd056025e7106c1a16df8f8","observation_id":"1354ea75-9676-432c-8178-1f179cdbc2fd","resolution":{"observed_at":"2026-08-07T05:42:05.138982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-07T05:42:04.062150Z","title":"S.; Nagrani, A.; and Zisserman, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.062150Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:70ca9d1425665b36811b284d8da96682037f445230dbd4c5b0494665c812ce05","observation_id":"7858a586-c626-431c-a6c5-2f2033923550","resolution":{"observed_at":"2026-08-07T05:42:04.062150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:05.112082Z","title":null,"venue":null,"work_id":"c16fd739-c815-4e3b-be23-b679501c6468","year":2023},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.067527Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:e7c7e347086e490545fc8461c3bd66173703bc649c318fec8d71c50f7a53736d","observation_id":"350e9093-c8b6-4d6c-ae25-4fb36b3c1385","resolution":{"observed_at":"2026-08-07T05:42:05.118325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07397","last_updated":"2020-10-28T03:48:28Z","snapshot_observed_at":"2026-07-06T09:28:36.954658Z","submitted_at":"2020-06-12T18:15:55Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07397","snapshot_observed_at":"2026-08-07T05:42:04.072119Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.072119Z"},"links":{"cited_paper":"/paper/2006.07397","citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:c4833707d0d0dcaee5acdaf3b6b580e0c8b23e77d86f97abdcdafed2e1e302bc","observation_id":"adf32a93-4406-4062-ba40-040327f3a857","resolution":{"observed_at":"2026-08-07T05:42:04.072119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:05.091105Z","title":null,"venue":null,"work_id":"53dea3bb-d108-4c64-986b-0c5f26a21032","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.077748Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:a14627fddefdf046afcafb80de52cad41c413bb605c19d0b94eae14a5b9d9568","observation_id":"d03c9ffe-7b19-40f5-b286-53097946da34","resolution":{"observed_at":"2026-08-07T05:42:05.097516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:05.067051Z","title":null,"venue":null,"work_id":"23309858-20f1-421a-828d-c9304ed791c3","year":2021},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.082974Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:1b13935f3f57fcddc55fefa76dbc3d00971897c98a45183c6b1ff3a50edb7498","observation_id":"aa1e58d2-70cd-4c7a-b398-ad2a56443a3b","resolution":{"observed_at":"2026-08-07T05:42:05.072596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:05.046990Z","title":null,"venue":null,"work_id":"de69b099-085f-4c14-ad73-b51e8e54feeb","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.088532Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:f08c7f8c7d17a560538a81a760173d727efe75f50364db6a3a59ef766b0a71d7","observation_id":"b0c1d5a8-0354-4659-b093-397d46653bff","resolution":{"observed_at":"2026-08-07T05:42:05.053385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09741","last_updated":"2022-07-11T04:21:37Z","snapshot_observed_at":"2026-08-04T11:18:15.777540Z","submitted_at":"2022-02-20T06:35:18Z","title":"Visual Attention Network","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09741","snapshot_observed_at":"2026-08-07T05:42:04.093554Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.093554Z"},"links":{"cited_paper":"/paper/2202.09741","citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:6b728f708bf6a0edc601eca293af2eea15245070980eeab7585a8c209427c4ad","observation_id":"3e329a2f-7aeb-4940-b0f7-24471e8db1ab","resolution":{"observed_at":"2026-08-07T05:42:04.093554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:05.029973Z","title":null,"venue":null,"work_id":"8bb26732-8c9a-4300-8c9b-e7047c4a9cd4","year":2018},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.099424Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:33fd8b4ce7d2f39b0b94c325bb64deea17323650e4fa74a73fb9e223a25e4740","observation_id":"2e6e09ac-d64e-4d00-9906-05608cca957a","resolution":{"observed_at":"2026-08-07T05:42:05.035225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:05.011057Z","title":null,"venue":null,"work_id":"3ce358d5-ba32-45dc-9556-2d7ee774b861","year":2021},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.104079Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:94395c460a62794563636d105e183a0abd869ed04b12e0f1be92804e56cf04c9","observation_id":"eb5c6911-9d0a-45eb-8d58-7dfec0a78c0d","resolution":{"observed_at":"2026-08-07T05:42:05.016501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.989937Z","title":null,"venue":null,"work_id":"6fb1dcc3-b91a-4095-8103-9594dd684f33","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.108993Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:e5b88d28732b55690fae81ca37229d35ec12a2ef4b26ca8da58f290e127943e4","observation_id":"97b184dc-c1ad-4ac6-aedc-bde5f357aa0e","resolution":{"observed_at":"2026-08-07T05:42:04.996973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.971259Z","title":null,"venue":null,"work_id":"bed5ebea-5d07-480c-96a5-105dea0f8471","year":2021},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.113762Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:767b71ea0cc4abcadce96b9210e61175f65c93f4f5a26230a3225d586104f678","observation_id":"8931119d-a7c6-4e17-86d4-049805251d5b","resolution":{"observed_at":"2026-08-07T05:42:04.976518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.955559Z","title":null,"venue":null,"work_id":"53464507-cce3-4f5e-9405-8ac6640a712c","year":2005},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.118779Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:dfa56b04e30dbfb9b4285b3e6451bafc64366643a587874e5a7306c558bc60f5","observation_id":"69583204-6771-499c-b77a-fe3710c19bde","resolution":{"observed_at":"2026-08-07T05:42:04.960142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.935934Z","title":null,"venue":null,"work_id":"5379209a-7404-4715-a276-a3c67216d5e3","year":2021},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.123674Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:690456f895df51e07163ba145a04f69b08ca527f458da0e0fc743d4c920189e6","observation_id":"09b72f0f-5205-4a4b-b6bf-38f28ddcbba4","resolution":{"observed_at":"2026-08-07T05:42:04.942102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.918599Z","title":null,"venue":null,"work_id":"9f2ab233-9fd4-44d9-bb46-a89ce212d08a","year":2017},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.130316Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:cbde7e0b5041e9df8757dbc0b8d012fc544753c52f61f2a426d37334e4e140c9","observation_id":"51b657b0-6b5d-413e-b823-158be3e7b645","resolution":{"observed_at":"2026-08-07T05:42:04.923622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.901064Z","title":null,"venue":null,"work_id":"2ffb4ba7-6380-4f2e-897a-6c02f6aedd8d","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.134920Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:66d90a8c6167dfe2776bf547168eac7d4df3818aad87f9485aee0056eda50f24","observation_id":"114e5795-2b01-417c-b5ed-be5f5f79031f","resolution":{"observed_at":"2026-08-07T05:42:04.906680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05080","last_updated":"2022-03-01T10:38:07Z","snapshot_observed_at":"2026-08-06T06:30:26.873321Z","submitted_at":"2021-08-11T07:49:36Z","title":"FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05080","snapshot_observed_at":"2026-08-07T05:42:04.139918Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.139918Z"},"links":{"cited_paper":"/paper/2108.05080","citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:bed1920d5fd82a2c3caf7265b48a7f5813ab453f15b4df5ec02e065be178817b","observation_id":"e0a363cf-e82a-4ba5-afd2-67d875d113bb","resolution":{"observed_at":"2026-08-07T05:42:04.139918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.880646Z","title":null,"venue":null,"work_id":"f157f986-f7ec-4ce3-8e65-7ddefba5e425","year":2021},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.145973Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:d03e04be1e159eaf4dd05f183bf81224be1ee2838e28287d75664026cb0b8f6a","observation_id":"124a687b-c5fd-4620-85c6-ed4338df9ec1","resolution":{"observed_at":"2026-08-07T05:42:04.887298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08685","last_updated":"2018-12-20T16:36:39Z","snapshot_observed_at":"2026-08-09T14:52:48.078687Z","submitted_at":"2018-12-20T16:36:39Z","title":"DeepFakes: a New Threat to Face Recognition? Assessment and Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08685","snapshot_observed_at":"2026-08-07T05:42:04.151101Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.151101Z"},"links":{"cited_paper":"/paper/1812.08685","citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:d7622a1889cb818cc7dbaa79c58be3edd862bf79a1b7f57dc4249ffb3e54c735","observation_id":"16bc51e1-b55a-4c9b-9f7d-0a85edcc0805","resolution":{"observed_at":"2026-08-07T05:42:04.151101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.865133Z","title":null,"venue":null,"work_id":"8b350daa-4be2-41de-a6c1-47dd3b2ae161","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.156090Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:d92717955b1832923698e20d54a56517106a6c9cc638f96da6acbf0b0f9a7b3e","observation_id":"075f088a-0ce5-4626-b19d-845f7ca9d732","resolution":{"observed_at":"2026-08-07T05:42:04.870124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.847858Z","title":null,"venue":null,"work_id":"4f73bff0-f223-4953-9bbd-ceff8daba354","year":2021},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.161234Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:f614f34464a79d3af0a62ad039d1933e2155cb5c3c82e445e571785c2e7466f6","observation_id":"6fbc019d-22d1-4515-b423-d5826f8e5cc6","resolution":{"observed_at":"2026-08-07T05:42:04.853030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.831153Z","title":null,"venue":null,"work_id":"397ce371-498d-4c73-8c65-4d3300782481","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.165938Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:47cd74394f765084447fabab8645f649e005d47a479138f1535dd5517f18dde3","observation_id":"dba3cc92-5a90-4e22-98b7-52f15aa7496e","resolution":{"observed_at":"2026-08-07T05:42:04.836199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.814821Z","title":null,"venue":null,"work_id":"0c047853-af77-4b60-89d5-449f9156c701","year":2020},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.170906Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:e6c727f3234641ea058d1c1948f32dbbc75f1bcf97cda4a603483b64e11c1566","observation_id":"e279f52c-3a1c-44e3-a4f6-c9fc4d7aa873","resolution":{"observed_at":"2026-08-07T05:42:04.819749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T05:42:04.176670Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.176670Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:675f01b1e3dee58bac5a197b7f9c574a8a7cf633059a9d30aa36b935d1eb5749","observation_id":"9036c8f4-c8aa-42ec-ae27-f01edbeca5ed","resolution":{"observed_at":"2026-08-07T05:42:04.176670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.795174Z","title":null,"venue":null,"work_id":"34116e0e-b9ad-4bd4-8ffc-e1123903d96d","year":2020},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.182189Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:07734f013ed3da161e4a7d028f00ef1639c89bb27bb1e39e9572b2d8c6e37853","observation_id":"15c30617-855d-4a27-8777-5f634c6a02bf","resolution":{"observed_at":"2026-08-07T05:42:04.802411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.776988Z","title":null,"venue":null,"work_id":"bc1b3e92-feba-4c67-9a19-56e8819774ed","year":2020},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.187427Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:aad7b3adb1e615b1fce54f29e29f11cd49e6511c68f40b02569fd8d568d3dfc8","observation_id":"bcf4e421-3825-4861-805d-4c8fb5e67a58","resolution":{"observed_at":"2026-08-07T05:42:04.782273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.758538Z","title":null,"venue":null,"work_id":"43d35535-03e5-438d-b73f-a30bfa68645d","year":2021},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.192604Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:590ebde2c3f6472877e005765a1a7f418d4951291ef0a73aa2d0eee78cdcf754","observation_id":"d6faeb58-a3c4-45b8-a913-ad177519e942","resolution":{"observed_at":"2026-08-07T05:42:04.764403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.741665Z","title":"A.; and Malik, K","venue":null,"work_id":"68aa1ce4-b6f3-411e-bff3-5eaa4cd25d12","year":2023},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.197467Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:19cbb708e014d395d9ae218236af4fc072fe8f62d398807640fb9260afbc313d","observation_id":"4f560643-f977-4c47-9d24-8fbb25ec6b83","resolution":{"observed_at":"2026-08-07T05:42:04.747238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.725967Z","title":null,"venue":null,"work_id":"d45bcddc-de94-448f-99e7-0398124cfe1e","year":2002},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.202159Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:ee2b8533cb9661b601fbedbc0dba5a89f13b8faf51827736764302e352d4e5c8","observation_id":"f5424935-9ffb-498d-b29d-984dbbbbf514","resolution":{"observed_at":"2026-08-07T05:42:04.731007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.706199Z","title":"R.; Cogswell, M.; Das, A.; Vedantam, R.; Parikh, D.; and Batra, D","venue":null,"work_id":"d80ccaad-2044-4f96-92ad-0197dc79301e","year":2017},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.206748Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:76234a6d17a24b0cb7ffe49a051a950405379b32035775cb88075ebe1e1e85e5","observation_id":"e594b4d7-a089-4136-b846-96af3ffb29b5","resolution":{"observed_at":"2026-08-07T05:42:04.712739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.684261Z","title":null,"venue":null,"work_id":"70e89ef9-bb7d-42a6-b92e-32d0cd9cf60f","year":2019},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.212124Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:ce39b83e1c6cf04735b8e45b2c812ad59781c86524628f66724f06df3576c11d","observation_id":"7a8c4977-ffcc-4bc7-8c4f-21634d48fdee","resolution":{"observed_at":"2026-08-07T05:42:04.689876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.216996Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.216996Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:2aaa0088dbbf466f10cb5e87c704ebb5d3fa4e2b20951d927bd2833e16e4ad74","observation_id":"fbf7b5a5-2694-496c-8f7b-412c85292972","resolution":{"observed_at":"2026-08-07T05:42:04.216996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03984","last_updated":"2022-03-08T10:18:25Z","snapshot_observed_at":"2026-07-06T12:45:28.817201Z","submitted_at":"2022-03-08T10:18:25Z","title":"Attention-Based Lip Audio-Visual Synthesis for Talking Face Generation in the Wild","version":1},"cited_work":{"arxiv_id":"2203.03984","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.03984","snapshot_observed_at":"2026-08-07T05:42:04.360962Z","title":"Attention-Based Lip Audio-Visual Synthesis for Talking Face Generation in the Wild","venue":"cs.CV","work_id":"5e3ee602-4d67-4a16-8b0e-189f39113d4a","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.221624Z"},"links":{"cited_paper":"/paper/2203.03984","citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:2ed0421a88072b3faf09068afcca2f1ded734222d30986e89b41b4ed4c6305bb","observation_id":"1a2bdf86-1ac2-4163-82c1-223489d87b37","resolution":{"observed_at":"2026-08-07T05:42:04.366185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.653114Z","title":null,"venue":null,"work_id":"fa1e3944-c743-4b2a-850f-f70c0d57914f","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.226704Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:82f1586bb64150e8ff3d491a4989eafd0229c4c77b66db883271f3449c5b7766","observation_id":"51521d00-ae19-43ae-a675-c6a3df7618ad","resolution":{"observed_at":"2026-08-07T05:42:04.658394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.635556Z","title":null,"venue":null,"work_id":"0c41f41e-a212-4570-b6f7-279283e56c4f","year":2020},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.231527Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:558974fdf67fa4f2478860879fde929a9f6e64951935ed49248b48eaf9180c8d","observation_id":"784490bb-7a32-41bf-83f2-e747ac6d1da3","resolution":{"observed_at":"2026-08-07T05:42:04.641703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.609706Z","title":null,"venue":null,"work_id":"d11312cd-a807-4157-80cf-e58fcc5dbcea","year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.236318Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:12409480ba09314bd31221bd8ad0c378ee58af3d51570031423259ac1f8519ba","observation_id":"c425bffc-f7cc-4f6c-be41-a3022939a282","resolution":{"observed_at":"2026-08-07T05:42:04.615851Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.591130Z","title":null,"venue":null,"work_id":"4eb01c11-65cb-4d49-9485-d468f71110de","year":2023},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.241476Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:6108e2fad60b28f1ddbaa837459ff32597f51a8376a385d4bbbb8f58d9aa5471","observation_id":"301da320-ab60-4373-a39c-0fc550e59ec1","resolution":{"observed_at":"2026-08-07T05:42:04.596632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.574369Z","title":null,"venue":null,"work_id":"a571b6f8-d93c-4c1d-9a27-a173ca09431b","year":2017},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.246518Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:d7ab62092bb19fb699ecb3e432085b70fd5a538531d17ad7851548bbb2335ef4","observation_id":"d3921aea-112f-424d-b687-0dd2c06866d1","resolution":{"observed_at":"2026-08-07T05:42:04.579304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.558210Z","title":null,"venue":null,"work_id":"0c2c3af4-9853-4e8d-8c6d-b88cedd85666","year":2023},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.251250Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:4c6b5093b25ee4c89026cf9134022fb426a3ce4e975e99e8c5bac2bffb604133","observation_id":"cf4de127-1219-4142-86cc-51c55b0f22ae","resolution":{"observed_at":"2026-08-07T05:42:04.562993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01265","last_updated":"2022-03-02T17:44:40Z","snapshot_observed_at":"2026-08-05T01:06:22.503376Z","submitted_at":"2022-03-02T17:44:40Z","title":"Self-supervised Transformer for Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01265","snapshot_observed_at":"2026-08-07T05:42:04.255746Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.255746Z"},"links":{"cited_paper":"/paper/2203.01265","citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:8949786743017bc6245ee5655b56359f4548e3ac17aa840c15572ce18cc41670","observation_id":"5778d8ee-344e-4019-b8b7-83b4e9e9b7bb","resolution":{"observed_at":"2026-08-07T05:42:04.255746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.540875Z","title":null,"venue":null,"work_id":"b71e785b-f06d-4d70-9ec7-43536ef1cc46","year":2021},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.261343Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:4555fe9f14b7de3da933c6731162b4de4b7ac569c3775e65d42cde92ac23f0c8","observation_id":"5dba9f14-9890-4697-a8b9-c56734a51e47","resolution":{"observed_at":"2026-08-07T05:42:04.546299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.521255Z","title":null,"venue":null,"work_id":"11d5d887-e2ed-4887-be3f-2862edcd17dd","year":2021},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.266216Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:91dc2f6c50d3fb295a2b10d06c54092e2e13c82201905f2a6352058c96086a3a","observation_id":"5df90ccb-32ae-4fe1-9a1c-3b9944f0a3a1","resolution":{"observed_at":"2026-08-07T05:42:04.527667Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05746","last_updated":"2024-01-11T08:52:13Z","snapshot_observed_at":"2026-08-08T19:10:46.418950Z","submitted_at":"2024-01-11T08:52:13Z","title":"Cross-Modality and Within-Modality Regularization for Audio-Visual DeepFake Detection","version":1},"cited_work":{"arxiv_id":"2401.05746","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.05746","snapshot_observed_at":"2026-08-07T05:42:04.317104Z","title":"Cross-Modality and Within-Modality Regularization for Audio-Visual DeepFake Detection","venue":"cs.MM","work_id":"4c9ebf17-e862-43cd-b637-8ca385bd26c8","year":2024},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.271018Z"},"links":{"cited_paper":"/paper/2401.05746","citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:a26a6a7264000de0b6f5da28949b694ffb954b4348dc84ae313bb24cae68a963","observation_id":"a13fa297-47ff-435d-a5aa-11a9d6feaa33","resolution":{"observed_at":"2026-08-07T05:42:04.324836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:04.276221Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:42:04.276221Z"},"links":{"citing_paper":"/paper/2506.07358"},"observation_digest":"sha256:d28de8d1584f59abe8421c05f92baf63a551518ce60ca337abaf58b53b2a9593","observation_id":"4ded6f32-1db2-4e76-bf15-f0db686ffdc8","resolution":{"observed_at":"2026-08-07T05:42:04.276221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07358","last_updated":"2025-06-09T02:13:04Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T17:00:18.485916Z","submitted_at":"2025-06-09T02:13:04Z","title":"Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":3,"verified_fuzzy":3},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2506.07358."}