{"as_of":"2026-08-20T08:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de834940b51e47442d5eefb0f3be93216b8b04eed9e065a2326b6b96036b4ba5","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:45:54.536804Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:45:49.818821Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T16:45:54.946643Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"cited_work":{"arxiv_id":"2507.12723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.12723","snapshot_observed_at":"2026-08-06T16:45:54.946643Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","venue":"cs.SD","work_id":"3e9ffa12-a439-4dad-a224-7cf2d86f7047","year":2025},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:49.818821Z"},"links":{"cited_paper":"/paper/2507.12723","citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:9221643317b79ccb9ac971a39917899bc46d4288ff86eaab076297347ee3eba4","observation_id":"25c12320-9ae1-42b1-82a1-810bb793b25c","resolution":{"observed_at":"2026-08-06T16:45:55.025578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12723/citation-record","integrity":"/paper/2507.12723/integrity","json":"/paper/2507.12723/citation-record.json","paper":"/paper/2507.12723"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:46:00.164933Z","title":null,"venue":null,"work_id":"8ab5d110-4790-4a97-a1a5-c320af339b63","year":null},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:49.757320Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:5074e63b5b85fb2441fdd59bfb3200a445b8b4d397324776ac827869dcf5dcbb","observation_id":"a25f8065-3a17-4cef-a89b-32277d43078f","resolution":{"observed_at":"2026-08-06T16:46:00.234428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"cited_work":{"arxiv_id":"2507.12723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.12723","snapshot_observed_at":"2026-08-06T16:45:54.946643Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","venue":"cs.SD","work_id":"3e9ffa12-a439-4dad-a224-7cf2d86f7047","year":2025},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:49.818821Z"},"links":{"cited_paper":"/paper/2507.12723","citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:9221643317b79ccb9ac971a39917899bc46d4288ff86eaab076297347ee3eba4","observation_id":"25c12320-9ae1-42b1-82a1-810bb793b25c","resolution":{"observed_at":"2026-08-06T16:45:55.025578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:46:00.003878Z","title":null,"venue":null,"work_id":"ddfcf1b3-f433-492a-8637-576f7d22ead5","year":null},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:49.931600Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:d323615b817ac1f7a0f2c612ceda4d4671dbc70cbb7419a0b0d20fb5b55bc06e","observation_id":"d6619807-2e32-46e3-baed-cd826fddd4c1","resolution":{"observed_at":"2026-08-06T16:46:00.104538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:59.837491Z","title":"Semantic Feature Contrastive LossTo ensure robust tam- per localization, we compare the tampered and recovered audio streams in a semantic feature space","venue":null,"work_id":"133308e2-ee59-440f-91fd-b7ea492c6208","year":null},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:49.996219Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:0bbe4f52a4e44a1495c2383938f857b975a727b7beab391092c1368f1c9e0a2d","observation_id":"a3f5f2fb-ceaf-4fe4-9090-1bafd1e75d36","resolution":{"observed_at":"2026-08-06T16:45:59.913070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:59.692034Z","title":"No Mask” refers to training without a mask. Our masking strategies outperform “No Mask","venue":null,"work_id":"2fdef92f-16f6-415a-9630-879432765a7d","year":null},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:50.073833Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:cbcd308d0646e50e7afe2435635e76a03fd1fc70aafa13eb42eff4c6b17d10b4","observation_id":"ec97d494-547a-4834-8835-68a045094ef1","resolution":{"observed_at":"2026-08-06T16:45:59.766837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:59.504991Z","title":"To achieve this, we propose cross-modal watermarking method not only localizing tampered regions but also recover- ing authentic audio","venue":null,"work_id":"243373ea-b295-4159-b59c-b72a7f3cd150","year":null},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:50.133984Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:c5c8bd16da50fd88ad122eef41f7d68d79b7a6a98b959b1dc48f41a8a23078f3","observation_id":"f0e59333-d118-47a3-a28f-f69472846bb2","resolution":{"observed_at":"2026-08-06T16:45:59.598713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:59.309718Z","title":null,"venue":null,"work_id":"a527ebec-2c97-44df-953a-40fb1f7931c8","year":2025},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:50.216060Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:dad3af651a13d6d075c96c664dccdd5b3bc41ca9a3ea931ce9d9c9e69b035688","observation_id":"73223795-f2e0-4ca2-9208-39d41d1c7d46","resolution":{"observed_at":"2026-08-06T16:45:59.401149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:59.126483Z","title":"V oice- box: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":"99c82156-a5e7-4ff7-82e6-f92ba0c2fb4d","year":2024},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:50.326051Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:0caf75c7b96d1c316bc9265a894221d6f0dc88e57b5f84f394b9407bdfbeba1f","observation_id":"cc92fce9-8588-4000-81ec-b2f8b062ca31","resolution":{"observed_at":"2026-08-06T16:45:59.214657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:58.974987Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"67616a87-f707-43ee-90fb-a562121bf3ed","year":2021},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:50.431336Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:d5ddefc2c3bd819a8ddf54b751b474198597b599858b8c249f9da0e7e33e3d6d","observation_id":"71f584fe-cfd8-42c9-965f-2992f64d5566","resolution":{"observed_at":"2026-08-06T16:45:59.049190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:58.807155Z","title":"Prompttts++: Controlling speaker identity in prompt-based text-to-speech using natural lan- guage descriptions,","venue":null,"work_id":"175e3d69-915a-4eaa-b5c4-575a4cd9d53f","year":2024},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:50.498661Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:11bfb3327423ca8b35b6e214575f9cae7c4df27349e21dff4e6d737d175d3e7e","observation_id":"0b4fa284-f4ef-4059-a7e3-cfe7be6d70e6","resolution":{"observed_at":"2026-08-06T16:45:58.870054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01479","last_updated":"2024-08-18T16:36:50Z","snapshot_observed_at":"2026-08-17T05:27:37.272553Z","submitted_at":"2023-12-03T18:41:54Z","title":"OpenVoice: Versatile Instant Voice Cloning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01479","snapshot_observed_at":"2026-08-06T16:45:50.581929Z","title":"Openvoice: Versatile instant voice cloning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:50.581929Z"},"links":{"cited_paper":"/paper/2312.01479","citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:3de90bd5e6c6de881cdf33b0aa3540a82d1a25dcfe9fe06d264d4a227d8bed41","observation_id":"b89aa9a3-7056-4595-8637-97608f5fe06a","resolution":{"observed_at":"2026-08-06T16:45:50.581929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:58.638461Z","title":"Paddlespeech: An easy-to-use all-in-one speech toolkit,","venue":null,"work_id":"93810231-7b00-4cf6-b5d6-57fb77e7e04e","year":2022},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:50.667815Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:042af66d4a7892d4e36fe6986413735d9a629f6959d55b747c15aa5673904de8","observation_id":"81502a34-be0a-47c3-9da7-091f66d9bc2e","resolution":{"observed_at":"2026-08-06T16:45:58.712099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05630","last_updated":"2021-02-10T18:43:56Z","snapshot_observed_at":"2026-08-16T18:46:24.498624Z","submitted_at":"2021-02-10T18:43:56Z","title":"Voice Cloning: a Multi-Speaker Text-to-Speech Synthesis Approach based on Transfer Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05630","snapshot_observed_at":"2026-08-06T16:45:50.765524Z","title":"V oice cloning: a multi-speaker text-to-speech synthesis approach based on trans- fer learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:50.765524Z"},"links":{"cited_paper":"/paper/2102.05630","citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:f75856459145bfc8d604edf7487b44525213fb694efb3fa0e2a9156c3ba62294","observation_id":"3aba5e75-4eea-4ad4-9ecf-3adae756963e","resolution":{"observed_at":"2026-08-06T16:45:50.765524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:50.866421Z","title":"A lip sync expert is all you need for speech to lip generation in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:50.866421Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:aee558bbd110c0c2e670ab74c80a58337bf796a6879659f643d9cc3ae86b3ae2","observation_id":"229c49e3-fa14-4f9c-bb0f-38942db4d6a1","resolution":{"observed_at":"2026-08-06T16:45:50.866421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:58.430241Z","title":"Diff2lip: Audio conditioned diffusion models for lip- synchronization,","venue":null,"work_id":"8ed3f99b-92e0-487d-ad2a-59c734db1b90","year":2024},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:50.990832Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:0925f2e765bb884820e5798155dbd6978729970de6f42fa3268d69d50c07c79d","observation_id":"f5d8182c-2d28-4ac4-b4b0-136a5d140498","resolution":{"observed_at":"2026-08-06T16:45:58.518164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:58.240819Z","title":"Pose-controllable talking face generation by implicitly modular- ized audio-visual representation,","venue":null,"work_id":"d956c2cf-eea6-4d46-8df3-6adc7b8a5972","year":2021},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:51.130244Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:e655f1db69a18ff40d721aad202f38da5d8bccce662f5333ccf4a0bfb49349d2","observation_id":"53301581-388c-4586-a1e1-8555189d3b96","resolution":{"observed_at":"2026-08-06T16:45:58.303254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15197","last_updated":"2023-12-23T08:45:57Z","snapshot_observed_at":"2026-08-16T14:32:01.416818Z","submitted_at":"2023-12-23T08:45:57Z","title":"TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation","version":1},"cited_work":{"arxiv_id":"2312.15197","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.15197","snapshot_observed_at":"2026-08-06T16:45:54.654784Z","title":"TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation","venue":"cs.SD","work_id":"144a9565-1541-49bc-9b23-16fd000bdf85","year":2023},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:51.295199Z"},"links":{"cited_paper":"/paper/2312.15197","citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:3521612527a287f18b7a7fcaf67050b564a8fc254f772e4f22d0fda703ffa329","observation_id":"98f9c78d-94b4-4d71-bb5e-9f17137ba254","resolution":{"observed_at":"2026-08-06T16:45:54.731731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:57.994467Z","title":"Synctalklip: Highly synchronized lip-readable speaker generation with multi-task learning,","venue":null,"work_id":"270a3b55-2d5b-4708-8d03-97d0ac7fe301","year":2024},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:51.472799Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:8c32ba5997b49567143856f6df99c4e3c7f91df007e44adcb3fb668093c3ffcb","observation_id":"b077b6a2-bf19-4acd-922f-2bf55b3c6242","resolution":{"observed_at":"2026-08-06T16:45:58.113236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:57.790372Z","title":"Editguard: Versatile image watermarking for tamper localization and copy- right protection,","venue":null,"work_id":"3557c3d8-6988-4b9e-9ae9-8b2f87f936da","year":2024},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:51.591498Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:fcc70474bb314516326166f166bd567510dbcbc47894d56779c8238a8e05badd","observation_id":"b5bf171c-b948-419b-8bfc-8ca4c4a494a6","resolution":{"observed_at":"2026-08-06T16:45:57.865630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:57.652336Z","title":"Proactive detection of voice cloning with localized watermarking,","venue":null,"work_id":"d1a79d0d-61e0-42a8-b395-1503e19be7e9","year":2024},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:51.723042Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:ab7198f2950fba232e2491373ef68d409be84b31714a02ed1288da51e9d6a025","observation_id":"72669cce-d637-4d0e-b732-dca031e82883","resolution":{"observed_at":"2026-08-06T16:45:57.715993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21611","last_updated":"2024-08-19T16:09:14Z","snapshot_observed_at":"2026-08-16T13:29:32.153302Z","submitted_at":"2024-07-31T13:49:17Z","title":"Enhancing Partially Spoofed Audio Localization with Boundary-aware Attention Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21611","snapshot_observed_at":"2026-08-06T16:45:51.888779Z","title":"Enhancing partially spoofed audio localization with boundary-aware attention mechanism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:51.888779Z"},"links":{"cited_paper":"/paper/2407.21611","citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:38b4c6f2d7336667f355cb61d63bb703e8c0cb190c44376e60b8e969a02a68c1","observation_id":"1f2ba057-3157-4c10-ab2e-eab0e2af9c8d","resolution":{"observed_at":"2026-08-06T16:45:51.888779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:57.434897Z","title":"Coarse- to-fine proposal refinement framework for audio temporal forgery detection and localization,","venue":null,"work_id":"6a8021c2-fa03-4879-9c9f-444ddbd988b4","year":2024},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:52.038159Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:4725e4ad0fd0aaf3e57050474f4d7574a6c87c699796483242da9bcf564c642b","observation_id":"0080dac6-140f-43b4-b90a-2f0c27ad71ea","resolution":{"observed_at":"2026-08-06T16:45:57.559506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:57.277468Z","title":"Wavmark: Watermarking for audio generation,","venue":null,"work_id":"eeabcd3e-8332-4700-835b-2ac5ac489cd1","year":2023},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:52.153256Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:8c4ba8b8780d53e7f7553c79c985300858af8050cc0e0ac672c5bc55d5506781","observation_id":"c0570cfc-711b-4ea6-8770-abba5c953757","resolution":{"observed_at":"2026-08-06T16:45:57.343824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:57.127156Z","title":"Hiding data in images by simple lsb substitution,","venue":null,"work_id":"c9e306d0-4be6-4722-939a-d559f070ebaf","year":2004},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:52.320247Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:a6e2a86d608d0d394fdc771c9f784507851c3c41c6f10b9d39df833d4d39b6fa","observation_id":"615ad3a1-de66-4b32-943f-8f0fe7785935","resolution":{"observed_at":"2026-08-06T16:45:57.191686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:56.945801Z","title":"Complete video quality-preserving data hiding,","venue":null,"work_id":"53394f7e-4b15-4072-b1f5-f0b341ca4b08","year":2009},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:52.445262Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:d2d92ef9911a6a80c8bf95f4cf69eb639e040cc2e4da8cc96273d75770db7963","observation_id":"c8440b55-d5a8-4687-a597-fddd9084fa02","resolution":{"observed_at":"2026-08-06T16:45:57.038920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.03892","last_updated":"2019-01-30T03:39:54Z","snapshot_observed_at":"2026-08-18T20:56:28.191189Z","submitted_at":"2019-01-12T18:47:38Z","title":"SteganoGAN: High Capacity Image Steganography with GANs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.03892","snapshot_observed_at":"2026-08-06T16:45:52.573245Z","title":"Steganogan: High capacity image steganography with gans,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:52.573245Z"},"links":{"cited_paper":"/paper/1901.03892","citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:9818e1f0e9a54894a4c30d30c84dedaef78c27e120e3ea879e7c79a9401420d2","observation_id":"b970d1cc-97a7-4998-b259-4e1814ea24cd","resolution":{"observed_at":"2026-08-06T16:45:52.573245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.8516","last_updated":"2015-04-10T12:27:56Z","snapshot_observed_at":"2026-08-12T12:07:47.951486Z","submitted_at":"2014-10-30T19:44:20Z","title":"NICE: Non-linear Independent Components Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.8516","snapshot_observed_at":"2026-08-06T16:45:52.709737Z","title":"Nice: Non-linear independent components estimation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:52.709737Z"},"links":{"cited_paper":"/paper/1410.8516","citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:9368ac200281eae9b09815252b7721520df34e53e71d7ffa6845c683e45eb6c1","observation_id":"67a01fa2-a2a6-4d05-9fcf-565b0113052e","resolution":{"observed_at":"2026-08-06T16:45:52.709737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:56.786936Z","title":"Hinet: Deep image hiding by invertible network,","venue":null,"work_id":"6276a2d4-8326-44af-802b-1241ba3ef94b","year":2021},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:52.852091Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:3c8685d610b8f1ef560e6f0e2eceab75ce44aac26726cb07f6d892b05f913631","observation_id":"f153a800-45aa-4f98-a867-49995a956c3a","resolution":{"observed_at":"2026-08-06T16:45:56.844075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:56.616576Z","title":"Large-capacity and flexible video steganography via invertible neural network,","venue":null,"work_id":"a074b895-1b19-4474-90b0-82e43bb9e52e","year":2023},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:52.960294Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:02b825f050be525e3b948c348a5b249d3d3151c9e069aa7e7072796b9b0b78e7","observation_id":"5fb90bcc-4121-42f4-abb8-0613fea70645","resolution":{"observed_at":"2026-08-06T16:45:56.713613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:56.461288Z","title":"Thinimg: Cross-modal steganography for presenting talking heads in images,","venue":null,"work_id":"ec026abd-562d-48ab-af71-beb05d7e2b73","year":2024},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:53.117346Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:f9cf0c8bfbecc3cc141e854145207c573afc66032c4044d64a432894fb0a1e20","observation_id":"11ac612b-a30f-41e9-91da-3642659a8a73","resolution":{"observed_at":"2026-08-06T16:45:56.529900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:56.260236Z","title":"Densely connected convolutional networks,","venue":null,"work_id":"c9b9d722-cff6-4c9e-8a21-e11e0661d7b8","year":2017},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:53.257898Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:8b352548c717b6d800035311ec11b6b99b74a8f57d0b43ece3d3dd46653c1b61","observation_id":"953805b2-14eb-4e8f-abaa-34a962a09c8e","resolution":{"observed_at":"2026-08-06T16:45:56.342670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:56.060472Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":"211b5e09-8582-497e-8791-6cc320d5da70","year":2017},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:53.380957Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:b5a5bf9ffca38dd56d131dbfa893545bdfc0878b257902dc91060660a94524aa","observation_id":"afe04c73-1ffd-4c35-ac6d-8985cd75e0ca","resolution":{"observed_at":"2026-08-06T16:45:56.157926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T16:45:53.537636Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:53.537636Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:f15087c41c6d3ea6dbf679153c2f4ee75e41a200068304069f37178e145e4413","observation_id":"6d9353e5-e375-432a-b6f9-ec3483484898","resolution":{"observed_at":"2026-08-06T16:45:53.537636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:55.863573Z","title":"Lightface: A hybrid deep face recognition framework,","venue":null,"work_id":"5f8212c8-c0f4-4831-b165-1e3db13b9f30","year":2020},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:53.679594Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:5d75b1a6d6e4dc5fc6108492d51b7aa747ef605f9e56351e3c64846e2e39ba48","observation_id":"ad9db548-882e-41dd-acb4-d7516b626039","resolution":{"observed_at":"2026-08-06T16:45:55.988215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:55.679219Z","title":"Flow-guided one-shot talk- ing face generation with a high-resolution audio-visual dataset,","venue":null,"work_id":"8e1d70fb-f284-48ea-ac28-7dc84ca626fd","year":2021},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:53.799916Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:3142d09985f3abdd64380bdb59e8ec08bd235abacf56590a539753b6ccfe08b8","observation_id":"2a2bd7e8-bdc5-4d37-beb6-66f7fe7deca1","resolution":{"observed_at":"2026-08-06T16:45:55.759725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-08-16T06:08:36.265981Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-06T16:45:53.924279Z","title":"Lrs3-ted: a large-scale dataset for visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:53.924279Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:712327e36ecf60b229c8ec5abcb640dd2be7e12ccc0b31b4d43befdcdd392fa0","observation_id":"80ba801b-e27a-466a-b7de-f8c384c73ac8","resolution":{"observed_at":"2026-08-06T16:45:53.924279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:55.530887Z","title":"V2a- mark: Versatile deep visual-audio watermarking for manipulation localization and copyright protection,","venue":null,"work_id":"4594e3b1-1947-45bf-9f11-4509aa9694f3","year":2024},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:54.102283Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:8bef9f016510b7c2f7ff0886d93b483e6b86802e196e3ef1a2209b2f3c034558","observation_id":"097491e6-36c7-4393-9268-f2bb64e5a0a4","resolution":{"observed_at":"2026-08-06T16:45:55.579282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:55.343091Z","title":"Musetalk: Real-time high quality lip synchorization with latent space inpainting,","venue":null,"work_id":"ed736611-0e69-495c-905a-b5dcc600f712","year":2024},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:54.229478Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:57cdf1e1f48a14490f496231bf21cb24d864c279d58e2a408f6b1d1113435007","observation_id":"8bb5e626-134a-475d-9179-74e5dfaa2c73","resolution":{"observed_at":"2026-08-06T16:45:55.436801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:54.316832Z","title":"Video enhancement with task-oriented flow,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:54.316832Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:3ab1f7554b87061cf5d282f64a5bd114dd84ee64cc58ba122390af337a1479fd","observation_id":"c93bb14d-866d-450a-aaea-3dc1355e87b4","resolution":{"observed_at":"2026-08-06T16:45:54.316832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:55.149001Z","title":"FMA: A dataset for music analysis,","venue":null,"work_id":"2ad3974c-e38d-4cc8-9b9a-aa03d4e8eb49","year":null},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:54.433749Z"},"links":{"citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:38f2bcd7b4a34d28ed7d6bcd4592ee51f0236f5eb307ad3d55bebd71dbd46dca","observation_id":"3dcdb2be-cec6-4c2c-b9ec-e1ce30e325c3","resolution":{"observed_at":"2026-08-06T16:45:55.220089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-08-14T21:26:53.042056Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-06T16:45:54.536804Z","title":"Available: https://arxiv.org/abs/1612.01840","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:54.536804Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2507.12723"},"observation_digest":"sha256:200a901fb0a19ebd15a33b1c28e340e2c48677236b87b01310d82c2e4ee574fc","observation_id":"4fee4e4e-2041-4248-86d3-983a29494207","resolution":{"observed_at":"2026-08-06T16:45:54.536804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.12723","last_updated":"2025-07-17T02:02:39Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T03:46:49.521791Z","submitted_at":"2025-07-17T02:02:39Z","title":"Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2507.12723."}