{"as_of":"2026-08-13T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bdeff37827e9f93f15eedeb04666cecf227ab12fff9770668c16ec1331ce4604","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:34:07.920960Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18748/citation-record","integrity":"/paper/2412.18748/integrity","json":"/paper/2412.18748/citation-record.json","paper":"/paper/2412.18748"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.432936Z","title":"Neural dubber: Dubbing for videos according to scripts,","venue":null,"work_id":"d3dd0ed3-6dab-45df-a4cf-434bab6f6e4d","year":2021},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.758539Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:1661825f8bf6077bb16c5a43bb2567836f183427589318fc9d35cf18e7e30005","observation_id":"1764f373-12b8-4dc3-9752-73911e284520","resolution":{"observed_at":"2026-08-11T04:34:08.436892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.419652Z","title":"Prosody Modeling with 3D Visual Information for Expressive Video Dubbing,","venue":null,"work_id":"c292c2ca-1e99-4520-8337-59552a03d989","year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.763464Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:f834b5cf713e5ea231de5b9a6ad86b9ea8beacf53e79d6c14e15f7f5aa50d07c","observation_id":"ec54db63-1103-45d6-a4df-f48b18939241","resolution":{"observed_at":"2026-08-11T04:34:08.423769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12636","last_updated":"2024-07-02T03:42:36Z","snapshot_observed_at":"2026-08-13T04:14:55.253291Z","submitted_at":"2024-02-20T01:28:34Z","title":"StyleDubber: Towards Multi-Scale Style Learning for Movie Dubbing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12636","snapshot_observed_at":"2026-08-11T04:34:07.768994Z","title":"Styledubber: Towards multi-scale style learning for movie dubbing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.768994Z"},"links":{"cited_paper":"/paper/2402.12636","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:ca9e0c55946f11a510b608bacd77e3b54e77356c558cebc5386d3a072fde974f","observation_id":"532688cd-8e25-4821-9be8-8dccc87e6896","resolution":{"observed_at":"2026-08-11T04:34:07.768994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.406292Z","title":"V2c: Visual voice cloning,","venue":null,"work_id":"69e04222-d87c-40c6-82fe-1f9fd3accff6","year":2022},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.774060Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:f00fcb0e42300e426f3f61aec16e403b330eecc0a568ab5b8bf3f2d76b65f227","observation_id":"d8e07d3b-dd93-47d1-a79c-27271ebc6bc6","resolution":{"observed_at":"2026-08-11T04:34:08.410226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.392546Z","title":"From speaker to dubber: Movie dubbing with prosody and duration consistency learning,","venue":null,"work_id":"cb54df0e-6e25-4d0c-8599-a9054d010d73","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.778636Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:e40684c26c3246cb22e9e074f13915b2ff9736b18e15eee422d06f8285a44cab","observation_id":"6d8cef30-e21c-4608-acba-195e24dab3aa","resolution":{"observed_at":"2026-08-11T04:34:08.397469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08988","last_updated":"2025-04-25T01:06:20Z","snapshot_observed_at":"2026-08-13T01:16:10.405871Z","submitted_at":"2024-12-12T06:39:49Z","title":"EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08988","snapshot_observed_at":"2026-08-11T04:34:07.783191Z","title":"Emodubber: Towards high quality and emotion controllable movie dubbing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.783191Z"},"links":{"cited_paper":"/paper/2412.08988","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:9d2d6284eeceaf60d5354568fa6775f4c2c25345cedaa79042d9d22a2f99711a","observation_id":"3d42e29e-c8bc-407d-8f4b-c075f902d825","resolution":{"observed_at":"2026-08-11T04:34:07.783191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17005","last_updated":"2023-06-29T15:02:22Z","snapshot_observed_at":"2026-08-13T01:16:39.364493Z","submitted_at":"2023-06-29T15:02:22Z","title":"High-Quality Automatic Voice Over with Accurate Alignment: Supervision through Self-Supervised Discrete Speech Units","version":1},"cited_work":{"arxiv_id":"2306.17005","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.17005","snapshot_observed_at":"2026-08-11T04:34:08.110203Z","title":"High-Quality Automatic Voice Over with Accurate Alignment: Supervision through Self-Supervised Discrete Speech Units","venue":"eess.AS","work_id":"23147c2e-b629-45f0-85de-15e88f6e085a","year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.788553Z"},"links":{"cited_paper":"/paper/2306.17005","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:bb07b2cf6ab154e9e3b8ea9903bc864d2e927f18f387ed6e7830d0ccabffa9bf","observation_id":"076a3700-5358-47d4-b854-4be31dabfaa0","resolution":{"observed_at":"2026-08-11T04:34:08.115409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08802","last_updated":"2024-06-13T04:36:34Z","snapshot_observed_at":"2026-08-13T01:16:40.148433Z","submitted_at":"2024-06-13T04:36:34Z","title":"DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08802","snapshot_observed_at":"2026-08-11T04:34:07.793247Z","title":"Dubwise: Video-guided speech duration control in multimodal llm- based text-to-speech for dubbing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.793247Z"},"links":{"cited_paper":"/paper/2406.08802","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:a76fa2d784e76bbfc51e498202648f55f3168906d80cd47c67ff19616c66ba41","observation_id":"a9d75b0b-ad46-4407-adea-1b9b0a18b657","resolution":{"observed_at":"2026-08-11T04:34:07.793247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.797858Z","title":"More than words: In-the-wild visually-driven prosody for text-to-speech,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.797858Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:089c6397dcbfd6b539a339a7c573fceed28b6cdd5aac5d9783ea292ce2c7c0a7","observation_id":"10c9ed64-3d2a-46ff-baba-9e02046012bd","resolution":{"observed_at":"2026-08-11T04:34:07.797858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.369965Z","title":"Learning to dub movies via hierarchical prosody models,","venue":null,"work_id":"10cfb917-69d0-46f4-8860-7ccc308c8d7e","year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.803591Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:59290aa2d25bdf9733f687f231f26262ced2f61f2d6b45ac02bc2537020fd666","observation_id":"ec185281-1a87-4f95-95d9-0d25343fd108","resolution":{"observed_at":"2026-08-11T04:34:08.374498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11593","last_updated":"2024-09-04T01:25:55Z","snapshot_observed_at":"2026-08-12T22:59:59.869509Z","submitted_at":"2024-08-21T12:59:42Z","title":"MCDubber: Multimodal Context-Aware Expressive Video Dubbing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11593","snapshot_observed_at":"2026-08-11T04:34:07.808156Z","title":"Mcdubber: Multimodal context-aware expressive video dubbing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.808156Z"},"links":{"cited_paper":"/paper/2408.11593","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:3dbcc0c07aa530d5b0447202b53e3b91b4a991f10720606637234e8abd084454","observation_id":"eb396945-041d-4a16-9cc0-c33c93495eeb","resolution":{"observed_at":"2026-08-11T04:34:07.808156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.354892Z","title":"To- wards Multi-Scale Speaking Style Modelling with Hierarchical Context Information for Mandarin Speech Synthesis,","venue":null,"work_id":"1eefca02-fe36-4d7d-b727-d92ecdab27f5","year":2022},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.813123Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:25eb66a18caf8fc6d0d907b27e86d2b071bd627a10481a3e3702954c9a314b24","observation_id":"5b6c150b-4206-40f6-9818-d1ee99cd7d13","resolution":{"observed_at":"2026-08-11T04:34:08.359596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.341056Z","title":"Msstyletts: Multi-scale style modeling with hierarchical context infor- mation for expressive speech synthesis,","venue":null,"work_id":"7e7b35f8-032f-4cb8-b58c-e359aef3ad62","year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.817279Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:5dd49892a358e986f5276f35fe0e4454cc9113b721b1a187bc0657541f22d011","observation_id":"0d71bcdc-de81-40a7-9b32-2f5b9f125c49","resolution":{"observed_at":"2026-08-11T04:34:08.345484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.326140Z","title":"Unsupervised multi-scale expressive speaking style modeling with hierarchical context information for audiobook speech synthesis,","venue":null,"work_id":"8197bc5d-64d3-4745-8818-601c59ddac07","year":2022},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.821403Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:3a9f342f7508a143504d313989e358f1d9fba15af9f49afa787daff9c005cb20","observation_id":"688ab624-d08f-4aa7-9a80-136595686d56","resolution":{"observed_at":"2026-08-11T04:34:08.331259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.825600Z","title":"Mae-dfer: Efficient masked au- toencoder for self-supervised dynamic facial expression recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.825600Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:e7b47afb46d5d1f993dd177da846957c2fc38e9527798c0d1586699422666fe7","observation_id":"edfbc176-425b-45b1-8274-b302725aed01","resolution":{"observed_at":"2026-08-11T04:34:07.825600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.830150Z","title":"Dfew: A large-scale database for recognizing dynamic facial expressions in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.830150Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:de3259af4c3c4c8ec2254b86941a2b09eea9a2e71f3aa697b3e6b117c8ef4542","observation_id":"37cda586-b2a8-43b7-a36e-3a46b127c0eb","resolution":{"observed_at":"2026-08-11T04:34:07.830150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.834265Z","title":"Estimation of continuous valence and arousal levels from faces in naturalistic conditions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.834265Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:2a8c29b14a458bb7c5e2b75caea3ff124359c670f2a5c1dad6f29082d93a29fc","observation_id":"0a5f69df-dd96-4e6b-99c6-b53bed2baedc","resolution":{"observed_at":"2026-08-11T04:34:07.834265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03521","last_updated":"2021-04-08T05:50:09Z","snapshot_observed_at":"2026-08-11T16:14:09.597441Z","submitted_at":"2021-04-08T05:50:09Z","title":"Towards Multi-Scale Style Control for Expressive Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2104.03521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.03521","snapshot_observed_at":"2026-08-11T04:34:08.061442Z","title":"Towards Multi-Scale Style Control for Expressive Speech Synthesis","venue":"cs.SD","work_id":"d4bb2001-f1b3-449c-88d1-bd83584466f5","year":2021},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.838476Z"},"links":{"cited_paper":"/paper/2104.03521","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:6f865f4df86106608a27a813fe46cfc375ce2c70f47e0d64714b1de5446717ae","observation_id":"ce456576-3b5c-4c7f-83c9-3b088757a057","resolution":{"observed_at":"2026-08-11T04:34:08.066385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.843110Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.843110Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:84d0a0651d2ac5aa9ff09a71eba23c1cfa21ff28d582623675d7c92a12a189b9","observation_id":"f6da0022-bbc2-459a-b689-5e853cf2a636","resolution":{"observed_at":"2026-08-11T04:34:07.843110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.277443Z","title":"Emotion-english-roberta-large,","venue":null,"work_id":"3ea95d70-b7f4-460d-b98d-8e1c9fee08a7","year":2021},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.847568Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:8f38e857af75f83b974f3712a9688a3b3cad350dce6ef082000641c336901ea2","observation_id":"60da494e-3e91-4d06-9a2b-37f6263c0626","resolution":{"observed_at":"2026-08-11T04:34:08.281979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-11T04:34:07.851676Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.851676Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:071d250e3b3582b4413cde7e0cf14cdb719b485d9a70de147499823b0c733d20","observation_id":"8bd7cb49-60bb-4b7c-af54-203db6ed751b","resolution":{"observed_at":"2026-08-11T04:34:07.851676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.856108Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.856108Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:00425ebfa6f974c1ca5880636c2b846d8da9df98f77407880eb52e8de6887750","observation_id":"bf5a25f9-586a-43d5-b5cb-77c6bbd199c2","resolution":{"observed_at":"2026-08-11T04:34:07.856108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.860218Z","title":"Iemocap: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.860218Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:503e45096783f2c949836e6d0cea2413219df393b2e5f97bf2d66918d16c2211","observation_id":"0f6185fe-dba4-47dd-b786-bceae8be4482","resolution":{"observed_at":"2026-08-11T04:34:07.860218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06646","last_updated":"2024-06-10T02:08:25Z","snapshot_observed_at":"2026-08-12T23:46:48.049761Z","submitted_at":"2024-06-10T02:08:25Z","title":"Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge","version":1},"cited_work":{"arxiv_id":"2406.06646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06646","snapshot_observed_at":"2026-08-11T04:34:08.027194Z","title":"Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge","venue":"eess.AS","work_id":"e3bd0ede-9990-4144-8708-e59d45da12e0","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.863878Z"},"links":{"cited_paper":"/paper/2406.06646","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:051f6660474ee0ca11b33125378e9c8755b0f4c4fa25e5853274838f48ffa726","observation_id":"8f05115e-8c98-41a0-8900-5ef51a094696","resolution":{"observed_at":"2026-08-11T04:34:08.031588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10903","last_updated":"2018-02-04T19:13:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-10-30T12:41:12Z","title":"Graph Attention Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10903","snapshot_observed_at":"2026-08-11T04:34:07.868501Z","title":"Graph attention networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.868501Z"},"links":{"cited_paper":"/paper/1710.10903","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:276bdae8588e12838aef12cd5b3da2c7096ab2a0266f0ecedcc87f36d0dfc913","observation_id":"98ea45bd-36ee-4d5e-83fa-c11bcb31e692","resolution":{"observed_at":"2026-08-11T04:34:07.868501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.872926Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.872926Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:0946adf287ff75444a1b6e1d60cd9c4dddffb0648cab7a1d96c260bb08e8e219","observation_id":"e8d6a142-b366-41a0-9501-e5f13c3e9403","resolution":{"observed_at":"2026-08-11T04:34:07.872926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.236596Z","title":"A method for fundamental frequency estimation and voicing decision: Application to infant utterances recorded in real acoustical environments,","venue":null,"work_id":"0a3321ff-d6aa-4825-8632-9ef998cdfc02","year":2008},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.877073Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:a27ac1ac230634c56e7b561adf69331430f32905475d59571bfc3c187478724c","observation_id":"2f32eebf-0417-427d-917a-9b4282893bbb","resolution":{"observed_at":"2026-08-11T04:34:08.241427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.222121Z","title":"Reducing f0 frame error of f0 tracking algorithms under noisy conditions with an unvoiced/voiced classification frontend,","venue":null,"work_id":"10ba46a6-e3f0-4dba-8349-c56bd9013074","year":2009},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.881464Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:d9212cbe28e20ac5e5a5bc932709fc9103d51b86a0c42f93bedf6924a52e6b89","observation_id":"bd2a6eaf-eeac-401a-9bc7-d319b635a0c3","resolution":{"observed_at":"2026-08-11T04:34:08.226734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.885819Z","title":"Out of time: automated lip sync in the wild,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.885819Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:df94f0e5d093d09c1e86e53e7049647671665d5aa60efe1a0517bfb840b1d81d","observation_id":"6543205f-33e0-49c2-a923-6013d7cf04da","resolution":{"observed_at":"2026-08-11T04:34:07.885819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.199310Z","title":"A lip sync expert is all you need for speech to lip generation in the wild,","venue":null,"work_id":"0eefc0f7-f2e7-4c4d-bdb6-16c7ac7e7b80","year":2020},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.890030Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:32a2c823b7189c0f4a366d7cf0be931d1410f8109f19e4f7260d8a99d992ade6","observation_id":"05c1dd58-9811-46ec-964f-baf9744ac89a","resolution":{"observed_at":"2026-08-11T04:34:08.203889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.894310Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.894310Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:3fbe0a32fca96dbc113a0f57ed94033ff0b9c637d11f40bb5690ab55d6185c26","observation_id":"94fe868d-8b6d-4530-a256-6b0d5e4926d7","resolution":{"observed_at":"2026-08-11T04:34:07.894310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.177361Z","title":"Text-to-speech for low-resource agglutinative language with morphology-aware language model pre-training,","venue":null,"work_id":"e8918048-9049-4a03-8173-cd858d6a507d","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.898590Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:f2ce798c1fdda1d7d514d7ff4b92ce631160dfcf65eebe36b341785a0b5bfaea","observation_id":"d49774c0-f3e4-4156-ad62-43b9ea9708e5","resolution":{"observed_at":"2026-08-11T04:34:08.181646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14101","last_updated":"2024-12-23T08:57:37Z","snapshot_observed_at":"2026-08-12T22:20:27.972073Z","submitted_at":"2024-10-18T00:46:18Z","title":"Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2410.14101","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14101","snapshot_observed_at":"2026-08-11T04:34:07.992797Z","title":"Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech","venue":"cs.SD","work_id":"782426f5-7c66-4b5a-ad4a-6fa581aacb39","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.902789Z"},"links":{"cited_paper":"/paper/2410.14101","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:717399aeb33be7e983c0ba7a38b9ca7d6774db03896d36886e06b7894d8d8364","observation_id":"0deab94c-ff93-4883-8c05-0eb527827fc1","resolution":{"observed_at":"2026-08-11T04:34:07.997986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"cited_work":{"arxiv_id":"2412.11409","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11409","snapshot_observed_at":"2026-08-11T04:34:07.970750Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","venue":"cs.CV","work_id":"ca9ed445-7bc9-4d3a-9ec6-556955fe8590","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.907336Z"},"links":{"cited_paper":"/paper/2412.11409","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:b6b685c04b8209f128c8cff9e590d88fb37cdc3068d8b9917505674829dd2a34","observation_id":"6ece83f0-cdae-48d8-b707-a9faaa591b34","resolution":{"observed_at":"2026-08-11T04:34:07.977433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09524","last_updated":"2024-10-12T13:02:31Z","snapshot_observed_at":"2026-08-12T22:24:47.366088Z","submitted_at":"2024-10-12T13:02:31Z","title":"Emphasis Rendering for Conversational Text-to-Speech with Multi-modal Multi-scale Context Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09524","snapshot_observed_at":"2026-08-11T04:34:07.911899Z","title":"Emphasis rendering for conversational text-to-speech with multi-modal multi-scale context modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.911899Z"},"links":{"cited_paper":"/paper/2410.09524","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:6ba48641c7300f6fbb49383da578372d1e2c55b4171cc41640b675148ce1fc50","observation_id":"6be81104-14f3-459f-ab46-f3adbaabcb2e","resolution":{"observed_at":"2026-08-11T04:34:07.911899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.916601Z","title":"Generative expressive conversational speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.916601Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:3527b0c24f1f5829be435c0b84c01afed0ca4d5a6f4f9287296a9d121cedbb0a","observation_id":"e5ba2496-6766-4eea-8122-51f259e4ce91","resolution":{"observed_at":"2026-08-11T04:34:07.916601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.154604Z","title":"Fctalker: Fine and coarse grained context modeling for expressive conversational speech synthesis,","venue":null,"work_id":"db5e9ca7-9e16-4211-8534-51b726835972","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.920960Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:87803eea2043bfe36c828ea03819887c0064f0fc5d0fe39f81d651cad2f22592","observation_id":"ee44814d-3815-4c23-8edb-3d0aa133750c","resolution":{"observed_at":"2026-08-11T04:34:08.159255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":5,"verified_fuzzy":14},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2412.18748."}