{"as_of":"2026-08-14T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:617450d5acab79a8fd1646a57db272ca16b5d719b44c6379285110977414e71b","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T06:59:35.258176Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02799/citation-record","integrity":"/paper/2607.02799/integrity","json":"/paper/2607.02799/citation-record.json","paper":"/paper/2607.02799"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:4ec345b2d73deaa1e1eec0f412660904006a2e809438700c5e6b70b479136523","observation_id":"16231457-b9c2-4edd-b904-4b1aed054137","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:762d7c50b65c667cbc126d7ff5934ee48e3f579e412b2c0ad7c6a75dae6d31a3","observation_id":"29c164ec-6152-4ef6-b0ec-ac56669ac259","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: 2024 IEEE Conference Virtual Reality and 3D User Interfaces (VR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:177a717060f5c3e38fbab71c7ff1833abc51df1e5a1fac91fa0ae03b259563b6","observation_id":"5debd6bc-45d1-4133-be40-861b3a56d09b","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-12T23:47:54.413535Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2406.04904 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:933e65b86fdbbeaae617742edb371703580364ead4fb1e707f914a3946d3822c","observation_id":"469e6569-08bc-43f5-ba0c-b09e242ddf96","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Pro- ceedings of the IEEE/CVF International Conference on Computer Vision (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:695346ea098059b76812bfa55be4f9b9230066fc6194f64014493ffe9e3c0423","observation_id":"a7f7f58f-2276-4993-a45a-fe34458d55a7","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Image and Vision Computing p","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:04b3581520d2412ec70d335c9dcc7982f29a92c052ec43d0831ead3c324721a8","observation_id":"fc640013-45d0-4fca-bdbc-f3c8a9f11b3f","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: 2020 twelfth international conference on quality of multimedia experience (QoMEX)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:6577fd75c7eee19882550618b57f74166c529f43e088a3b5ce15ded58041f78e","observation_id":"9dfefea7-030c-4933-9c7f-f671bfe6718f","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:0c94b168ce2980160a52b901622979c20938e43bdad1ef574ed5d98e57afbe13","observation_id":"2b418585-7b48-4fe3-b487-ea1318105f20","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the SIGGRAPH Asia 2025 Conference Papers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:7e11e5ca7c7dd2831179c33311b196a640fa50dd5ac0b6f6d86c52b0a500e84d","observation_id":"c1657afe-ac24-47c7-adab-cbe1f0605ad4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:82b2d833ca33c373dafa885668da2a6e609b19945462607484c06ff3b03f398c","observation_id":"3f2554ed-d8a0-466d-b23a-381973ee498d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:3d7a27c7db327689763882e2e2c745c7f431cb0f4941f81bfbab519e7e5f3765","observation_id":"c930a273-6912-4c87-8546-06952f4f07f6","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:6eae3d75e157049eda6eda9f1fa869d342651a6d784f8c016bab071258df3f3a","observation_id":"c2fe8359-3656-4955-b889-c8b296cf79da","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Nature Eye39(2), 215–216 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:f8664dc13581db3de7370ee78d82e47e015a2f0be87d225bec86c5ba0e9cdfa9","observation_id":"5cd87e4a-f0a7-454f-89cb-aa1c0354218b","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2407.21783 (2024) Conversational Human Audio-visual Talking Dialogue Generation 17","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:fc9b4a976c21b6fe4ba8cd9c69fb177551f213deb977df366649a9ccc9ce5295","observation_id":"301cca55-37dc-43b5-8fb5-271bf9b856e4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceed- ings of the 63rd Annual Meeting of the Association for Computational Linguistics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:92e4911b6f62ca0a197a6c1f7150eafae00db44494597cffabadc8e6bbf246dd","observation_id":"a0fabf44-0b21-48bc-9eac-910af9b4a693","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2507.06261 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:8ed99ad19beaf1e48c148bd7474b6754580c0451f125e8b7aafdf1b617634ac2","observation_id":"6c1ee824-e5e9-4088-b3d1-2191d4c8a2e0","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:4c09a6cd8a9ba865c4583e2fba3bcb293674a31e3f374cbdec2a91a828e4e59a","observation_id":"e465180d-23bd-43cc-8b24-ac00f20a25f4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Nature645(8081), 633–638 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:021f124656b6ca3e918d301797933d49e7347243f0f82d5b0158e24fd9791ea0","observation_id":"ad94245c-ba64-4d58-8a6c-5cb0932d121b","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: European Conference on Com- puter Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:0c7de747993881ca3c9bb7363080015a6407e846208da6b61fc9002aa35b6302","observation_id":"3abec7bc-cbd9-4dd9-a6ba-f9d4cfe8db44","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"International Conference on Learning Representations (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:3cc93b4e236865fc947af0996f8f30186d4079f879854f8fc7d1d28176c2385c","observation_id":"429fef16-52a0-4093-9df4-a5669481f262","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:35ad1fedea868c06c9e589e9def7e3be33677bb9265fec62e713aa1c6a3783a5","observation_id":"eeb403fa-eefe-42e8-96b6-b38bbe6d108d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2208.01626 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:dda6cf6d42ef5c822a62546ad242c85b30a14b5cf0e0f84991a1a9479fce45cd","observation_id":"c091924a-8d13-459f-9c99-07c4419519d0","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Ad- vances in Neural Information Processing Systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:dcd54f15637f1d2c155088ef45a3b12c94eea83195744f18dfc30d22486c971d","observation_id":"3e802df3-334b-4288-bc80-586de0bcca99","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 33rd ACM Interna- tional Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:109225d2ccb6a42c5630a71b122f0af6a16b2c02747f4bb5b5af5902c796993a","observation_id":"7779227b-8250-4dc7-a3a4-64047774830e","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2506.17298 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:20dd8c7ce494a304297b2c0fbede0e5cc28914fa78e1c494ebd786243edf74b8","observation_id":"be5ce976-1c56-44c3-9604-c43441071750","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:41b46e4710aa4021a847643f2fb2a9714a933d22c53bd0f3f51a9cc8bf623c31","observation_id":"c59a32e7-7a47-4de1-9318-3a6c93eab075","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2512.20296 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:d2667c0e1916a6770c3464e18209f261a4af34814901feb48eb0ff4449565b69","observation_id":"e570bf38-84fb-464e-be63-76a1ee5b5d18","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:524074fb387471720afdc7efc44dc4ea00d4dcc519c477083c38c755dc564510","observation_id":"7a707019-3222-4338-8485-3bb3c1524174","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Song et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:284ec5b43616f957e960bb9a73a5bde7893c442519a8f7ab403c864dfb705216","observation_id":"03287d08-d986-4b1f-854b-1a90e352b0e8","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-08-11T15:05:41.299576Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19978","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2505.19978 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2505.19978","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:12acb5cc6c0eb570796c99e9fc43f5a0980515ff1b6989357d1bbea547f6b553","observation_id":"4c03c341-584d-49d8-96e2-1f86307a08dc","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies8(2), 1–36 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:df3a4c2d83ff7a64f515cdb0430007128635aecd69710d77903e751fec356638","observation_id":"cd3fe4f5-3f6e-43e5-b142-49030ccc0451","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of IEEE pacific rim conference on communications comput- ers and signal processing","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:108dc53c8d94b7ee5dfdc266a79a93e530629647880c90ae1a50db4338e8440a","observation_id":"b88fd506-9c9b-4134-87af-ad780be052da","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23552","last_updated":"2026-05-15T04:47:28Z","snapshot_observed_at":"2026-07-06T21:49:33.849898Z","submitted_at":"2025-06-30T06:51:40Z","title":"JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23552","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2506.23552 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2506.23552","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:8ac83d23066293458bf841285466de3d6bfa1f4db4397931c258acc9005edaac","observation_id":"edb16883-9a58-4305-a172-7b37268a11d4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-14T04:53:10.712854Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2412.09262 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:89f2f686c140fb841f938e3934fc31a2ee1080744311a7eb5c54a618805b6444","observation_id":"a55db7b3-04b5-4057-a81b-560e4ef632c3","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Advances in Neural Information Processing Systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:8e78d97fe856183d6379970a272fe53af09bcb8f4649f529ff4a08cf2d5451a6","observation_id":"87973081-0baa-4911-961b-76c824bf4102","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Artificial Intelligence308, 103714 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:559b1c06121ce268eb067efa6dd954a7de3951129a8690c7f303095fbe4a364e","observation_id":"a4306348-1389-4a61-b369-4f3e3c3274c8","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: 2024 IEEE 18th International Conference on Automatic Face and Gesture Recog- nition (FG)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:b11190d9ae6b5ea6e0b0005c7a0bdce47f968c36d9544f60e7f5eab4517890a3","observation_id":"e8e8c560-45ef-46df-a7dc-0e1001ccd65c","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-14T09:13:56.327308Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2502.04328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:1dbd34dae69ea1b28431fd92f762585b5c8d45d5bd4f76db64763e320c2f30f1","observation_id":"367c2df0-13f8-499a-b7d2-0f7a77a9917a","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"IEEE Transactions on Visualization and Computer Graphics (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:48fac628d5b61d8ae45421a472f4c7aa8ed84c553ea78a3ed3c80ed9155b8f12","observation_id":"22755e79-115e-414f-87be-571aa0a7e6a4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 33rd ACM Interna- tional Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:c2cff6599c739c61d462704401b4f2196503f75cfe25740cb6ce0ebe64ee976d","observation_id":"9edea1c7-818c-472a-b600-73b0f09452ee","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01900","last_updated":"2024-06-07T02:57:36Z","snapshot_observed_at":"2026-08-12T23:50:59.626882Z","submitted_at":"2024-06-04T02:05:57Z","title":"Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01900","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2406.01900 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2406.01900","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:7854338dfc05c37e48ad9c978297fddff84a2e0a1844e5ae84a8db8482cb6fa6","observation_id":"a5c68731-bcdb-4a43-9d72-00d6cc501fa4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:777ecde9c7f276f84d7b45006e456741b935981335ed9ddc610768557e3572e9","observation_id":"839f2359-8d28-441d-a7ed-55bec0a699f2","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:4db3583d48abcf60b0a25ae3083ba81cbc63793b64920df3e45581c7fd7f831c","observation_id":"72749509-e10d-4090-9f81-d1867f3c5e0b","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: 2024 IEEE 18th International Conference on Automatic Face and Gesture Recognition (FG)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:2ce7eceee7b86b49c0bae019ef826e477d9c77212e50188fb8dbdfe301deaafc","observation_id":"6f305d61-f7aa-41d1-91c4-75be7ed9329f","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceed- ings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:f3fe01db699eb6184a9121ccc923e63897f9500356021c04ee75fc706891ab4d","observation_id":"ebe74958-f498-4595-ba5b-da33a3d5d276","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:26cb2b1ee8045781448b64e05f83eb5fd990cfe3254aa9dbbdf1a5e148c853ac","observation_id":"935abe57-e289-4b00-9ea4-06ad18a28d89","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: European Con- ference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:0e1bee4d8f4b7b42f1a7446630fb0640e4585acc224a233f7c88cdde267f64a4","observation_id":"1763cd38-7e5a-473a-8421-edf50e53fc42","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:c3fde75e6d6e91c1f2246e94c3f3a9ce77f8651023c871b677fe0e751c065be0","observation_id":"d38e47b7-68d5-49c2-85b9-c038e3121311","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 28th ACM international conference on multimedia","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:d213bf2eecf774c459109d49c7ccc57ebab46effd7fc273a2f69cb0d826bf58c","observation_id":"7da31929-0993-4755-aff7-1c2d7fdfc869","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21144","last_updated":"2025-03-27T04:18:53Z","snapshot_observed_at":"2026-08-10T20:18:59.017739Z","submitted_at":"2025-03-27T04:18:53Z","title":"ChatAnyone: Stylized Real-time Portrait Video Generation with Hierarchical Motion Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21144","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2503.21144 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2503.21144","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:2788873a04f89419a1892bf3d4eac6420187aa223704666234e393f36a1f7495","observation_id":"d09e33ef-922d-4587-af53-1289a0c9e8fc","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2505.09388 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:898e70be7e6b1a25ef8d1929339fd1c2961be942683e81eccbcd66ea8e66d09c","observation_id":"996f768c-7235-46f8-bb64-4e448b3eac3d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-14T05:20:02.331354Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2106.04624 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:66f0ff51f2c9fb333dd5f9362c6a936370709b2ccd42ddd2610573b6ff9539de","observation_id":"f1a3da29-8750-4303-98f5-833a79ab54ee","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:bb2e9763139c19a40c59f1c4f8cdbd8079d7a51fea0bb5110d11c7a9afa2bf63","observation_id":"46d1033b-ef3e-4185-87c2-5c896a3c70cf","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (Oc- tober 2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:d6d8b0b76d1841f1b2ca16d79652362844b47b792d3a51c28d49305fe1cfdc7e","observation_id":"9fdc273b-e58a-45d3-b932-1b5e34f278e1","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"IEEE Transactions on Affective Computing14(4), 3048–3065 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:aecef6e2e69ad5dcd532e6d265fe2a557350d3802ce7ff9ce93c14565c9afbfa","observation_id":"9a3e8360-1d76-477b-b4a5-598e1fcfea0d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"ACM Multimedia 2025 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:79b1f02088479101afbfdbaf4fcf2dea4ad3f1b44f59712198cff6bc61377e21","observation_id":"7664d177-6ab0-404d-8575-cf0278b9b708","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 31st ACM International Conference on Multimedia","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:6dc5621f5c8ed016a21197cb99048eab9c4d5900f06a72eb91439632feaa57b1","observation_id":"900e048a-05bd-425b-ae8b-be00b0d047b0","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: 2024 IEEE 18th International Conference on Automatic Face and Gesture Recognition (FG)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:fb65af6e6bcdfb032787e7039110dbca19c4cee9ea71e2bdd19dc1052095c8b1","observation_id":"466a5fd1-4d97-4337-963c-de8c039a8a47","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"IEEE Transactions on Visualization and Computer Graphics (2024) 20 J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:0ece91a2f2dfa7bd4372136f396f2eeb6dd07eca1cff35efdda9fac341726abb","observation_id":"0a2642a2-8fd2-4734-921b-8719fd409f4b","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:ae278a53e1a176f8f8b301e6a60aa81b230174f82ee87a1851907c1b10624d5c","observation_id":"f759af64-f4f5-41a5-b1d8-bbac14338408","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:9520d9ca40f444fb8f885f3840a106c94acf940b764bcadc545fb4e1c6210f26","observation_id":"d8bf0cd6-b995-46dc-8403-2ecebb77b7df","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:1812.01717 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:29555ea6f9177dde63d2c8616b1c8dba2fc1acad5c3edb97fe98dbcd58d16d04","observation_id":"347ad915-a80a-4f29-88ab-67fa58ceb9bd","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02490","last_updated":"2024-03-26T03:41:26Z","snapshot_observed_at":"2026-08-13T12:32:07.244613Z","submitted_at":"2023-03-04T20:08:57Z","title":"Diffusion Models Generate Images Like Painters: an Analytical Theory of Outline First, Details Later","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02490","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2303.02490 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2303.02490","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:1d119cb5fe47b4c3c130606fe7044f02bd017eb93cc5ffffdd9169ac5cd4cca3","observation_id":"b2da9b1c-cee5-4825-8063-ad06e0a83be1","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:496d75b4f584a4d463ea82db5032b7dbb1ee688ce8e01ef6d6c3b59b97d1338f","observation_id":"477671db-9fbb-4bc1-b8e1-0fa8d8db0177","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03017","last_updated":"2025-01-26T01:52:22Z","snapshot_observed_at":"2026-08-12T22:31:11.274899Z","submitted_at":"2024-10-03T21:58:39Z","title":"Tutor CoPilot: A Human-AI Approach for Scaling Real-Time Expertise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03017","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2410.03017 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2410.03017","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:8fd263fb94ab860d2dceb4e968ccfda0ca77b5801a880a36318922e35cb7054c","observation_id":"7f87a648-6256-4115-8cf7-89675874cb52","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Advances in Neural Information Processing Systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:768cf4a652779ba30a8b80b188b37f4394e28cc5f4c9faaa01f165d47b560891","observation_id":"e1ecd6ee-19bb-44e7-b3f3-c2b5ff528ea1","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:2b54964c5a24ef701592781500159792672a1f8f1abf667d84bfd2c7ca52f619","observation_id":"b5b1bab0-e2a0-4b0f-8fb5-20cf7b73186a","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-08-13T00:29:00.053734Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2404.10667 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:d3b1c261cd3a354548cf1f3143b017b8a9b2f3f3018836e94ed14efbd0ebb530","observation_id":"34c30995-038f-4a29-9c72-3de725794378","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"IEEE Transactions on Affective Computing (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:9d31f51fe5791ad9815ce98e7bd934be4efc36dafc28717b9e8d40a7a5a9efe1","observation_id":"b94a50aa-7b85-4af3-8c77-a02b229cbf99","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Visual Intelligence2(1), 24 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:4d3562f6fba23881df62d9636e245cb920ecf58d1703c8c4bf8346aba315ef1d","observation_id":"14e72780-1807-42e0-baa0-cf49d2c3546d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2406.12793 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:c24bb925720202854b86e30bb27d54e9a9f4a0d5d7e2de59c7394dba625c3e5d","observation_id":"e38f7226-db7d-4521-aea7-b9656f02248d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:f3d99e90816b803547f0f3255d15987dfc37d2166a58e4cb561c044da36796d9","observation_id":"f0ba440f-6fb5-415a-8602-68c282edcd80","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: International Conference on Learning Representations (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:ec1d579a6b8108675df7d989bb07aeab5d30f8664f7adff3359e8cdd7de865b1","observation_id":"cf0597de-9447-4aef-8c2e-5e8271cc473d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:5a96ebc78baa5083c7c085d25cd81bf8a2a56eb9c8fddbf6fa5536cbcfdb01d5","observation_id":"36e5e9a7-c810-4786-96eb-2c3d4fba3e8f","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:766aa532b2f7456de1b448b82f8c42ec6723e488d9d6d595beccca87ad4b4cd3","observation_id":"00dc2844-9437-41b9-808f-b8aaac57df9a","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:eddef7e079e5e9ef59f7a46d3396bf27f6a604019f10481c9e0f9cb360f5c770","observation_id":"a9c5af27-da19-4da2-9cfb-96b0ad46aa31","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 32nd ACM International Conference on Multimedia (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:11e6c49a7788b012b5ee5df74616303efb9e120917d7e9856090aeb15fafe07a","observation_id":"e9a61f71-f202-4fdf-9de3-3e8d278c5902","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:73a92b47ea54d6d2804a87a313564edfba75826314f5d1b17d2c3aaeba71220e","observation_id":"0ec7758c-fb42-4344-a5c3-5d62a71b1344","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":78,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2607.02799."}