{"as_of":"2026-08-19T08:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26333a5913d056623900f892d30d1d7f5eb42eeb236877e2a47df33fde41fbee","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:41:07.918981Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T01:23:09.117957Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12847","snapshot_observed_at":"2026-08-01T10:37:54.999164Z","title":"idit-hoi: Inpainting-based hand object interaction reenactment via video diffusion transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20174","last_updated":"2026-07-22T14:06:39Z","snapshot_observed_at":"2026-08-14T15:44:28.290456Z","submitted_at":"2026-07-22T14:06:39Z","title":"StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T10:37:54.999164Z"},"links":{"cited_paper":"/paper/2506.12847","citing_paper":"/paper/2607.20174"},"observation_digest":"sha256:be5a3a4adcad349e32ea5f38b0f2673dd0735ba3d0c4dd82275451ef7bc849da","observation_id":"7addece3-57dc-4b59-ad74-400167705ffc","resolution":{"observed_at":"2026-08-01T10:37:54.999164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12847","snapshot_observed_at":"2026-08-01T05:27:18.894578Z","title":"idit-hoi: Inpainting-based hand object interaction reenactment via video diffusion trans- former.arXiv preprint arXiv:2506.12847, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22241","last_updated":"2026-07-30T03:34:42Z","snapshot_observed_at":"2026-08-15T05:30:04.018365Z","submitted_at":"2026-07-24T12:17:57Z","title":"AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T05:27:18.894578Z"},"links":{"cited_paper":"/paper/2506.12847","citing_paper":"/paper/2607.22241"},"observation_digest":"sha256:68aa28a29c2da5d540d17ad26f139fae342aa65ddf4c6b8b6b594a6bf0dfb72d","observation_id":"7100c40b-5eb5-4d71-b27d-1189285c9be0","resolution":{"observed_at":"2026-08-01T05:27:18.894578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12847","snapshot_observed_at":"2026-07-31T08:51:27.095194Z","title":"idit- HOI: Inpainting-based hand object interaction reenact- ment via video diffusion transformer.arXiv preprint arXiv:2506.12847, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-16T14:00:04.137627Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":1},"reference_index":205,"source":"pdf_text","source_observed_at":"2026-07-31T08:51:27.095194Z"},"links":{"cited_paper":"/paper/2506.12847","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:3e80f4453213b64becfb45383ebe5be81adbaae7178b655e9ba93dba44a55782","observation_id":"f587cc87-3ff3-4bb0-8e72-3fd690d0778d","resolution":{"observed_at":"2026-07-31T08:51:27.095194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12847","snapshot_observed_at":"2026-08-04T01:23:09.117957Z","title":"idit- HOI: Inpainting-based hand object interaction reenact- ment via video diffusion transformer.arXiv preprint arXiv:2506.12847, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-16T14:00:04.137627Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":187,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:09.117957Z"},"links":{"cited_paper":"/paper/2506.12847","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:04c127d592828ed650dcd21788c6036e9cbaba44edc20db52442e4534e4a4ae4","observation_id":"30d0897e-a33f-44be-8a63-bbebb729aaee","resolution":{"observed_at":"2026-08-04T01:23:09.117957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12847/citation-record","integrity":"/paper/2506.12847/integrity","json":"/paper/2506.12847/citation-record.json","paper":"/paper/2506.12847"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:55.849134Z","title":"Person image synthesis via de- noising diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.849134Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:0797bd1951afb6a4d8fccc2c7ec90f5adefe219de03de1bbaa39710c222be498","observation_id":"1d78cc45-a367-4c45-9b1d-ed589175f3ab","resolution":{"observed_at":"2026-08-07T00:40:55.849134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:56.026603Z","title":"Videopainter: Any- length video inpainting and editing with plug-and-play con- text control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.026603Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a937ef030e13fcdb4c4020c512f7bdf8c41e603244f7f97f3565290a07b67b93","observation_id":"87e4ccb9-97a3-4d1d-88c0-96a38758b037","resolution":{"observed_at":"2026-08-07T00:40:56.026603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:56.147395Z","title":"Smpler-x: Scaling up expressive human pose and shape estimation.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.147395Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:61a3617aa87dc8a8024bb76c89df67b1bdfc8ccbee97473f59e1623fd34f97ab","observation_id":"3c87dd3b-a552-442f-a769-09586745fb9e","resolution":{"observed_at":"2026-08-07T00:40:56.147395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:56.276084Z","title":"Pix2video: Video editing using image diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.276084Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:aca884b7441a45023e9b41ae97c6bead60fdde1fef26e0544036d0d1aa5f991f","observation_id":"b7b6547e-4d76-439d-8174-ab27619128e3","resolution":{"observed_at":"2026-08-07T00:40:56.276084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:56.407455Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.407455Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a019ec0a687bc423d1f7ad8d4dc2270e50b5763fea0ba0475150a4a0551e733d","observation_id":"3c527140-e1f0-462f-936b-7748adb26f9f","resolution":{"observed_at":"2026-08-07T00:40:56.407455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T00:40:56.552104Z","title":"Pixart-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.552104Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:77586ed6bef26247b9420ed7f7b7c8e43aff5b747fa406d41e6cdc09834e5ec0","observation_id":"d0cd001b-8d41-4423-92d4-90dcb07eaa0c","resolution":{"observed_at":"2026-08-07T00:40:56.552104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:56.697928Z","title":"Control-a-video: Controllable text-to-video generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.697928Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:27716544cdfadb080218751a80bba154e77d58cd19f542a14e2e5c82796395f8","observation_id":"8eec9d24-25f8-4151-9226-3683a7196b86","resolution":{"observed_at":"2026-08-07T00:40:56.697928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.730721Z","title":"Cg-hoi: Contact-guided 3d human-object interaction generation","venue":null,"work_id":"ec8eac3e-9d21-48ce-9d8b-512f43125176","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.763263Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a62bad0a31cfeb37e6a276f43c093e6ca2c313824ae9f54534d0d9facc4ebb4c","observation_id":"d4bfc890-7a8e-4d38-a338-c94ad7667d51","resolution":{"observed_at":"2026-08-07T00:41:18.736762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.711105Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"0c96fbf1-689b-46be-82d4-a0dc3b3b965a","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.841966Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:6a22f3d1b5c160706cfcd3b0a64f6e49fbaba3ffd00fb9b37a9d150d9df91e6b","observation_id":"dd4570e3-0316-4bbc-8397-25a22af4e0c0","resolution":{"observed_at":"2026-08-07T00:41:18.717139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:57.009521Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.009521Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:6b201b6068fc46dea0e316c9544c8d8f6dd34a30d386ec47f7a13152d2c9be4c","observation_id":"28603426-b44b-423b-825c-2a8a5bbee419","resolution":{"observed_at":"2026-08-07T00:40:57.009521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.676544Z","title":"Re-hold: Video hand object interaction reen- actment via adaptive layout-instructed diffusion model","venue":null,"work_id":"f86f5603-7d6f-4731-8926-c82d3a137f2d","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.115303Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:15c98746e3e5e5d3d9485b2f380fad92996cb0c2fe9efc89e6fc2e26ea188c1e","observation_id":"946c9b23-1f5d-4fc3-805c-9019e4e3eaf0","resolution":{"observed_at":"2026-08-07T00:41:18.682177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.658884Z","title":"Ccedit: Creative and controllable video editing via diffusion models","venue":null,"work_id":"cbe9b00a-bc2b-4696-b2f4-3b75a3416830","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.204044Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:7c57434a66b5a306c557df8be5d604965781aaa08764639b57ad0f7c9e909e18","observation_id":"444ee6dc-b79b-48c1-b1ee-f76fd6ff1325","resolution":{"observed_at":"2026-08-07T00:41:18.665051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-15T05:59:56.592267Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-08-07T00:40:57.359048Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation.arXiv preprint arXiv:2502.04847, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.359048Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:ffb99172a95266dd342e6a3d54213c5dd12b6731b1676d0b65848f6bc13706a6","observation_id":"7ac5ae84-74b1-4c0d-8aae-4c50a97ad4c1","resolution":{"observed_at":"2026-08-07T00:40:57.359048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.640777Z","title":"Tokenflow: Consistent diffusion features for consistent video editing.arXiv, 2023","venue":null,"work_id":"9a82d746-032e-4593-9675-4ffad6ee7131","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.530289Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:db6ad6864e64cf5096dce78d9c2618ec56c204493e0ecb124e86c802c8669393","observation_id":"375e4770-abf2-456f-8dc5-8c9e8339deaa","resolution":{"observed_at":"2026-08-07T00:41:18.646670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.620455Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":"0c721936-344e-4e29-8629-ff4b6d577c87","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.712846Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a98ebdb33e3370c8edd1112665f7efebca9b9a257b3f29a977372e5d835eb5e6","observation_id":"891ee0a2-a6b1-4f00-96c4-38ad8a68f67b","resolution":{"observed_at":"2026-08-07T00:41:18.626921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.599470Z","title":"Videoswap: Customized video subject swapping with interactive seman- tic point correspondence","venue":null,"work_id":"ca0d7f28-44a4-4da5-a893-89e5c7134c31","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.888052Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:15ae9aba2c30580f7a48b4dd5c2d0e155b60b180d63889eeeb074880dde6e334","observation_id":"a74efc51-aa1f-442b-b944-fa215e95add4","resolution":{"observed_at":"2026-08-07T00:41:18.606275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.581075Z","title":"Talk-act: Enhance textural- awareness for 2d speaking avatar reenactment with diffusion model.SIGGRAPH Asia, 2024","venue":null,"work_id":"9ccdbff2-68eb-493c-8bc4-88658fec12db","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.033983Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:ab2abcf6f440c6ff4bdb7ef20f1d66b1464a8b0f5c7f2a52cf1cdc2cf2020355","observation_id":"ba21eacd-fd29-4ff8-b905-621052d961e4","resolution":{"observed_at":"2026-08-07T00:41:18.588021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.563619Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control.arXiv, 2024","venue":null,"work_id":"cc8ccf73-d9bf-4b8e-ad9a-c339d669e0e8","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.141288Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:22b1a6ee51ac8d6bb8964781ad7f3f5aaffb9c781d12d5aa1cc42fdaa3221396","observation_id":"8a25d911-f505-423f-8ea9-2127cd6a0025","resolution":{"observed_at":"2026-08-07T00:41:18.569441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.545096Z","title":"Resolving 3d human pose ambigui- ties with 3d scene constraints","venue":null,"work_id":"cb880067-a07e-4c40-a0c7-28b090e6b8e1","year":2019},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.247226Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:2f9bf61083fdaeeb71e6f455f848efbec2c2411c36b92bdcba7fff5625de237c","observation_id":"6c07f26e-efc0-4834-a2f8-88d5c99d8dd6","resolution":{"observed_at":"2026-08-07T00:41:18.551542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.514218Z","title":"Populating 3d scenes by learning human-scene interaction","venue":null,"work_id":"af292262-d8cd-47e0-9cba-828c3b806e72","year":2021},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.327537Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:bb52a1639d26024109cd4d2bbe229d62c123a38365c5f360af34dab2fa35ccef","observation_id":"7768c4ab-da41-48e1-a27a-a94e565f3f9d","resolution":{"observed_at":"2026-08-07T00:41:18.528089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.393033Z","title":"Synthesizing physi- cal character-scene interactions","venue":null,"work_id":"83baf031-ad56-4e90-9971-06c97bd354b8","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.419397Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:564694716f23e2ae3030f9847d767afc77465b5b6ab5ac873ed4190c25f7c00e","observation_id":"f652b488-9eb5-4420-8e2a-b8c3201b3c65","resolution":{"observed_at":"2026-08-07T00:41:18.443031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.181496Z","title":"Hand-object interaction image generation.NeurIPS,","venue":null,"work_id":"d3b5c1a1-328e-4eae-8f3e-38da0663e5e4","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.505914Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:744e76f83a1a4495d892bb42b4402137076c142bdc02bc0d947d8db942de6d86","observation_id":"ee101561-8130-4d4f-b99d-e6d58a8674e8","resolution":{"observed_at":"2026-08-07T00:41:18.272435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.011491Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":"a611dbb8-6d3c-4338-912a-c310be523c3b","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.587901Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:0bda001b6e82a8598fb3214b1d4296de9dc9422a2707df2f40248cfef9cfef60","observation_id":"c58761c5-83cf-436a-97f4-c6afe99a70db","resolution":{"observed_at":"2026-08-07T00:41:18.062117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06145","last_updated":"2025-02-10T04:20:11Z","snapshot_observed_at":"2026-08-14T23:19:43.982858Z","submitted_at":"2025-02-10T04:20:11Z","title":"Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06145","snapshot_observed_at":"2026-08-07T00:40:58.645841Z","title":"Animate anyone 2: High-fidelity character image animation with environment affordance.arXiv preprint arXiv:2502.06145, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.645841Z"},"links":{"cited_paper":"/paper/2502.06145","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:e878186ad61bb257d0666d5c7404feb5fdbd6fa9c48a38756984347f942b70b8","observation_id":"42031114-248d-4ed7-9e35-685b36367ebc","resolution":{"observed_at":"2026-08-07T00:40:58.645841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-07T00:40:58.747297Z","title":"Vace: All-in-one video creation and editing.arXiv preprint arXiv:2503.07598, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.747297Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:bdf331dff78dc94c7a4a64627bb05a39787efc7c47a1faf5e400703906b4e59e","observation_id":"b1c244ba-1ebc-459c-ab1f-38d2afd9f69a","resolution":{"observed_at":"2026-08-07T00:40:58.747297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.879511Z","title":"Dreampose: Fashion image-to-video synthesis via stable diffusion","venue":null,"work_id":"b4739045-24e9-4389-8b00-2dd962902756","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.861552Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:2b8aa5ef682748d27d24afc181526195e60860b0d7dc934b1d31336000d3fba4","observation_id":"1b1427ab-33b7-4321-9ca6-48409fc65980","resolution":{"observed_at":"2026-08-07T00:41:17.923114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T00:40:58.985574Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.985574Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:023ffd3112af480d0f7f7ce0a09a3fadb8ee34cbaa6cedce19556836579412f9","observation_id":"b7ea3f57-8e41-466c-861b-fa63dce0ba4b","resolution":{"observed_at":"2026-08-07T00:40:58.985574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.732934Z","title":"Anyv2v: A plug-and-play framework for any video- to-video editing tasks.arXiv, 2024","venue":null,"work_id":"67465732-ba13-4e84-bb0d-fa78d36b77bc","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.071513Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:f59521b20c5b01c7cf37ff7b14d2fa00756429cb124c82075a0e8db8ea512941","observation_id":"3f2c233f-983d-4237-8e3d-570a41636637","resolution":{"observed_at":"2026-08-07T00:41:17.845182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.600383Z","title":"Flux.https://github.com/ black-forest-labs/flux, 2024","venue":null,"work_id":"ff42808b-826a-4393-b0d2-989d9eec474f","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.129725Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:994c122dc33c997af800c433e4642e93fc7b336c661391eb5b7efdd9714c4c75","observation_id":"5bffd73d-dcee-4468-8fb5-52609dddfbf6","resolution":{"observed_at":"2026-08-07T00:41:17.650595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.375237Z","title":"Lego: Learning egocentric ac- tion frame generation via visual instruction tuning","venue":null,"work_id":"6058a88b-cde4-4384-98a5-c14c2d250249","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.225938Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:9090bbff94aba08ebe6685681f326d773611d5095652d7cebdc2836365e4c3cc","observation_id":"46857b48-d2cc-43fd-8860-b9fb80935fb5","resolution":{"observed_at":"2026-08-07T00:41:17.470230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.291232Z","title":"Shape-aware text-driven lay- ered video editing","venue":null,"work_id":"5bf698a9-34d5-4c9b-b712-0c6c79f3b006","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.323533Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:ad3dd14653e2b58b7f5b7272cf741f91f80abe48b3dea65730dd5f31f6467817","observation_id":"5ac1839c-76f6-4fac-92e1-f41c9f028dd3","resolution":{"observed_at":"2026-08-07T00:41:17.322349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.185172Z","title":"Generative om- nimatte: Learning to decompose video into layers.arXiv,","venue":null,"work_id":"e7ed8fa8-ff0d-45e6-ae12-c17c5993afc3","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.406104Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:70df869b93614af33b4ffc1d81969fc0a446a196e25ffd5a6e68350635a2d75d","observation_id":"5f05962b-104c-477a-aaed-7848f3fd0afb","resolution":{"observed_at":"2026-08-07T00:41:17.230606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:16.906431Z","title":"Vidtome: Video token merging for zero-shot video editing","venue":null,"work_id":"812d65d6-89bc-4690-aebf-b408499e147b","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.468695Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:b5f45d246c727d97aa9c672f8bcd3a6838344b3d2b386bd94bfa29e4d638e416","observation_id":"20f1775c-f3c3-45ef-a6b6-5ea631e9b977","resolution":{"observed_at":"2026-08-07T00:41:17.036408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:16.607230Z","title":"Video generation from text","venue":null,"work_id":"985d1a31-010d-4f43-910c-22f329aa916d","year":2018},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.569258Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:8f3efae5c890ea0bb94bea000f6592e2c37b3202bcb567feb009fb5f60803d4c","observation_id":"133a9f74-e380-4fa8-84b3-bb139730b507","resolution":{"observed_at":"2026-08-07T00:41:16.739371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T00:40:59.660776Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.660776Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:0d9442be8a57560ec9faa0b6eba8f52f4154d1f0ca4a3a9e7c76c4e3a31646b9","observation_id":"4158dac0-cec8-4cd3-bf99-534b47953d49","resolution":{"observed_at":"2026-08-07T00:40:59.660776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:16.375816Z","title":"Flowvid: Taming imperfect opti- cal flows for consistent video-to-video synthesis","venue":null,"work_id":"51cf1059-71bf-40f2-b202-0d52c83e59b7","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.767048Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:b7b2e4e7d6264a56597e9057a124ffd85882ae245c69daaebf9a70ce1f73aa3a","observation_id":"237fda55-aa45-4e5b-acbc-6a79a7f5f4bf","resolution":{"observed_at":"2026-08-07T00:41:16.482657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:16.167484Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":"5d68784d-e5bd-417a-82ad-de9448198115","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.852408Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:0b3468ebc3e75ee272b0a734e3dcf2c229045ad277c83dfd0a528f95d02f6eb9","observation_id":"ccd59e8f-5f78-471c-b09d-8b6dd3b0cb1e","resolution":{"observed_at":"2026-08-07T00:41:16.274883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:15.944055Z","title":"Iterative ensemble training with anti-gradient control for mitigating memorization in diffusion models","venue":null,"work_id":"551f9219-7e19-4b2d-9b38-5353cf2601b1","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.952831Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:5d2e1a4a3248f886184683a1b2392167b106137adcd728f7bfba0f4444dfb08a","observation_id":"3a6392ac-1bf7-4d7c-bc07-7e55bdc26d36","resolution":{"observed_at":"2026-08-07T00:41:16.035930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:15.701892Z","title":"Live speech por- traits: real-time photorealistic talking-head animation.TOG,","venue":null,"work_id":"be230735-6b55-4868-a504-956a8814d982","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:00.025488Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:f85c0f0ba4763ea325c1f620c064b5d3ec64fd32ff228ff9e0a83898630cc242","observation_id":"21c8291f-9cfd-47cd-a041-c7b69fe23212","resolution":{"observed_at":"2026-08-07T00:41:15.816820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:15.485177Z","title":"Dreamactor-m1: Holistic, expressive and robust human image animation with hybrid guidance, 2025","venue":null,"work_id":"bbcc09f5-e45d-4057-b2ff-e49850bb1e43","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:00.125115Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:f01abb8400a25ed3b91e5a25517dc0172c0e6cb7305725e5a91745f6c82c09f5","observation_id":"d59c705e-ab3b-49b6-9c01-69b88252813f","resolution":{"observed_at":"2026-08-07T00:41:15.614113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02487","last_updated":"2025-01-15T13:07:56Z","snapshot_observed_at":"2026-08-16T12:59:41.777279Z","submitted_at":"2025-01-05T09:40:58Z","title":"ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02487","snapshot_observed_at":"2026-08-07T00:41:00.228866Z","title":"Ace++: Instruction- based image creation and editing via context-aware content filling.arXiv preprint arXiv:2501.02487, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:00.228866Z"},"links":{"cited_paper":"/paper/2501.02487","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:ac00014bfc5a8b22a4ff0a9ece626d2692c7e95cf679185d624b06666766ee5e","observation_id":"e418d60b-fe81-41ae-b4c5-e3e8adca9598","resolution":{"observed_at":"2026-08-07T00:41:00.228866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:15.171937Z","title":"Mimo: Controllable character video synthesis with spatial decomposed modeling","venue":null,"work_id":"4b72e02d-db97-4e73-981f-3aa67f8fff10","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:00.689236Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:60b14022dc0ed39443a561edc636220f9628dc84e43ef1c62b5743c98dbe24ae","observation_id":"e5ab77f8-b365-4af5-b0b8-fbc15c25910f","resolution":{"observed_at":"2026-08-07T00:41:15.304385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.921648Z","title":"Sora: Creating video from text.https:// openai.com/sora/, 2024","venue":null,"work_id":"08be1c13-933d-4ada-a2f2-00279e6b58d0","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:02.570292Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:bfc792494ca24bac73db5dae0543459e40395cf3c2b6775782de594fbcd362d0","observation_id":"4d4c7e16-5d70-4c67-8d23-969a26fe7c26","resolution":{"observed_at":"2026-08-07T00:41:15.006145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.796601Z","title":"Reconstruct- ing hands in 3d with transformers","venue":null,"work_id":"08621a87-46c3-4856-a85f-b6cde23c665c","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:02.794703Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:ad7b4c3d5553d390d9f392716da8bdc3c38f2cf7be1762d79e6be0db4900ebcf","observation_id":"ee9e51ab-dfc4-4569-8929-8ce1c90d0b96","resolution":{"observed_at":"2026-08-07T00:41:14.877718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.620723Z","title":"Vase: Object-centric appearance and shape manipulation of real videos.arXiv, 2024","venue":null,"work_id":"cfa416eb-41ab-4ff3-9b56-1ff514f7081d","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.395040Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:79c54649d2f199980f747a81572fcae82ccd5bbe03fb0bc6a0329f0882d53846","observation_id":"93e9b51d-433f-4654-a869-9ff43e1212b1","resolution":{"observed_at":"2026-08-07T00:41:14.710627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.488597Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"03837ed2-96c5-4732-924f-4c4292c9f7bd","year":2020},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.643291Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a8a7dfd19c59d88bcf8978d460f7b515c02d1ce4c7998c5504327f88d36a0028","observation_id":"04adb67f-2efb-4d33-af6a-4a884744d84c","resolution":{"observed_at":"2026-08-07T00:41:14.536687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.364516Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":"ffec00c8-e721-484e-bb6d-ac67f2596de0","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.745650Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:cace836b0b95714a0c7c57830b3d61e2cd7f354ec9fb28189639a0a0c02bca59","observation_id":"f8e562a0-d805-4eed-97e3-6bea44ee846b","resolution":{"observed_at":"2026-08-07T00:41:14.425726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.235214Z","title":"Stable diffu- sion 2 inpainting.https : / / huggingface","venue":null,"work_id":"6d5f7745-a190-495e-8de4-8617a8aa0abd","year":2022},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.868749Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:317f0870b45b11575b89c9e6430948f514e6e3f1f5223caf41dfb45b29a68e0d","observation_id":"6dfce370-292e-4c4c-805d-fa5807744f9f","resolution":{"observed_at":"2026-08-07T00:41:14.274527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:04.923402Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.923402Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a4f107442d51d4bf7e56e597fa4fe135f3708a0ac878747cbd2537ab53b3e5ce","observation_id":"db8cc9c2-7702-4c71-abc2-e3b9ec5bb039","resolution":{"observed_at":"2026-08-07T00:41:04.923402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:04.929104Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.929104Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:4c398c7799acd69f0beb840e3915da7e3f1ffec02f99a27de9f8e08c02626900","observation_id":"79bedfab-3e06-479d-90e1-5b4817113664","resolution":{"observed_at":"2026-08-07T00:41:04.929104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17405","last_updated":"2024-09-23T20:52:01Z","snapshot_observed_at":"2026-08-16T13:48:56.392885Z","submitted_at":"2024-05-27T17:53:29Z","title":"Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17405","snapshot_observed_at":"2026-08-07T00:41:04.992398Z","title":"Human4dit: 360-degree human video generation with 4d diffusion transformer.arXiv preprint arXiv:2405.17405, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.992398Z"},"links":{"cited_paper":"/paper/2405.17405","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:18ab34c9b4e7ae6ebf1e97cd56020fb35d86684c5eab02adb1065b48b5d064dc","observation_id":"6256689b-ee15-4038-8bda-8e49319670bb","resolution":{"observed_at":"2026-08-07T00:41:04.992398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.037419Z","title":"Edit-a-video: Single video editing with object-aware consistency","venue":null,"work_id":"c74c85d5-173d-4fb7-9cf2-9b22ae392f61","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.054638Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:4996099298200761f6dba40882df80d10ee7eed6497637a3d72a701e2f01c509","observation_id":"1531149b-5832-43c2-a3da-32aad6c2706d","resolution":{"observed_at":"2026-08-07T00:41:14.118624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.908454Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv, 2022","venue":null,"work_id":"fd41666a-cd02-4c0c-914f-2e6d51c11f81","year":2022},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.127368Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:1566e4a9567e5ff7ffc379015dc57c317b9356fe4c50d8d5b0de9e075f1d8fa1","observation_id":"76a50cca-916c-46f7-8a5d-960b83b9e323","resolution":{"observed_at":"2026-08-07T00:41:13.967877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.793084Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":"8616b00f-91b1-4c2a-83f8-2f2c6796a2b8","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.215658Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a00f613dc0aa50c91bb1e76dc18f2ab23e9a3d73925704e0d614ca78b5467c27","observation_id":"4fcbaeb9-bbc8-4323-936a-98225a940114","resolution":{"observed_at":"2026-08-07T00:41:13.844013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.683174Z","title":"Attention is all you need.NeurIPS, 2017","venue":null,"work_id":"abe70f81-805a-4ff3-81ea-6c7570a0b6bb","year":2017},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.282748Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:afd6a7d7f799aca667df2b5e3f917dde1e7a3d00dda0533a51dc85893a118cff","observation_id":"1833d2a1-9209-449d-a166-9147a385e97e","resolution":{"observed_at":"2026-08-07T00:41:13.725532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.509445Z","title":"Wan: Open and advanced large-scale video gen- erative models, 2025","venue":null,"work_id":"4dd6be02-e50c-4785-a284-e1a13fb0616a","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.351828Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:cbe71435a0b8dbe58f51ab25c423a724a463cefd2968f87cbc792025fd45a854","observation_id":"84e4ab52-6e9c-41ae-ae7f-98caa501a480","resolution":{"observed_at":"2026-08-07T00:41:13.590511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.345109Z","title":"Robust video portrait reenact- ment via personalized representation quantization","venue":null,"work_id":"7c862ab8-47e2-4c5a-b009-732be2216f6a","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.445126Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:de46300f66807e16da87bee7e58fadb4101b8a3f0a46f7007c156cb32f7fdbda","observation_id":"fca04e0f-4ebc-4160-b035-cb2e592d659f","resolution":{"observed_at":"2026-08-07T00:41:13.434166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.218427Z","title":"Efficient video portrait reenactment via grid-based codebook","venue":null,"work_id":"ae7b655d-1db7-4949-b141-d76847cabc25","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.540143Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:d34212636e21b3b412ef4df6a902eb62bf45d848643999baa5364d84fb43b6b0","observation_id":"37e5e87b-32f7-40a8-9e2f-4f006ad5689c","resolution":{"observed_at":"2026-08-07T00:41:13.264151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.020451Z","title":"Diffusion in diffusion: Cyclic one-way diffusion for text-vision-conditioned generation.ICLR, 2023","venue":null,"work_id":"6a74da06-cab3-4fbc-93b8-6d917dec7f6a","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.609950Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:47a084a7cbcc333dd4143add25d16cd5a0cb27cdd7f643a834b64162cf8e2d32","observation_id":"54a117d9-1ed8-4d65-927d-c2d7e24f1d09","resolution":{"observed_at":"2026-08-07T00:41:13.133190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:12.881961Z","title":"Disco: Disentangled control for realistic human dance generation","venue":null,"work_id":"aac293d7-435f-4cc3-90af-82ff756fce52","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.693536Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:f6adeae21ade06a24811d9e63112f3c8d699dce4582eb1aa0abcd3a404d99c9c","observation_id":"a34be035-95e6-4c89-b858-84db5d41886d","resolution":{"observed_at":"2026-08-07T00:41:12.936533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:12.653410Z","title":"One-shot free-view neural talking-head synthesis for video conferenc- ing","venue":null,"work_id":"1db6bfb9-59c1-45a5-85fb-eb4697daa93c","year":2021},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.791022Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:9c7cd1c8b1ec5c070e1e69630d60e907d24c344c68b6fad9df29e0eda44743f4","observation_id":"3fbab669-8ebb-455d-8e72-fd981d2c52ff","resolution":{"observed_at":"2026-08-07T00:41:12.730327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:12.451485Z","title":"Videocomposer: Compositional video synthesis with motion controllability.NeurIPS, 2024","venue":null,"work_id":"65d4ca59-5a88-48cf-b463-f2bfd35690c1","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.885683Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:5aae6476b8c80ddeedfd99484fa585506e01e33997b3e144bfbb8256eadcd40f","observation_id":"9b960a2d-fb93-481d-845f-7143d44f64e8","resolution":{"observed_at":"2026-08-07T00:41:12.534289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:05.956615Z","title":"Unianimate-dit: Human image animation with large-scale video diffusion transformer.arXiv preprint arXiv:2504.11289, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.956615Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:051816c01a6d5e69353e601d61319b49e6c59753e1f16f7217a62dcb38e56bf8","observation_id":"98c38943-a261-4899-8dcb-9822c011902e","resolution":{"observed_at":"2026-08-07T00:41:05.956615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:12.276532Z","title":"Latent image animator: Learning to animate im- ages via latent space navigation.arXiv, 2022","venue":null,"work_id":"0e566fa0-53d9-47ab-85ae-e8e0282a0c96","year":2022},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.058039Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:b2cb851353d8d74297adaaa5a048e7952920f19de6bb0fcf0eeaef74530b6a8a","observation_id":"f9d141e7-259d-49fe-94be-f4cdaf127bd8","resolution":{"observed_at":"2026-08-07T00:41:12.358387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:12.111339Z","title":"Foundationpose: Unified 6d pose estimation and tracking of novel objects","venue":null,"work_id":"9ab59dbd-785d-49cd-8258-4c9011374e8a","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.158274Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:f1b46e323a51f7fe967eece2d7a06854e33741fcf58ba871b557b2729e17846e","observation_id":"88f8bc3d-fdd1-41cb-abf3-75b1f792f7bd","resolution":{"observed_at":"2026-08-07T00:41:12.187867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.909208Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"815974ff-28c2-4eba-9604-fd3d7151309c","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.227531Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:1eb6d005e619476eea61c98548ca5b950a4c4277f9327b0d645be46455a30105","observation_id":"93e611b8-95ff-4542-a080-9dbed1fe7a5d","resolution":{"observed_at":"2026-08-07T00:41:11.988082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.765569Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv, 2024","venue":null,"work_id":"39a197e8-5639-464b-8c91-af45d0a8d068","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.307583Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:48561a438aa4e8bee45b9db44ec315e0474264c125dba5d3089c36db0558c3e7","observation_id":"d884100c-e331-4ee7-b609-eb18e98646e3","resolution":{"observed_at":"2026-08-07T00:41:11.830962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.568703Z","title":"Hoi-swap: Swapping objects in videos with hand-object in- teraction awareness.NeurIPS, 2024","venue":null,"work_id":"5afab5f1-bb68-41cb-bd18-81c4ee4a31fe","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.377089Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:3cf22a17171915bd1c5063be162e8b4a266be74879966077852a0e121cc347fc","observation_id":"3ea10905-0ca3-4cd4-a13b-ac1908019815","resolution":{"observed_at":"2026-08-07T00:41:11.670573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.374207Z","title":"Showmaker: Creating high-fidelity 2d human video via fine-grained diffusion mod- eling.NeurIPS, 2024","venue":null,"work_id":"d49203e8-4eba-4c87-bb00-e968dd766281","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.445388Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:61db2abc749854f7845af562fbd30f9e93c0fbbd7acefd0e6cc3ea5b3261a40e","observation_id":"180c060e-094b-4a4b-a15d-ad6630d416b7","resolution":{"observed_at":"2026-08-07T00:41:11.431258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.233646Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"026aea19-903f-4803-8062-dc7e10f000b7","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.520664Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:fccd9bc2c635bf4c88f06a7465130f9cdb7ea722c3ceab487ee7e7c437cda80e","observation_id":"c6a856d5-2818-4056-95cd-7c779519471e","resolution":{"observed_at":"2026-08-07T00:41:11.304565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.038199Z","title":"Effec- tive whole-body pose estimation with two-stages distillation","venue":null,"work_id":"423e8a9e-67af-4712-9b61-9d08b766e162","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.594525Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:464be7db5ed52443dc507547c20e9811f8a06a49b148e4dd89a10f40b63f8a32","observation_id":"ffe09eaf-ae67-474f-a342-7cac1ae98853","resolution":{"observed_at":"2026-08-07T00:41:11.126525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:10.877452Z","title":"Space-time diffusion features for zero-shot text-driven motion transfer","venue":null,"work_id":"29eb0b14-ffc5-4172-97ab-5b975dff9e81","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.674585Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:2addc97d699dfbd6d9ca2226c14ef6a727c8fbb29a2a5f2b18529637dcd81e88","observation_id":"dcc5f97e-bee4-4cb1-983c-c7613a11b563","resolution":{"observed_at":"2026-08-07T00:41:10.950453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:10.705268Z","title":"Diffusion-guided reconstruction of everyday hand- object interaction clips","venue":null,"work_id":"42f57a08-3c01-4487-9831-a8f8914f6006","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.773556Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:ea7998a20fb1744215d7a4b55750fba6bd00f99f24018697f8d17dc36b6fd7ab","observation_id":"b47d8aa3-a7b1-4180-8aa7-15ad68ed279f","resolution":{"observed_at":"2026-08-07T00:41:10.782808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:10.551305Z","title":"Affordance diffusion: Synthesizing hand-object inter- actions","venue":null,"work_id":"c5e9c207-5de8-42a4-ac86-ac8b05fb889f","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.846684Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a8773984b363212a3e7918fd7d443e64aa16bf10a2d2b9efdd8002ac77388773","observation_id":"d42757ab-d2b5-405e-b095-279a5de21aab","resolution":{"observed_at":"2026-08-07T00:41:10.615828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:10.312870Z","title":"Moonshot: To- wards controllable video generation and editing with multi- modal conditions.arXiv, 2024","venue":null,"work_id":"fffcd304-b741-4e6d-85e4-a1adc3763a06","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.915945Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:85a5519ff9282a3b9b9a39d2f27c72f5282e6c76c83ab60ba4db728a13719bdb","observation_id":"2a5871f5-458d-4221-823f-9bf05474adcf","resolution":{"observed_at":"2026-08-07T00:41:10.436269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:10.136601Z","title":"Graspxl: Generating grasping motions for di- verse objects at scale","venue":null,"work_id":"699dd871-d80f-4155-9c7e-ce0803831c10","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.985295Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:01eb3eb8b779c7a8d855295186b4bd0085f3531e233741611db51cbffd61bbb5","observation_id":"4ffb5d07-6954-4cfe-9af1-3d347d2e6729","resolution":{"observed_at":"2026-08-07T00:41:10.220306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:09.939809Z","title":"Hoidiffusion: Generating realistic 3d hand-object interaction data","venue":null,"work_id":"3d43b8c8-89e6-4ed0-ad6b-2d6788f574d4","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.056644Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:115f1a3220539b092c49c1736bd7a921e015f0dfbfd358f95152d241318316f3","observation_id":"18df7205-b067-46c6-b67d-2504aa2089dd","resolution":{"observed_at":"2026-08-07T00:41:10.041631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:09.780965Z","title":"Place: Proximity learning of articulation and con- tact in 3d environments","venue":null,"work_id":"403e9d12-38f1-49fe-b8a7-269e67959638","year":2020},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.125844Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:15dd9236ba0d09ab60a3a824c6468c4d366dfa82210e4ce7635aa92d5555e5fd","observation_id":"ee2636fd-962e-40aa-b2af-a097141604fa","resolution":{"observed_at":"2026-08-07T00:41:09.852017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:09.548881Z","title":"Generating 3d people in scenes with- out people","venue":null,"work_id":"03758c23-d48c-481a-b43f-b4aea3847aa8","year":2020},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.207170Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:32ec910a1969e3d16b06adc4d9153247cea5df9f896f95866bcbe6b42180cd2a","observation_id":"05fe2724-05d6-488f-83ef-168f9d183dec","resolution":{"observed_at":"2026-08-07T00:41:09.673946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-16T13:38:51.127960Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-07T00:41:07.314086Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance.arXiv preprint arXiv:2406.19680, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.314086Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:41c57f707628902707e88fefb9b1f47eda3cf384cb542a9550f061cd37fd762b","observation_id":"072c37cb-e248-4725-ba45-2e8b6c1da1bc","resolution":{"observed_at":"2026-08-07T00:41:07.314086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:09.362623Z","title":"Avid: Any-length video inpainting with diffusion model","venue":null,"work_id":"20ffa6ae-d172-4654-a0fc-d24cd7f43af2","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.430241Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:0affd7b2ab8e1bb88451125b2eda5e62605265739d84597530d1a42da2a5a37b","observation_id":"789bac7d-8272-4bab-8e76-4cdd1d12f094","resolution":{"observed_at":"2026-08-07T00:41:09.464243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:09.129712Z","title":"Pose-controllable talking face generation by implicitly modularized audio-visual rep- resentation","venue":null,"work_id":"fd172c84-d0a4-493b-8577-72c5926b71e5","year":2021},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.513431Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:0834a5748a73083706a8ff9f17344c94f7033007667616ec084d6cf952ef5ed6","observation_id":"3cbbf123-e7e0-49fa-8dac-c73266f3dae7","resolution":{"observed_at":"2026-08-07T00:41:09.247269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:08.925026Z","title":"Realisdance: Equip controllable character ani- mation with realistic hands.arXiv, 2024","venue":null,"work_id":"87aca25f-784c-429d-ad62-7bdfa8744f92","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.594471Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:6233be34843631f05b19cd2098febf231ef642222e14a04851d5ef16a504bdca","observation_id":"ae7da5e1-6bca-4c2c-9f02-5fcb4cafb4b8","resolution":{"observed_at":"2026-08-07T00:41:09.007311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:08.746991Z","title":"Discrete contrastive diffusion for cross-modal music and image generation.ICLR, 2022","venue":null,"work_id":"8ee895f7-781c-492a-ac84-5de8f81b53da","year":2022},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.671543Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a89a91e0c162353893bdce8245be54c19550857ea846b5d7ba478ab7c8654e03","observation_id":"a4e8ed7d-5a25-419c-ac8b-949aafbc6019","resolution":{"observed_at":"2026-08-07T00:41:08.827167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:08.557904Z","title":"Cococo: Improving text-guided video inpainting for better consistency, controllability and compatibility","venue":null,"work_id":"5f3547b7-2f1f-4e47-a134-2bdae50e0620","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.779574Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:c749878cad2f97e86c90471b3b528888e37948114500f8c596ff885764ca3abb","observation_id":"9d0c6260-f658-4548-b34f-d47e83a80825","resolution":{"observed_at":"2026-08-07T00:41:08.662632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:08.370354Z","title":"Cut-and-paste: Subject- driven video editing with attention control.Neural Networks,","venue":null,"work_id":"9115acc1-0167-48fb-8c83-c0dcc69eaae5","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.918981Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:42c665ebd7211c0609fa15e461b214844977615d5cc9d7618c8c09383cdcc144","observation_id":"500b1a36-b8f8-4578-88ea-446576a18f7f","resolution":{"observed_at":"2026-08-07T00:41:08.442439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","latest_version":1,"primary_category":"cs.GR","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":67},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 4 inbound Pith citation observations for arXiv:2506.12847."}