{"as_of":"2026-08-14T10:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f2e620adec689122b30ed229dafb83e823f5757df12bdc4ace83f538c831a5a","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:07:15.192008Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:09:51.916002Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T23:31:21.996122Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08797","snapshot_observed_at":"2026-08-06T15:09:51.916002Z","title":"Hunyuanvideo-homa: Generic human-object interaction in multimodal driven human animation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.916002Z"},"links":{"cited_paper":"/paper/2506.08797","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:650d00d7b954892c281227d15f2a6a335cdba25d2afba54398f2abe4a0c8b0fe","observation_id":"d4776e48-b2a1-4f33-9ac4-7b64aa05c48d","resolution":{"observed_at":"2026-08-06T15:09:51.916002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"cited_work":{"arxiv_id":"2506.08797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08797","snapshot_observed_at":"2026-07-09T01:19:36.380554Z","title":"Hunyuanvideo- homa: Generic human-object interaction in multimodal driven human animation.arXiv preprint arXiv:2506.08797","venue":null,"work_id":"6dec4a37-023c-4e80-a013-93fb065d282f","year":2025},"citing_paper":{"arxiv_id":"2512.09646","last_updated":"2026-04-08T15:03:02Z","snapshot_observed_at":"2026-08-11T07:14:41.090718Z","submitted_at":"2025-12-10T13:40:24Z","title":"VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T23:30:14.969895Z"},"links":{"cited_paper":"/paper/2506.08797","citing_paper":"/paper/2512.09646"},"observation_digest":"sha256:4ef1f1df41e9a3b17b2679234df0d054ae150441d152d2bffe98d24a593efc42","observation_id":"6520dd86-2b53-45dc-8825-bf9b92f07a76","resolution":{"observed_at":"2026-07-09T01:19:36.380554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"cited_work":{"arxiv_id":"2506.08797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08797","snapshot_observed_at":"2026-07-09T01:19:36.380554Z","title":"Hunyuanvideo- homa: Generic human-object interaction in multimodal driven human animation.arXiv preprint arXiv:2506.08797","venue":null,"work_id":"6dec4a37-023c-4e80-a013-93fb065d282f","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-08-10T21:01:10.829067Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2506.08797","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:4c24ff8000411b35d9ad04f9b3edbebab60f2852c6e39081d0c66550b5f1d535","observation_id":"5cc0e35d-d677-4b28-ae37-737691ad3291","resolution":{"observed_at":"2026-07-09T01:19:36.380554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"cited_work":{"arxiv_id":"2506.08797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08797","snapshot_observed_at":"2026-07-09T01:19:36.380554Z","title":"Hunyuanvideo- homa: Generic human-object interaction in multimodal driven human animation.arXiv preprint arXiv:2506.08797","venue":null,"work_id":"6dec4a37-023c-4e80-a013-93fb065d282f","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-08-11T04:55:53.338738Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2506.08797","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:0b5a9fe6b99d5af78f0ebc2c8b209b4a414b918e25efbb998ea985ce0d04bcd1","observation_id":"ccc26b66-cc67-4ae2-a977-bf55d8a440c0","resolution":{"observed_at":"2026-07-09T01:19:36.380554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08797","snapshot_observed_at":"2026-08-04T05:51:18.179232Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-13T20:45:11.827051Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.179232Z"},"links":{"cited_paper":"/paper/2506.08797","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:e1c332c5e29df07236d78a5fa9d17955efb34515ed2c46bc7af8d9aaf74effe2","observation_id":"d6adda24-10da-4a15-b2b2-8317664b43b4","resolution":{"observed_at":"2026-08-04T05:51:18.179232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"cited_work":{"arxiv_id":"2506.08797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08797","snapshot_observed_at":"2026-07-09T01:19:36.380554Z","title":"Hunyuanvideo- homa: Generic human-object interaction in multimodal driven human animation.arXiv preprint arXiv:2506.08797","venue":null,"work_id":"6dec4a37-023c-4e80-a013-93fb065d282f","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2506.08797","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:d190fbcd96d20414c514473169c4e4baa749c35badfce7dbab16290ec71991a7","observation_id":"85627e22-73e7-4684-b5a1-bea08e89bdd5","resolution":{"observed_at":"2026-07-09T01:19:36.380554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08797","snapshot_observed_at":"2026-08-01T10:37:53.829539Z","title":"Hunyuanvideo-homa: Generic human- object interaction in multimodal driven human animation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20174","last_updated":"2026-07-22T14:06:39Z","snapshot_observed_at":"2026-08-13T16:50:07.911910Z","submitted_at":"2026-07-22T14:06:39Z","title":"StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T10:37:53.829539Z"},"links":{"cited_paper":"/paper/2506.08797","citing_paper":"/paper/2607.20174"},"observation_digest":"sha256:4f7d47afe641fc12c62545dbf2323439c4addddb8c5daf88a829ce0338e60d37","observation_id":"96207e89-b4cf-4340-a436-2da9dfdc30b4","resolution":{"observed_at":"2026-08-01T10:37:53.829539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08797/citation-record","integrity":"/paper/2506.08797/integrity","json":"/paper/2506.08797/citation-record.json","paper":"/paper/2506.08797"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T05:07:14.990221Z","title":"Blattmann, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:14.990221Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:543c9ab8b415bdc5a4ebac9372cd51e650116b42433dc4a8a418f980c608b2fc","observation_id":"b0ca87d1-4796-4256-ad53-f730ee11e621","resolution":{"observed_at":"2026-08-07T05:07:14.990221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:16.044810Z","title":"Caron, H","venue":null,"work_id":"6976c2bc-4630-4eaa-9725-17ba64cec378","year":2021},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:14.994895Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:dce70af541345af49d6d3075cb481ad1e4af78ce4842252ee434330a386554b4","observation_id":"ae459ba1-010d-4845-8394-1058f9fdecb7","resolution":{"observed_at":"2026-08-07T05:07:16.048518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:16.032882Z","title":"Chang, Y","venue":null,"work_id":"1f09d602-979e-41de-b9d3-b0b816c878b0","year":2023},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:14.999349Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:9d9afce46d0ce84798a76e6306f25611133e1a037ff92389c50ec383db6f9d09","observation_id":"0220a26c-8c11-4f9c-812a-d556b4e0d301","resolution":{"observed_at":"2026-08-07T05:07:16.036510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:16.020858Z","title":null,"venue":null,"work_id":"62c6271a-6d32-4c27-878c-070616c72d5e","year":2025},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.003301Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:3ea9aac618f6d6db46bd83f45aa46665726eee0297c10422d7477a184a047eea","observation_id":"f97e95c5-d0b4-4ce1-91a3-0836e6316685","resolution":{"observed_at":"2026-08-07T05:07:16.024565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:16.008649Z","title":null,"venue":null,"work_id":"051e4648-a437-4f9e-8872-ca6dcb2b3fe7","year":2016},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.007770Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:45b90b5911525d4c81bfc7f4e7b030954f2f2eab009814645ce6649a8fb5a4f5","observation_id":"4a7a9c56-3416-4d80-bd3f-af0a6ade30e2","resolution":{"observed_at":"2026-08-07T05:07:16.012438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-08-13T18:01:17.322810Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-08-07T05:07:15.011660Z","title":"Corona, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.011660Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:5bb53351b3eb27fe3a855a43a69ba9a3d6ea857bf580beeb0c0f88e54512f1cf","observation_id":"b1686fa9-01dc-4ba4-91c5-e233b32bcb2f","resolution":{"observed_at":"2026-08-07T05:07:15.011660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.016076Z","title":"Esser, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.016076Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:8bcf4c69ac523a7c1493f6046a9546209bcb58d869510627b0190729d2398bb8","observation_id":"ae9fa597-04f9-4565-bd5e-b4e03bb22212","resolution":{"observed_at":"2026-08-07T05:07:15.016076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16942","last_updated":"2025-03-25T08:12:22Z","snapshot_observed_at":"2026-08-10T11:19:49.920472Z","submitted_at":"2025-03-21T08:40:35Z","title":"Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model","version":3},"cited_work":{"arxiv_id":"2503.16942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16942","snapshot_observed_at":"2026-08-07T05:07:15.697037Z","title":"Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model","venue":"cs.CV","work_id":"c52b82f6-e1f1-4d06-b4a5-a72166c8ffae","year":2025},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.020125Z"},"links":{"cited_paper":"/paper/2503.16942","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:12197633528ec1f08b57abb526ae8b8f1dd8ac6b38ad9d07ddb0a6d1d66c6a5a","observation_id":"de855897-b19b-43bd-b91f-bdbd81174438","resolution":{"observed_at":"2026-08-07T05:07:15.702938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.987971Z","title":"Ghosh, R","venue":null,"work_id":"dce64bdb-e641-4c5c-b999-c53352919283","year":2023},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.024580Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:36a8822a558482a5c446b4a2981cf99fa2e00ed0af6df7f66747c997b372d60e","observation_id":"1bb3af1c-2a0f-4f5f-8cbe-f1d10a43893d","resolution":{"observed_at":"2026-08-07T05:07:15.991435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.976483Z","title":"Heusel, H","venue":null,"work_id":"38512355-3f79-47a8-93df-b0637ecd903a","year":2017},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.028260Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:1aa94325805c2a15102fe44146da306edc2c36e8edff968ce85228478e44c04c","observation_id":"66442418-fbac-4938-96ff-d3afea193c17","resolution":{"observed_at":"2026-08-07T05:07:15.980094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.964319Z","title":null,"venue":null,"work_id":"a8726a00-b341-446e-961f-90a1b92ac29d","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.032053Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:6b675184811f472d67418dbc73f56ab39eab7b8b159651384e87cd954f578c2b","observation_id":"3eb2ed14-aaa6-4e03-952a-3acaaf760805","resolution":{"observed_at":"2026-08-07T05:07:15.968197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06145","last_updated":"2025-02-10T04:20:11Z","snapshot_observed_at":"2026-08-12T07:46:13.550482Z","submitted_at":"2025-02-10T04:20:11Z","title":"Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06145","snapshot_observed_at":"2026-08-07T05:07:15.035885Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.035885Z"},"links":{"cited_paper":"/paper/2502.06145","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:fd2a494929d6ca1a90b8f617aaa8285018170943ac81b06cbe2261f05b9ae08b","observation_id":"85e619ce-9d97-4571-8c6b-cad9d204c591","resolution":{"observed_at":"2026-08-07T05:07:15.035885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.952650Z","title":"Huang, F","venue":null,"work_id":"7847e413-ab42-4f83-82b3-0113594f19e0","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.039605Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:418e87036c12d18c236aafbf15d661b7a3463e59fbbdff8ac2bd83db7a028f25","observation_id":"65ac84c3-2cb5-4cf1-9e4c-e237b7ff3b63","resolution":{"observed_at":"2026-08-07T05:07:15.956274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16331","last_updated":"2025-06-05T11:49:59Z","snapshot_observed_at":"2026-08-12T13:11:55.603094Z","submitted_at":"2024-11-25T12:24:52Z","title":"Sonic: Shifting Focus to Global Audio Perception in Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16331","snapshot_observed_at":"2026-08-07T05:07:15.043271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.043271Z"},"links":{"cited_paper":"/paper/2411.16331","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:76ed03d113b2062167f80bafb3270fafd69303cafaff40dcd27d106bc73f7d8d","observation_id":"b60969b4-3581-4303-999a-c620a3b768f8","resolution":{"observed_at":"2026-08-07T05:07:15.043271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.940803Z","title":"Jiang, Z","venue":null,"work_id":"0f27b142-c6cd-44de-9260-897810b1fd82","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.047279Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:9a408897472cd11aef2b7418742cfc72ad565b423bbabf4d0f03606ce6cddc77","observation_id":"09c495b4-da43-45ba-8c73-a0fa6310d9ba","resolution":{"observed_at":"2026-08-07T05:07:15.944542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.928783Z","title":"Jiang, Z","venue":null,"work_id":"61b15b03-d561-4001-9dfa-88e111c28bbc","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.050852Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:efca754321fdc7c3155c90e7922d53912e463cd9138dacf2f780d0c8a648bd48","observation_id":"fbc50b40-7c98-4fa7-864b-389ee098231c","resolution":{"observed_at":"2026-08-07T05:07:15.932510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-07T05:07:15.054368Z","title":"Jiang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.054368Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:dca0500b381bb25b73efb1cfcbe9864900dacdd3f54ddb27de36600641b9f51c","observation_id":"bd07486d-a18f-48d6-ac7a-5c469db53935","resolution":{"observed_at":"2026-08-07T05:07:15.054368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T05:07:15.058186Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.058186Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:6e2e86a5244ff51d9fe6dbf5a1171bf386a00481ffddcd8828bbff8cbc6e5197","observation_id":"ee91f300-9ad8-4abf-8bb7-d6cea612440f","resolution":{"observed_at":"2026-08-07T05:07:15.058186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T05:07:15.061950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.061950Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:afa4b512f720c46ee1bed08f72c6fe3b04f460cd24e2df90cc344e9beac18d59","observation_id":"54dd8474-957c-45fe-8996-b5ec7fd95e48","resolution":{"observed_at":"2026-08-07T05:07:15.061950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.915814Z","title":null,"venue":null,"work_id":"8ea8143b-fcd9-460e-a8d0-5789e43524e9","year":2023},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.065656Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:f2126b4c746ad0b16765430358912e8f1757e89b3e9ea31548b4fb448cac0fa3","observation_id":"ec9eb658-dbd3-48f9-a893-5ca6d3a0608a","resolution":{"observed_at":"2026-08-07T05:07:15.920091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01876","last_updated":"2025-04-05T05:31:38Z","snapshot_observed_at":"2026-08-12T22:52:22.377483Z","submitted_at":"2024-09-03T13:19:31Z","title":"CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01876","snapshot_observed_at":"2026-08-07T05:07:15.069517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.069517Z"},"links":{"cited_paper":"/paper/2409.01876","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:af530f1240c8f459a8e98f818002f8df5cc2fe4069ddf462ff616af822db8710","observation_id":"cfd25029-0362-4163-8bca-e628478d122c","resolution":{"observed_at":"2026-08-07T05:07:15.069517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-14T07:42:52.531248Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-07T05:07:15.073459Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.073459Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:495bc34d97017736cf4ff6798ea921fe4c9a11b8cfdb31e14b242f60173a0628","observation_id":"b23d7f39-b1a6-4e11-9b16-4b50e8928c45","resolution":{"observed_at":"2026-08-07T05:07:15.073459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T05:07:15.077554Z","title":"Lipman, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.077554Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:dd77a8c175dfbd094e35d0dded97af81a0597066e630e4f7bf2020f5a8bd223f","observation_id":"0d936f60-8589-456f-872e-634135e14145","resolution":{"observed_at":"2026-08-07T05:07:15.077554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.903084Z","title":null,"venue":null,"work_id":"a9869500-6168-45fc-8a13-411f59d19864","year":2023},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.081439Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:f2b0d5ea284b2bff57757f45608d136b5fafd05f0039b3f5281c5ed080841d42","observation_id":"a5af6cab-0e8a-4acf-a7f5-623ac1baeb75","resolution":{"observed_at":"2026-08-07T05:07:15.906640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.890777Z","title":null,"venue":null,"work_id":"acc6bc25-7bbb-4f90-9713-88fab1e09f8c","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.085543Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:df02e3218af330e9bca09e30e8617964ce37652e4448c5ec6fc4e6158a45d0e5","observation_id":"7d5c20ba-b5c1-4483-86d3-30b4e8471066","resolution":{"observed_at":"2026-08-07T05:07:15.894523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.878847Z","title":"McFee, C","venue":null,"work_id":"598a00ec-6be5-4cd3-9f92-c8cab4efebf4","year":2015},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.089605Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:6383b518938bab35eb8a7abc023affed23906ef2fee58ad09ec44267adc85747","observation_id":"617c4b12-378c-488b-b0ef-02e5e9dd2683","resolution":{"observed_at":"2026-08-07T05:07:15.882539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16160","last_updated":"2025-06-11T08:28:01Z","snapshot_observed_at":"2026-08-12T22:38:33.785879Z","submitted_at":"2024-09-24T15:00:07Z","title":"MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16160","snapshot_observed_at":"2026-08-07T05:07:15.094291Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.094291Z"},"links":{"cited_paper":"/paper/2409.16160","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:25da78149ed320fa96f4b252c2042df83493f0475c6b81ce0c003a0dbe607a75","observation_id":"e88431f2-74ff-4469-93e9-fb36edb08c7e","resolution":{"observed_at":"2026-08-07T05:07:15.094291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.098106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.098106Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:491ba63691099bd2a3a3a951da3172b6ebdcd27afdccf085b7f2ed97a4bd30d8","observation_id":"65e7f9bc-1091-4f8d-a439-60a3744b5faa","resolution":{"observed_at":"2026-08-07T05:07:15.098106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16212","last_updated":"2024-12-18T00:37:55Z","snapshot_observed_at":"2026-08-13T22:21:56.794857Z","submitted_at":"2024-12-18T00:37:55Z","title":"ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16212","snapshot_observed_at":"2026-08-07T05:07:15.101686Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.101686Z"},"links":{"cited_paper":"/paper/2412.16212","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:50b02a005ee908de98c6a3616641ce4c403937db535af7d7e565b32e60f5ccc6","observation_id":"a4743763-47f5-4b1c-8470-485a02c0b32a","resolution":{"observed_at":"2026-08-07T05:07:15.101686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06553","last_updated":"2025-07-07T05:09:32Z","snapshot_observed_at":"2026-08-13T05:04:55.541639Z","submitted_at":"2023-12-11T17:41:17Z","title":"HOI-Diff: Text-Driven Synthesis of 3D Human-Object Interactions using Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06553","snapshot_observed_at":"2026-08-07T05:07:15.105677Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.105677Z"},"links":{"cited_paper":"/paper/2312.06553","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:5bfdb898201770b49a9474c3b86891b8e155bf452e5ef43bf9afdbdd32168e39","observation_id":"4dcea8d2-cb25-4ec2-9951-010cb855c598","resolution":{"observed_at":"2026-08-07T05:07:15.105677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.866734Z","title":"Radford, J","venue":null,"work_id":"be841af3-c3aa-488d-aa60-3e9bec1f8e58","year":2021},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.109313Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:0e4f8a714da22c38cbf07c63dead4940a2b19443554de8549529f99269d33524","observation_id":"0ad89ee6-9fe6-4f38-a2cf-4f596193cb7c","resolution":{"observed_at":"2026-08-07T05:07:15.870529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T05:07:15.112832Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.112832Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:2d80259dd87908da3f7c0b64add1ec2bed369aadd0550c7e8b044e558f6ec8f2","observation_id":"7bf6a82f-9aa0-4b4f-b799-aa2eb985cab8","resolution":{"observed_at":"2026-08-07T05:07:15.112832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.855073Z","title":null,"venue":null,"work_id":"818584bb-6abb-43a3-932e-a6d6c6c070b1","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.117225Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:d164642732f796d768b6458e7b7a9a3a49769f8c8ee9061ca7cdc7f757a4dffb","observation_id":"31de9a2b-2e04-436a-b098-dda4e6952cce","resolution":{"observed_at":"2026-08-07T05:07:15.858624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.120920Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.120920Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:1f5c1c7f264813f69012a3bda371bebb81d00e32480d67134ac40ad48aed832e","observation_id":"fd3f0e28-2d5d-45df-9678-7c1b18453a12","resolution":{"observed_at":"2026-08-07T05:07:15.120920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.834955Z","title":null,"venue":null,"work_id":"dc92f878-70bc-4531-9de1-32a5ed9ac714","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.124595Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:cec1dab229eec2b55096b42556c1e59fdc90de0eb37ee486c4bc88778f4c46c3","observation_id":"484fe3bb-2ce6-4ff8-8570-ae5d2a8f3313","resolution":{"observed_at":"2026-08-07T05:07:15.838532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17697","last_updated":"2024-11-27T07:39:20Z","snapshot_observed_at":"2026-08-12T15:54:01.295306Z","submitted_at":"2024-11-26T18:59:22Z","title":"StableAnimator: High-Quality Identity-Preserving Human Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17697","snapshot_observed_at":"2026-08-07T05:07:15.128129Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.128129Z"},"links":{"cited_paper":"/paper/2411.17697","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:444b012c0a108eca099dd55db5b089aac5fc1693c7b23314ecf2209bf1d1412d","observation_id":"a04d0853-748d-49a4-bd63-e9d7f45dcbd0","resolution":{"observed_at":"2026-08-07T05:07:15.128129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-07T05:07:15.131757Z","title":"Unterthiner, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.131757Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:770e615f6d0ca468d0abb096ea0e8b16f161c078be7973aac7d208cebc003295","observation_id":"6d1904a6-f7fe-4897-bd51-2227546b86b2","resolution":{"observed_at":"2026-08-07T05:07:15.131757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T05:07:15.135416Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.135416Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:5d3402160ca94e1a43399987457507bba64f617013509ff5255da10fa9669dc0","observation_id":"d2dca16d-e51f-45be-82a3-418c67c2a856","resolution":{"observed_at":"2026-08-07T05:07:15.135416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:07:15.139064Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.139064Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:5d5ee39bb6661bf568d35d543a9b8500de85a43285c166c91bb94677a5696b10","observation_id":"eae3a003-2f1b-4816-b084-79848605e6c1","resolution":{"observed_at":"2026-08-07T05:07:15.139064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.823490Z","title":null,"venue":null,"work_id":"865a9448-92e0-4204-b7f2-a4975f8f6f47","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.142718Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:4a3f959e4db8947ded722e7324296d4619bf409fef557a4c0f431f63dbac79d9","observation_id":"4838ac87-d887-4cd9-ab43-df53cbe08d6f","resolution":{"observed_at":"2026-08-07T05:07:15.827007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01188","last_updated":"2024-06-03T10:51:10Z","snapshot_observed_at":"2026-08-12T23:51:43.869038Z","submitted_at":"2024-06-03T10:51:10Z","title":"UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01188","snapshot_observed_at":"2026-08-07T05:07:15.146443Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.146443Z"},"links":{"cited_paper":"/paper/2406.01188","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:7e89e784f57e96c1d01e53b70388384cd21f0a489d2a7dfe1a5991057f4689ab","observation_id":"91ca9bd0-f838-4fa4-acdd-9ef2b09d78a0","resolution":{"observed_at":"2026-08-07T05:07:15.146443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.150092Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.150092Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:62a3ac359a9f09aa5eb0bbda0d1c5f48602627a0ef5c982095a4578ab4bee6a9","observation_id":"dc0a1690-b236-4020-bb5d-04958a9d41c7","resolution":{"observed_at":"2026-08-07T05:07:15.150092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.811977Z","title":null,"venue":null,"work_id":"9d5209cb-c6f5-40f7-8b65-779728321379","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.154172Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:b890b738833c886b812dd75d28708aea8adeff7c67dab6eb51efbe1815d9b2bd","observation_id":"4f40aa06-c7c2-4967-9623-69976fed45b0","resolution":{"observed_at":"2026-08-07T05:07:15.815546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.799290Z","title":null,"venue":null,"work_id":"a047f3a4-ffda-4c57-b685-6fcbe7283dbe","year":2023},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.157826Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:b1193e94b4611abaa4049bbbbdd69bb2d229c51a0206d2904eb2800bc31dd65a","observation_id":"fd352863-e67c-4f0d-854d-90d3ee8b8360","resolution":{"observed_at":"2026-08-07T05:07:15.803322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17383","last_updated":"2025-06-23T06:27:21Z","snapshot_observed_at":"2026-08-13T13:22:13.959413Z","submitted_at":"2024-11-26T12:42:13Z","title":"AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17383","snapshot_observed_at":"2026-08-07T05:07:15.161431Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.161431Z"},"links":{"cited_paper":"/paper/2411.17383","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:490e855170990d6203dec66827d61c389ec76565a062bf6bfd763f7eb401c9b0","observation_id":"d82759de-ba97-4831-9f09-2ce941a4833e","resolution":{"observed_at":"2026-08-07T05:07:15.161431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.786463Z","title":null,"venue":null,"work_id":"f62eb249-1b23-42a6-9e04-3987b1af5172","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.165245Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:2594eb0ee62b3d44407d9c42743fc6a07ef25c4c1389888b1fd6eae88183475c","observation_id":"433e54dc-d2aa-4faf-8152-6f221b269c38","resolution":{"observed_at":"2026-08-07T05:07:15.789992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07754","last_updated":"2024-11-08T21:35:16Z","snapshot_observed_at":"2026-08-12T23:45:05.474893Z","submitted_at":"2024-06-11T22:31:29Z","title":"HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07754","snapshot_observed_at":"2026-08-07T05:07:15.168770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.168770Z"},"links":{"cited_paper":"/paper/2406.07754","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:67f3db7c624931d8f20d9257cd2bd04e7dd3e6bd6b6981cedcbb3c9b51fb300b","observation_id":"84bebacb-0d3f-4e78-85fb-f212ed8f2ca5","resolution":{"observed_at":"2026-08-07T05:07:15.168770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.774721Z","title":null,"venue":null,"work_id":"f0fb250b-b025-47f0-843c-19d587976bf8","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.172606Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:229eefe4e6aa19879cb457f8e46313d38f7f752a877caa76bfdcae61cdbfb75f","observation_id":"81cf7fda-803e-4bbb-9e3c-101e60cac3e8","resolution":{"observed_at":"2026-08-07T05:07:15.778193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.762923Z","title":null,"venue":null,"work_id":"21f387f5-6a13-462c-bc79-70799dd0ea7a","year":2023},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.176525Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:89959df69b18f3477796af9a66b71c17ce5b64f3709035150cb3f8e265c7abd9","observation_id":"8083b526-4c7a-4a20-a453-1c66d4e64b98","resolution":{"observed_at":"2026-08-07T05:07:15.766481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.750399Z","title":"Zhang, X","venue":null,"work_id":"fce3bf4a-01b4-4404-9a2a-ea0ad5a8b00e","year":2023},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.180425Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:4ef7402a370527b6f834dec1fd18cf1068247e7d28787fa28e3a7e8ffb7f6ffc","observation_id":"12113b3d-b607-4cd5-91dd-38834a3c3a54","resolution":{"observed_at":"2026-08-07T05:07:15.754349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-13T04:40:24.036354Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-07T05:07:15.184611Z","title":"Zhang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.184611Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:0c090b0d4c9faa3fc4a7f758a2f2f5e9a3720886fed78d641a520c9ef8134596","observation_id":"81d175ab-acfe-476a-86f2-1be1d4a54a75","resolution":{"observed_at":"2026-08-07T05:07:15.184611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-08-12T22:19:09.109938Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-08-07T05:07:15.188299Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.188299Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:6c9261dc9c9473ed803b9ce9fd3c176f80c04cfb8b6b1a10f05d7b7941920f52","observation_id":"8298ced2-5661-40d2-a24b-03c834d10b85","resolution":{"observed_at":"2026-08-07T05:07:15.188299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:15.738196Z","title":null,"venue":null,"work_id":"423148f9-fecb-4819-87a4-ead9ec6a3e17","year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.192008Z"},"links":{"citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:467b0f9df90506fca62ec6f80d2895f10cfe11d3afb5f4c2c8ed2552b76660c6","observation_id":"9891aa66-5325-4f7d-b603-e7a25078fd66","resolution":{"observed_at":"2026-08-07T05:07:15.741878Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T20:45:07.349070Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 7 inbound Pith citation observations for arXiv:2506.08797."}