{"as_of":"2026-08-09T00:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7dc099966a3eddbab79c2d0c2d94ce0cad1be0c0196121f8ba697f87d8274322","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:51:18.368996Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T00:59:43.745654Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:09:56.485116Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"cited_work":{"arxiv_id":"2603.14686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.14686","snapshot_observed_at":"2026-08-04T01:52:33.282752Z","title":null,"venue":null,"work_id":"b20be148-7368-4a2e-8332-958a47edf80a","year":2026},"citing_paper":{"arxiv_id":"2604.14556","last_updated":"2026-04-16T02:39:15Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T02:39:15Z","title":"Controllable Video Object Insertion via Multiview Priors","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T11:44:17.033051Z"},"links":{"cited_paper":"/paper/2603.14686","citing_paper":"/paper/2604.14556"},"observation_digest":"sha256:91cbd8a672e69aebf4a79882429184da16e6de374d80bb216eda0a024ab98e8e","observation_id":"d380bd2e-4ecb-4882-b390-a636882722b2","resolution":{"observed_at":"2026-08-04T01:52:33.282752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"cited_work":{"arxiv_id":"2603.14686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.14686","snapshot_observed_at":"2026-08-04T01:52:33.282752Z","title":null,"venue":null,"work_id":"b20be148-7368-4a2e-8332-958a47edf80a","year":2026},"citing_paper":{"arxiv_id":"2606.24498","last_updated":"2026-06-23T12:30:04Z","snapshot_observed_at":"2026-08-05T20:07:28.394395Z","submitted_at":"2026-06-23T12:30:04Z","title":"VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T00:59:43.745654Z"},"links":{"cited_paper":"/paper/2603.14686","citing_paper":"/paper/2606.24498"},"observation_digest":"sha256:e2d76bd35632edc90367e0fa6dbd48364270f601a158e8cc381e99992ea08bdc","observation_id":"38925e92-2ad6-4530-97bb-74311b3b8347","resolution":{"observed_at":"2026-08-04T01:52:33.282752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.14686/citation-record","integrity":"/paper/2603.14686/integrity","json":"/paper/2603.14686/citation-record.json","paper":"/paper/2603.14686"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-04T05:51:18.098812Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.098812Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:0999f3f9654d2ec8ca2f9f1a0fa15967543d761df3223fec3522818ae4d24fe5","observation_id":"b1aa708c-375e-4a52-867e-68f4f8ab4712","resolution":{"observed_at":"2026-08-04T05:51:18.098812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.105517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.105517Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:800c06b3ba42f01ef552e2c31d3c3a094ebfdd23dea347ebb11f156b206a5c1a","observation_id":"e29c055a-350e-4ff8-9f65-44c65b6e6ee6","resolution":{"observed_at":"2026-08-04T05:51:18.105517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-07T20:58:14.689758Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-08-04T05:51:18.110781Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.110781Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:a8f9aa4d5fac1954edfa4bb591e0f0d50e21926525bd722515d078d01d916ee5","observation_id":"e55e8956-b8f0-4f28-8a80-3d82ee835944","resolution":{"observed_at":"2026-08-04T05:51:18.110781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.115975Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.115975Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:3c8305f6ff554db492b3eebf483ace1a6836386696a6a91aede78cd59651b288","observation_id":"b510ec62-daa0-4da5-ae4a-7cb0773c249d","resolution":{"observed_at":"2026-08-04T05:51:18.115975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.120659Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.120659Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:33d4f0251e455a7dccd8035f33eb95e268e239817bcb01c9bb022a04f609de65","observation_id":"d18c06b5-69be-4030-9fce-1223b936dc7b","resolution":{"observed_at":"2026-08-04T05:51:18.120659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.126833Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.126833Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:c74bb344778583fffa487a03ada39acf9007678daf8eef55cf6aad9e4235dc0d","observation_id":"9ff5ed00-7ae5-492b-b778-91a3e60a7ea9","resolution":{"observed_at":"2026-08-04T05:51:18.126833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.138845Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.138845Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:838291ad9aae40ebe5fdacdd39ad928c68c66ee98e363717541d733519839149","observation_id":"490134c9-613a-49b7-b5bf-be4e2c19bd48","resolution":{"observed_at":"2026-08-04T05:51:18.138845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.143944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.143944Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:3c72d2887a2880904b1435dba1c1a922e77cb432095fcf19b28460ed9230f005","observation_id":"c6840a51-fe24-4d12-a38e-61f3f85afeb0","resolution":{"observed_at":"2026-08-04T05:51:18.143944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-04T05:51:18.152357Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.152357Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:fdb3711351a2a6971feae2dcd01f9aa11910056881a35f4dd55e88d1b10aac88","observation_id":"038ae1d7-c724-47d8-860d-9402ba8ba5e0","resolution":{"observed_at":"2026-08-04T05:51:18.152357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-04T05:51:18.157830Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.157830Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:12a9005aff923ee338e9e79ff45c606821971cca5d2466b5da2d3ffb4cdc3bc6","observation_id":"bb95b24b-9a80-490d-b510-3b6420cf8919","resolution":{"observed_at":"2026-08-04T05:51:18.157830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-04T05:51:18.163164Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.163164Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:c7238cc00c0683b5b9f215e8e1d167fc935d5905ef4c86b9a3ac3069721d139e","observation_id":"133b439f-3eac-4fb4-9b53-14a50f0180d9","resolution":{"observed_at":"2026-08-04T05:51:18.163164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-04T05:51:18.169044Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.169044Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:a2910f9878817f7ab021fdf568d86e3e702f086728e77b19d5d381378bacf752","observation_id":"c97ce011-c67f-4cbf-a1d6-0403d5d9fecc","resolution":{"observed_at":"2026-08-04T05:51:18.169044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-07T04:59:22.282816Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08797","snapshot_observed_at":"2026-08-04T05:51:18.179232Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.179232Z"},"links":{"cited_paper":"/paper/2506.08797","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:9531ccb5a36f57212b8e25bdacded7bc72af9f18a345aac48c59d738cf55ab83","observation_id":"d6adda24-10da-4a15-b2b2-8317664b43b4","resolution":{"observed_at":"2026-08-04T05:51:18.179232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08634","last_updated":"2024-07-11T16:15:47Z","snapshot_observed_at":"2026-07-06T18:44:57.578408Z","submitted_at":"2024-07-11T16:15:47Z","title":"RTMW: Real-Time Multi-Person 2D and 3D Whole-body Pose Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08634","snapshot_observed_at":"2026-08-04T05:51:18.185135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.185135Z"},"links":{"cited_paper":"/paper/2407.08634","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:ab8de459eb2f874e3a67d0a1ddbb051f5b14136949f332cb786f21467898cf8f","observation_id":"cd5008ab-a760-4c54-a698-5794c5011dfa","resolution":{"observed_at":"2026-08-04T05:51:18.185135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.192246Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.192246Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:1b1d37286ecb6491389e54f652a60d2f19264ea2fa0f9255c20131d120689f96","observation_id":"ce23bc03-0137-4b26-82cf-d439a1628d84","resolution":{"observed_at":"2026-08-04T05:51:18.192246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T05:51:18.204730Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.204730Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:6dcd9dd2a6a2e34c32d0202dd84729a047e3748f331ad16131b4ded664d17ac4","observation_id":"b218307f-9b56-46b9-9a4b-36196cf3f4be","resolution":{"observed_at":"2026-08-04T05:51:18.204730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-04T05:51:18.215614Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.215614Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:d5888636f7c9ff359203c64f22cf67dbf031f8087ebdb042a0f42d5ab9321069","observation_id":"c5b06e17-aa0b-4273-a73b-8b29735ecb1a","resolution":{"observed_at":"2026-08-04T05:51:18.215614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.221154Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.221154Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:01e5bac33e022233f46d419c7dfd8d60332e9c3f352e28b1a87e1f199cf6a835","observation_id":"e21ede37-84ea-46d8-a57f-ad12acb28182","resolution":{"observed_at":"2026-08-04T05:51:18.221154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-04T05:51:18.232473Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.232473Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:ec1c8ce547e358be10607893b074b3a71e7a45555de4f581ded2049faca95ecc","observation_id":"b16c105f-f6af-4215-ad0b-6fb297f91cdc","resolution":{"observed_at":"2026-08-04T05:51:18.232473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-04T05:51:18.237773Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.237773Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:c5144493daade35fdd6e7c6fffab5185e1b3186787547cedeeb8dee8e5f53540","observation_id":"16979f16-ebb9-4677-b32a-776376fd6c4f","resolution":{"observed_at":"2026-08-04T05:51:18.237773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.243683Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.243683Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:d98a7391bb22f90f78e24f2f3e5cd092f5a9b2459f70e865515bbeedd726a02f","observation_id":"04d54133-eb18-4228-a6f2-5658f12fa613","resolution":{"observed_at":"2026-08-04T05:51:18.243683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.255365Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.255365Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:8972ab1f38b0d9ba57cfa68a5366566b97c027f11cdc9d6cea8fad8c656c6777","observation_id":"f01654d5-378e-4f14-9079-a98f9a64b87e","resolution":{"observed_at":"2026-08-04T05:51:18.255365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.260833Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.260833Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:099ae6307522ed23fbd8d2fb0e58f552a8fe34c94e12b20ffcafc702f48f47e9","observation_id":"068d8b06-fb24-4022-888d-ab858b393888","resolution":{"observed_at":"2026-08-04T05:51:18.260833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-04T05:51:18.267443Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.267443Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:4fc1060f0d682ccccce60f2d12daa03ab7271f3cc82124c2783b45f7c14a4462","observation_id":"5c40f80d-7768-49f7-a28a-f4b114bbe64c","resolution":{"observed_at":"2026-08-04T05:51:18.267443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.248963Z","title":"InProceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.248963Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:8fb202d6d7877519b0a03e9d2a731ebd2faab2dae401222ac9d6b938a77383e8","observation_id":"04532f0f-0f71-4dac-8848-862446cf5bc6","resolution":{"observed_at":"2026-08-04T05:51:18.248963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.278318Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.278318Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:2ee1092ae2a54c8ffbc5da3056408d4b38e39c16397037a0b65cf5e865bb6075","observation_id":"455c3f13-6a47-4e7c-af02-b4c4abf191af","resolution":{"observed_at":"2026-08-04T05:51:18.278318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-04T05:51:18.283800Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.283800Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:125c15f658f477a0a972994010eefa4b8829c3d82355fb9542092359cd7c1342","observation_id":"18119a37-0603-4057-9a07-671a26fcbc29","resolution":{"observed_at":"2026-08-04T05:51:18.283800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.288763Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.288763Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:e4ef5949a427ab70afd2aca55ced0feedb2f91c8bb55bb2522baaf5f4372f1a3","observation_id":"e32f25a6-a742-480c-a4dc-8e7b60e0d4a6","resolution":{"observed_at":"2026-08-04T05:51:18.288763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.272924Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.272924Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:0eaac5ca1f2c2df5ed70870c6a5dcce1a1e3b728ef23db2bfc898e195c6dd67b","observation_id":"3f551690-9f63-4a02-b25b-03ae57310c35","resolution":{"observed_at":"2026-08-04T05:51:18.272924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.300737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.300737Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:98c43c45f66054be1b63fe5391d10301ff30c05a5bd2aa08643cdc4d7b3f4b84","observation_id":"6aebffb1-0f1a-44a7-86ae-ab297ce6e65e","resolution":{"observed_at":"2026-08-04T05:51:18.300737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13347","last_updated":"2026-03-07T07:01:59Z","snapshot_observed_at":"2026-08-02T12:12:15.465550Z","submitted_at":"2025-07-17T17:59:53Z","title":"$\\pi^3$: Permutation-Equivariant Visual Geometry Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13347","snapshot_observed_at":"2026-08-04T05:51:18.305928Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.305928Z"},"links":{"cited_paper":"/paper/2507.13347","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:c353efe94087cee99aa826530c611ef488a2b703895d6f3d8f0b415db030c149","observation_id":"6b6c40c3-0cb7-466a-804b-f41bee43aa1f","resolution":{"observed_at":"2026-08-04T05:51:18.305928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.311084Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.311084Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:bd0969988d5566e3bca878059e96b501ca8d34e55b11f0b23bf5fceb1e5df512","observation_id":"03da2018-497a-4bf2-9c50-105062db989f","resolution":{"observed_at":"2026-08-04T05:51:18.311084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10568","last_updated":"2025-08-27T03:34:57Z","snapshot_observed_at":"2026-08-08T16:12:04.523586Z","submitted_at":"2025-06-12T10:58:23Z","title":"DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10568","snapshot_observed_at":"2026-08-04T05:51:18.294240Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.294240Z"},"links":{"cited_paper":"/paper/2506.10568","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:4268c2be6eea68cd0939685c7860ce0a189074b5fc98d9a2d30186941db3099f","observation_id":"be3e3eba-ad2f-4489-b69e-9ae609aadbb7","resolution":{"observed_at":"2026-08-04T05:51:18.294240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.321386Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.321386Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:ce46fcd039f5b2379f2cf47902fe177d722ec5756c9972ef735d1d84cc914f41","observation_id":"3040c207-a712-458a-84e4-e2076723cad9","resolution":{"observed_at":"2026-08-04T05:51:18.321386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.326505Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.326505Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:ca40960ee627a7992b0c3a874f933ecc32f64f2e73a2376d63b2df486ac5233e","observation_id":"500fe1d5-d8c3-499e-a066-fcbdc3341779","resolution":{"observed_at":"2026-08-04T05:51:18.326505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.331988Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.331988Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:b1e0f2dda0d92cd5078589a6f96a482b23963dbe6dca767b191cef10be5ae241","observation_id":"c5a55f1f-e6f0-4b1e-bd12-009264df94b3","resolution":{"observed_at":"2026-08-04T05:51:18.331988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17383","last_updated":"2025-06-23T06:27:21Z","snapshot_observed_at":"2026-07-06T19:57:14.289258Z","submitted_at":"2024-11-26T12:42:13Z","title":"AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17383","snapshot_observed_at":"2026-08-04T05:51:18.316887Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.316887Z"},"links":{"cited_paper":"/paper/2411.17383","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:fe0ee7915b105b4ba6cbae229899bbe1b28e71fa217f5d74bbbdc0804aed01ef","observation_id":"6604432f-ebaa-4d44-a338-b4e6769e4fa7","resolution":{"observed_at":"2026-08-04T05:51:18.316887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-04T05:51:18.341928Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.341928Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:b64913af62038f4e7a68eebd92729c8361fe9818892a5ff156b73bdf734ed101","observation_id":"a3c75d5f-5f17-46d8-a0a3-a045909e59d5","resolution":{"observed_at":"2026-08-04T05:51:18.341928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.347090Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.347090Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:ed3537338a3c0fae9905d3474b21653962ab138091af7c70223290094bcaaf47","observation_id":"51ff2502-47e8-4c67-9e06-75716d625942","resolution":{"observed_at":"2026-08-04T05:51:18.347090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-07-06T22:30:31.933240Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-08-04T05:51:18.351672Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.351672Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:10cf7cea024762c7f7d09ca54a490f4d8a912c4f58db0a03d5c3193701c3bf61","observation_id":"ac46fc77-f504-4418-8c2e-e76e0b9c3484","resolution":{"observed_at":"2026-08-04T05:51:18.351672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.336435Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.336435Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:8600f5303922d35a34503f339496316f0e1e8ff50faecd90105b01d277880540","observation_id":"ed2c303c-9e75-4f58-9952-0a77f0615b85","resolution":{"observed_at":"2026-08-04T05:51:18.336435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.362675Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.362675Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:c5be2438f67ae5868fc7e56ef815191c1a0be460f08f96cefc2c624fdc58c3eb","observation_id":"13bfb6fa-cde1-4de3-9fb3-a6e25a97abc5","resolution":{"observed_at":"2026-08-04T05:51:18.362675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.368996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.368996Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:0631693f52a3dfc09706349e22dade934497db0d69fc1d3443a9da05d700c573","observation_id":"bacbffde-6624-4b81-93d3-eaa7844ff749","resolution":{"observed_at":"2026-08-04T05:51:18.368996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.357386Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.357386Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:d4531ad1600250ae2b060331c20df01efc387f0d9552babbd4af61dce1c388a3","observation_id":"69f03735-c228-4fb3-b692-a0287f117ffa","resolution":{"observed_at":"2026-08-04T05:51:18.357386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-04T05:51:18.226041Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.226041Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:f32e08260ecaa6ea0b00d77df043dac56edeb810b1b90d87043f1b716583233b","observation_id":"89f85e54-5606-424c-b4e4-237bd2bbec87","resolution":{"observed_at":"2026-08-04T05:51:18.226041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.132547Z","title":"InProceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.132547Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:b0bcada5b24780150e80c79122199de9aa9efafadeb6e70baaa4dcc43d946074","observation_id":"ed24f181-dec8-4e7a-a322-aaee1267b8d0","resolution":{"observed_at":"2026-08-04T05:51:18.132547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-04T05:51:18.200198Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.200198Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:43a87bf38e8e29e3e1c62ce799c91536379213e18fcf466707ce8d40cba25146","observation_id":"c19dee81-eaf7-4b91-be3f-d3db49139466","resolution":{"observed_at":"2026-08-04T05:51:18.200198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2603.14686."}