{"as_of":"2026-08-19T04:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75df54fffbdcf1874bfe5d08c00a031d78c52a4be60fbe804f81a6701d6231b9","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T07:25:41.219753Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T23:30:14.969895Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-16T23:31:22.000482Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"cited_work":{"arxiv_id":"2506.19840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","venue":"cs.CV","work_id":"4a4d269c-091f-49e2-80b9-a67c168ec15b","year":2025},"citing_paper":{"arxiv_id":"2512.09646","last_updated":"2026-04-08T15:03:02Z","snapshot_observed_at":"2026-08-11T07:14:41.090718Z","submitted_at":"2025-12-10T13:40:24Z","title":"VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T23:30:14.969895Z"},"links":{"cited_paper":"/paper/2506.19840","citing_paper":"/paper/2512.09646"},"observation_digest":"sha256:e134a456df9a41aeec6ac45733c416ab980db4aaa287fb7432c9acc8e76f99a8","observation_id":"4a07035f-929a-442a-9a64-d6dbb5889d01","resolution":{"observed_at":"2026-05-16T23:31:22.002931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"cited_work":{"arxiv_id":"2506.19840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","venue":"cs.CV","work_id":"4a4d269c-091f-49e2-80b9-a67c168ec15b","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-08-16T20:35:09.241083Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2506.19840","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:c647128dea5331135b108b5ce36034662cb5423519b7d92c935911a7c31b2b08","observation_id":"fce67bb8-d112-45d1-9e60-fdf9e3d2b5ba","resolution":{"observed_at":"2026-05-16T13:47:57.383574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19840/citation-record","integrity":"/paper/2506.19840/integrity","json":"/paper/2506.19840/citation-record.json","paper":"/paper/2506.19840"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://huggingface","venue":null,"work_id":"b488d487-bb29-4eb7-b981-700b7fde69f3","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:d681a05f5118103c9baf2fe9b936a8df01a8dacb8c150631275583c9373c8fb1","observation_id":"2d686a18-97ad-4803-ad5c-e21ec9abcca0","resolution":{"observed_at":"2026-05-19T07:27:09.391897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https : / / klingai","venue":null,"work_id":"c7d103d6-5f0f-443a-9521-4b3c07c5c052","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:d4302028699208cb42e45c95b79cb8f2d158efa948b6eb00ccbb7362ef9e90e9","observation_id":"6aef5841-5d96-4d7f-bf92-0beee8b0ee9b","resolution":{"observed_at":"2026-05-19T07:27:09.383113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https : / / klingai","venue":null,"work_id":"5cfd37e3-ce06-4c02-9e34-d6b80d3bf6d9","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7aa9b6b6667f0b94a3963efcb9ea236d9bd18db164990feb634b860008954b9e","observation_id":"ae8cea70-f067-4eee-a58e-543e57456759","resolution":{"observed_at":"2026-05-19T07:27:09.370562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Circle: Capture in rich contextual environments","venue":null,"work_id":"8101bad2-f569-4fca-8367-7b5c85e32eb8","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:77d11a8f0791b312831f4467235c98a490ffb94563526bebc9849bf94dc4a8cf","observation_id":"e94bc09f-f9df-4fa8-9b1d-fe8372b631f3","resolution":{"observed_at":"2026-05-19T07:27:09.387795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1ca4a5828b06a19f5966860cdeeaccc7ba07e42f73dd951258e68939c2a64a75","observation_id":"79e7acd1-7de7-44d2-a56f-9471e8513031","resolution":{"observed_at":"2026-05-19T07:27:09.017753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Align your latents: High-resolution video syn- thesis with latent diffusion models","venue":null,"work_id":"f53dec66-2659-4388-919b-933e2112f629","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:5b98607604c263cba25e26f96990bad6f4dd7d57532fec6ea697ddba19574a3b","observation_id":"0b34be10-717e-434d-b030-c5ffc30ce52b","resolution":{"observed_at":"2026-05-19T07:27:09.380862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08331","last_updated":"2025-08-06T08:27:53Z","snapshot_observed_at":"2026-08-17T00:18:17.415673Z","submitted_at":"2025-01-14T18:59:10Z","title":"Go-with-the-Flow: Motion-Controllable Video Diffusion Models Using Real-Time Warped Noise","version":5},"cited_work":{"arxiv_id":"2501.08331","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08331","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Go-with-the-flow: Motion- controllable video diffusion models using real-time warped noise","venue":null,"work_id":"0f39a941-ade2-4b23-91d0-49540e59835d","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.08331","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:10f22c3e7c43330dd7d22b8ef4d1ec1cc910dd0192862104852c19f9acafcad1","observation_id":"8e7dfc2e-fee8-46e4-b10a-53b6c422f84d","resolution":{"observed_at":"2026-05-19T07:27:08.987121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18597","last_updated":"2025-03-26T09:05:41Z","snapshot_observed_at":"2026-08-16T12:59:57.130892Z","submitted_at":"2024-12-24T18:51:19Z","title":"DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation","version":2},"cited_work":{"arxiv_id":"2412.18597","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18597","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2412.18597 (2024)","venue":null,"work_id":"09730fa6-d46e-4939-9bdf-6e28a187a693","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.18597","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1d92f3981ba61d3946f7fefe9c5e036e34924174ad5d486ba7f2c11e56851f68","observation_id":"64831998-ba09-4e44-9bf8-46a485de7063","resolution":{"observed_at":"2026-05-19T07:27:08.888669Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wang, and Gordon Wet- zstein","venue":null,"work_id":"4dbb6e77-39c1-4450-95c5-cbdce1eda652","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:135ae0a74cfcca7148b83068da19fdef4c35d3c4672976e5d887e89d98d8a4ec","observation_id":"18ccce00-371a-4fde-b02b-54c13375c4f3","resolution":{"observed_at":"2026-05-19T07:27:09.372865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen- erating human motion in 3d scenes from text descriptions","venue":null,"work_id":"4d570086-dc16-42ba-9d81-72533c24599a","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:d6827a63e4c7cc95b3d1410ba6a597aaa0636e5bfd818459ee39f67532997767","observation_id":"01b88b08-d983-4942-ab93-41a85ebec5fc","resolution":{"observed_at":"2026-05-19T07:27:09.432964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videocrafter2: Overcoming data limitations for high- quality video diffusion models","venue":null,"work_id":"7914f943-d80d-4ad6-9d09-f3f0510849a8","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:a8ccbba830eaa98c86d43a7649e6be89f83d3a1ef2df5d8ebba123130f06cbcf","observation_id":"d1813d2b-2b25-413a-98d9-b96938e3bb6f","resolution":{"observed_at":"2026-05-19T07:27:09.434985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:9dec6c10af8ad9b5b64310f7f6b6e324079d3ad52a8365799d4bf094bc849331","observation_id":"d34ff940-edb5-4b82-ba0b-7606b5f9523b","resolution":{"observed_at":"2026-05-19T07:27:09.031158Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02690","last_updated":"2024-12-04T20:51:17Z","snapshot_observed_at":"2026-08-12T15:54:02.294599Z","submitted_at":"2024-12-03T18:58:19Z","title":"FoundHand: Large-Scale Domain-Specific Learning for Controllable Hand Image Generation","version":2},"cited_work":{"arxiv_id":"2412.02690","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02690","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foundhand: Large- scale domain-specific learning for controllable hand image generation","venue":null,"work_id":"f804423a-1051-4db4-ba39-3d5ea94a79a9","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.02690","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:595a71c5b67863a874be0f38c92e9e9cf95a8e6af00a07378282d819dc17b222","observation_id":"8980f562-7d33-4e49-909f-b8303dd47069","resolution":{"observed_at":"2026-05-19T07:27:08.950681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06187","last_updated":"2025-03-20T17:59:56Z","snapshot_observed_at":"2026-08-16T12:59:16.381164Z","submitted_at":"2025-01-10T18:59:54Z","title":"Multi-subject Open-set Personalization in Video Generation","version":2},"cited_work":{"arxiv_id":"2501.06187","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06187","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-subject open-set personalization in video generation","venue":null,"work_id":"d75990b3-0ef1-4b4d-988b-455afa033c08","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.06187","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:33a98ffb5f11a4b344da3b3dfea1a6c8b947475c69da7d72e5be399d7aba996d","observation_id":"a41d63e8-a50f-4d6d-b081-8964572aa162","resolution":{"observed_at":"2026-05-19T07:27:08.962058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12601","last_updated":"2025-07-02T06:39:01Z","snapshot_observed_at":"2026-08-16T13:24:31.260407Z","submitted_at":"2024-08-22T17:59:44Z","title":"DreamCinema: Cinematic Transfer with Free Camera and 3D Character","version":2},"cited_work":{"arxiv_id":"2408.12601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.12601","snapshot_observed_at":"2026-07-03T20:28:55.541052Z","title":"Dreamcinema: Cinematic transfer with free camera and 3d character","venue":null,"work_id":"53443bf8-4cf9-4ccd-b02d-df30f96e44c4","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2408.12601","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:d7b37d625886bc568c453a9b7ed840ce485b88aeb381e6cdba52e522279e667a","observation_id":"95f81163-0c62-48c3-b556-f280a720f4a5","resolution":{"observed_at":"2026-05-19T07:27:08.924583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Style in- jection in diffusion: A training-free approach for adapting large-scale diffusion models for style transfer","venue":null,"work_id":"f80a5c83-a03d-4fc6-b4bf-c36fc36c23b0","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:125008039d165a68c7b75a8beb7393b903a886049abda8e1f679ca53b7773421","observation_id":"6d017889-c582-4163-9e44-3fa9aad3cf04","resolution":{"observed_at":"2026-05-19T07:27:09.407942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13307","last_updated":"2024-03-21T13:06:49Z","snapshot_observed_at":"2026-08-18T14:35:27.290955Z","submitted_at":"2024-03-20T05:11:10Z","title":"LaserHuman: Language-guided Scene-aware Human Motion Generation in Free Environment","version":2},"cited_work":{"arxiv_id":"2403.13307","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.13307","snapshot_observed_at":"2026-06-29T08:13:15.845179Z","title":"Laserhuman: language-guided scene- aware human motion generation in free environment","venue":null,"work_id":"32dfe758-454f-48eb-82d3-e148b1cf084f","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2403.13307","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7f68f3af13737defc0d461d3663bd375ccf4a38a4a1c543816fd35177c80e5c4","observation_id":"ea15e6f4-ff2a-49bb-a810-e591ee266e7d","resolution":{"observed_at":"2026-05-19T07:27:08.928143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dragvideo: Interactive drag-style video editing","venue":null,"work_id":"8b1d26ae-329d-47df-a9de-67604dde9707","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:fabe63787c348ee4dc28f96f5178c3d0e3269b2e239fb90122df3b2117aa9d9f","observation_id":"c5853e52-9dc2-49d6-9516-9bf42fe391bc","resolution":{"observed_at":"2026-05-19T07:27:09.415913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"d2799393-6ff9-4a57-a4db-41fafe84a7d7","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:565627f078d27f3fce3a536c623522a2911238c17c8fe54dcc1b644e1a393239","observation_id":"4735d37b-4b3c-40b7-ac2b-de5f38da1b2b","resolution":{"observed_at":"2026-05-19T07:27:09.460875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"08d0ef70-a0e9-40d4-91a3-8353264e406c","year":2017},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:2363405a889c77684ad3e0f065f46a55a07a79dcb755896984df0d414e816fc2","observation_id":"38402460-8972-4a89-b6c1-797260cc1575","resolution":{"observed_at":"2026-05-19T07:27:09.402967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.18281","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motioncharacter: Identity-preserving and motion controllable human video generation","venue":null,"work_id":"50840446-3606-4fe1-aae9-640bd41999d1","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:71464e97aed0f94d1bcd03b46d3d3fd845b0c89585ab06d0db493e83c25ea685","observation_id":"44297a95-be3f-42aa-a795-984e0ec19c5f","resolution":{"observed_at":"2026-05-19T07:27:08.943609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05107","last_updated":"2023-12-11T11:00:13Z","snapshot_observed_at":"2026-08-16T14:36:30.066266Z","submitted_at":"2023-12-08T15:37:17Z","title":"DreaMoving: A Human Video Generation Framework based on Diffusion Models","version":2},"cited_work":{"arxiv_id":"2312.05107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.05107","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamoving: A human 9 video generation framework based on diffusion models","venue":null,"work_id":"01dc1447-30c7-41a8-a01c-adf0db7c71d0","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2312.05107","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:9fdc4f1c8ceb9209a1e9a76594b275745336816090d4f64581710044a27cf544","observation_id":"5833cf9c-ea0e-4167-b952-ddf3442a58a5","resolution":{"observed_at":"2026-05-19T07:27:08.903461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hu- mandit: Pose-guided diffusion transformer for long-form human motion video generation","venue":null,"work_id":"55d17465-1ab4-46ac-931e-68b17d8d8a2f","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:daca86b4419db29df7c06d796a3a8a2a08b7fd5a0776e642c5e18019f07a9442","observation_id":"d4a87c14-ff9c-4fb5-992a-95da6d00b502","resolution":{"observed_at":"2026-05-19T07:27:09.424764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preserve your own cor- relation: A noise prior for video diffusion models","venue":null,"work_id":"e2b02bec-63b3-4497-821e-21be2578f740","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:5c538612d6b369f534b49f5ca8f02173b3e4c77366ec60a3669d0fcb81c27115","observation_id":"bde0305e-a6aa-4411-b26e-5ab1ff159543","resolution":{"observed_at":"2026-05-19T07:27:09.395903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03847","last_updated":"2025-01-09T04:25:42Z","snapshot_observed_at":"2026-08-16T09:31:46.329467Z","submitted_at":"2025-01-07T15:01:58Z","title":"Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control","version":2},"cited_work":{"arxiv_id":"2501.03847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03847","snapshot_observed_at":"2026-07-04T00:09:14.791130Z","title":"arXiv preprint arXiv:2501.03847 (2025)","venue":null,"work_id":"2b6484b7-b532-4eb7-a7d9-45bc262bc16a","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.03847","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:323f7dc17c0901ca673cf39b74c58655a37ae23baaac7fb85ffe56b1faa0ae7a","observation_id":"1fe104f2-9d30-490c-a21c-dbc76fe11627","resolution":{"observed_at":"2026-05-19T07:27:08.870018Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I2v-adapter: A general image-to-video adapter for diffusion models","venue":null,"work_id":"0c147b93-2585-4523-a2d6-65070ac39a20","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:617cda7ed55c5f28be3334a0a4f7b31a91aa1ab2ebeed48bbc911d39655492c1","observation_id":"6de8377e-6e7e-471a-99e9-7365c9a8aed0","resolution":{"observed_at":"2026-05-19T07:27:09.470482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:943c05ba46a7f8a9123c517b82d828426384c0e8292a4d6781e76092ab25f858","observation_id":"57fbd5a5-c7e7-4861-98c4-c4c292d21c2f","resolution":{"observed_at":"2026-05-19T07:27:08.982745Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human poseitioning system (hps): 3d human pose estimation and self-localization in large scenes from body-mounted sensors","venue":null,"work_id":"a8a1682b-6501-488f-a479-9426d06d86a6","year":2021},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:aac2b619ce394ed3251fe3de09f745810b1c51355967463df48a51229b14a22e","observation_id":"ec21d92d-03ff-446c-978f-9944d80f78c4","resolution":{"observed_at":"2026-05-19T07:27:09.448646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:23704577e24a7ab65a0aa66d29e00d590e0fc7cfab962f178fb6a2316bb36dd4","observation_id":"6eb35fcf-5690-483d-b0ad-2b267534a11b","resolution":{"observed_at":"2026-05-19T07:27:08.881798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Resolving 3d human pose ambiguities with 3d scene constraints","venue":null,"work_id":"6f99507a-7e8a-4080-b5bc-e497ddfa8985","year":2019},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:d01e65a4d88fb0dffdd874985346402a34d19a09dd7c4f819ef4e037d2100cca","observation_id":"f880363c-9778-4dc1-a132-03e48c0fac0c","resolution":{"observed_at":"2026-05-19T07:27:09.442835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cameractrl: En- abling camera control for text-to-video generation","venue":null,"work_id":"e410b73b-4c0c-48bf-ad73-b917baa37ae2","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:3987c976b420c108b1a6581a6a8fa54e6a282378026095362c53c06a1a4f86e3","observation_id":"29faf151-4e34-443f-a81c-c327a84bd195","resolution":{"observed_at":"2026-05-19T07:27:09.438862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"662ccbc5-2e43-43d7-b509-3121dab16551","year":2020},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:ac53be13904ed54f45ee3871957bdb8fbcb78bb223a49d8a852a4308a3e0ee0f","observation_id":"0ee1e086-8eb5-41b6-bc25-094c13d7ab0e","resolution":{"observed_at":"2026-05-19T07:27:09.352457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video dif- fusion models","venue":null,"work_id":"6154d0da-7b03-44f1-9794-14f6c9919c64","year":2022},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:3cfb8951316d859559be5dfc2da281f3ee7aa1376cd00ad5886de96e5f55fbb3","observation_id":"72adb8c4-cf57-42a5-950b-9c94279a883e","resolution":{"observed_at":"2026-05-19T07:27:09.378506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04925","last_updated":"2024-11-11T13:24:18Z","snapshot_observed_at":"2026-08-16T13:02:01.573262Z","submitted_at":"2024-11-07T18:00:33Z","title":"StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration","version":2},"cited_work":{"arxiv_id":"2411.04925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04925","snapshot_observed_at":"2026-07-09T07:56:04.704136Z","title":"Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, and Eli Shechtman","venue":"cs.CV","work_id":"d989b19d-4134-4b76-a09f-cc1e4b0e579e","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2411.04925","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:aeb5097740558e116012ba2959e01ade897d80d1dd1cbd67d3e19ab69eb5a9aa","observation_id":"d8dfb9d3-1e8f-49aa-b4a1-0c68a32fd565","resolution":{"observed_at":"2026-05-19T07:27:09.047774Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13185","last_updated":"2024-12-17T18:58:07Z","snapshot_observed_at":"2026-08-17T09:12:55.157131Z","submitted_at":"2024-12-17T18:58:07Z","title":"Move-in-2D: 2D-Conditioned Human Motion Generation","version":1},"cited_work":{"arxiv_id":"2412.13185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13185","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Move-in-2d: 2d-conditioned human motion generation","venue":null,"work_id":"721ef584-29b7-49f1-b16c-4123ad4c1eae","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.13185","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:23f4547b1f0bcbc26ed3bf8198ead1867f1fe9bb270dbec8c62e69dc5b0ddc48","observation_id":"d8d95c5e-a9f6-46e1-8879-6bd7835672af","resolution":{"observed_at":"2026-05-19T07:27:09.026206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion- based generation, optimization, and planning in 3d scenes","venue":null,"work_id":"34e14cdc-9a79-4367-8fdf-9f09dde559cb","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:8e8612c4da9215a0baa06a220c38d37fe0c63b9edd770c0fb3332b93d852c555","observation_id":"0a703d01-3746-4922-a8fa-52d7f51a99b3","resolution":{"observed_at":"2026-05-19T07:27:09.400573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09600","last_updated":"2024-12-12T18:59:01Z","snapshot_observed_at":"2026-08-17T19:44:42.836082Z","submitted_at":"2024-12-12T18:59:01Z","title":"Owl-1: Omni World Model for Consistent Long Video Generation","version":1},"cited_work":{"arxiv_id":"2412.09600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09600","snapshot_observed_at":"2026-07-03T20:28:55.530707Z","title":"Owl-1: Omni world model for consistent long video generation","venue":null,"work_id":"7229dc8c-33c8-4190-b5c8-2f7bc6e6ba76","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.09600","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:ccd3755b698599e142f4a802e6c2bb0866ff0a1c36a1035f93fbdb2618b346cd","observation_id":"ab80ed95-0cf1-4260-bb39-cf4bdd53d804","resolution":{"observed_at":"2026-05-19T07:27:08.914073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VBench: Comprehensive benchmark suite for video generative mod- els","venue":null,"work_id":"587bf44b-d860-4797-8ae3-e5060465dff7","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:9f7d492ea88696d48d6be34f5ff154bbc959d5527ac4642e26f21c4adf3aaf79","observation_id":"5aef4116-47de-4fd1-8ffb-eab323b57762","resolution":{"observed_at":"2026-05-19T07:27:09.338032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Peekaboo: Interactive video generation via masked- diffusion","venue":null,"work_id":"a094fec5-c99c-4822-ae22-bc01155977fb","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1958086f046ac27451b713385c0eb0938e1ccac150b1f5254858568a0ecd371d","observation_id":"8c7ea417-d225-4159-9b03-a54064538929","resolution":{"observed_at":"2026-05-19T07:27:09.355593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up dynamic human-scene interaction mod- eling","venue":null,"work_id":"a1a97dea-cebb-404a-976a-34f59218f3d6","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:473afa7e884d7850a15ae9c2d073013cf9c4e1b39b9150802870a594b0316ae7","observation_id":"1abb434e-c6e7-4f68-9e21-90ea0fc7fec9","resolution":{"observed_at":"2026-05-19T07:27:09.349819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.06244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Story-adapter: A training-free iterative framework for long story visualization","venue":null,"work_id":"5b137cec-538a-4374-a20e-c46d55dbee8d","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1573d150479da66a9b84d1292abd57a990c0a3c13fa20287542c44059687359f","observation_id":"d75ab0ff-7002-442f-8baa-d0364867cf24","resolution":{"observed_at":"2026-05-19T07:27:08.969859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b1d33aed-b5eb-4e39-ab3a-a19d5daf5e82","year":2022},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:a45e3794fc88487d11edf40fa9041bef76c79392a5373720772a5cf51c3f26b9","observation_id":"7fb8259d-5cb8-4452-a262-6136b00325dd","resolution":{"observed_at":"2026-05-19T07:27:09.347205Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"d7f94bea-a769-4893-b50f-dc321bfa2127","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:e02932ada489c0701b408e3a84350a04d262b86aa6a426caf34c5c9c87015eed","observation_id":"070fbb13-03a5-4e37-aef3-d79af46ed906","resolution":{"observed_at":"2026-05-19T07:27:09.430996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08333","last_updated":"2025-08-11T11:45:30Z","snapshot_observed_at":"2026-08-16T12:58:57.267113Z","submitted_at":"2025-01-14T18:59:59Z","title":"DAViD: Modeling Dynamic Affordance of 3D Objects Using Pre-trained Video Diffusion Models","version":3},"cited_work":{"arxiv_id":"2501.08333","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08333","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"David: Modeling dynamic affordance of 3d objects using pre- trained video diffusion models","venue":null,"work_id":"7c190ede-491f-4d30-8a4f-55f926d504ae","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.08333","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:79c0d586be0064f13d853ca7fdc0f0a2b0172a192414dbc4949f4eeec435e1f4","observation_id":"0536bf5d-27ba-4e47-b7e2-bf5ad2f02654","resolution":{"observed_at":"2026-05-19T07:27:08.899329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment anything","venue":null,"work_id":"1dec762c-a558-48a6-96b6-54616121d7d0","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:2c7ff45ba5d764100c32f22e18bea6dee71a5f39160423ad38ff2e29b6658ff5","observation_id":"03e928e1-e6fa-47f9-b330-463f389b43dc","resolution":{"observed_at":"2026-05-19T07:27:09.444712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Putting people in their place: Affordance-aware hu- man insertion into scenes","venue":null,"work_id":"bd971ac0-4182-4c02-8602-20de42f9706a","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:4396f68418e8263a49f4f409f78c82c12b65fdab110757ba903522880af74048","observation_id":"e4bc4dcd-92d7-45d4-b02a-4937a5878675","resolution":{"observed_at":"2026-05-19T07:27:09.440806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5332fee4-9488-435e-a71e-fe867fce114a","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1dd7e949088fba1229adcc3a9cbdf53e981de42d259a47fb3ef7c0c670e1c981","observation_id":"296e44be-638a-4080-b07d-a60c071a34bc","resolution":{"observed_at":"2026-05-19T07:27:09.335703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18600","last_updated":"2025-03-21T16:17:28Z","snapshot_observed_at":"2026-08-16T12:59:57.072485Z","submitted_at":"2024-12-24T18:55:38Z","title":"ZeroHSI: Zero-Shot 4D Human-Scene Interaction by Video Generation","version":2},"cited_work":{"arxiv_id":"2412.18600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18600","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ze- rohsi: Zero-shot 4d human-scene interaction by video gen- eration","venue":null,"work_id":"5198abbf-14ea-4520-af19-adef1e7f39f6","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.18600","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:9df8f9b2ab22d8fc1ef1d4bef1347f858a06d29749922b77c6470e785da60de8","observation_id":"d12c0e47-faf6-40eb-b8fd-ec341830cc80","resolution":{"observed_at":"2026-05-19T07:27:09.005765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrik: A hybrid analytical-neural inverse kinematics solution for 3d human pose and shape estimation","venue":null,"work_id":"85b19daa-5a9a-4ebf-86e4-18c919784ac3","year":2021},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:a909b94f473441561be79c34cbdfa59985230ff4d0a3344e1207e1ba78462bc7","observation_id":"8535c6c0-ccc4-4ca8-92e7-d29bd5452c65","resolution":{"observed_at":"2026-05-19T07:27:09.342596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05690","last_updated":"2023-04-12T08:29:31Z","snapshot_observed_at":"2026-08-16T15:41:05.026384Z","submitted_at":"2023-04-12T08:29:31Z","title":"HybrIK-X: Hybrid Analytical-Neural Inverse Kinematics for Whole-body Mesh Recovery","version":1},"cited_work":{"arxiv_id":"2304.05690","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05690","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrik-x: Hybrid analytical-neural inverse kinematics for whole-body mesh recovery","venue":null,"work_id":"5781ce84-d0ae-41f7-b0b2-1c04a21f570e","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2304.05690","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:75f80357700e8c103d458472ba6db9cfa189f7bfd5bb9657fc050f857d5530e8","observation_id":"1849a30c-4223-4bbd-8554-76fc0c4a368f","resolution":{"observed_at":"2026-05-19T07:27:08.966145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genzi: Zero-shot 3d human-scene interaction generation","venue":null,"work_id":"ba427dad-a53c-4fc9-a5d4-2d14237572e2","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:a30aca37e030aeeb7b14dd8f10ef2b41a40ff49ba9f645fca910ee83ef751a11","observation_id":"4a4af4a0-1bae-4dbf-8d40-ea9a1363cc3b","resolution":{"observed_at":"2026-05-19T07:27:09.364710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animatable gaussians: Learning pose-dependent gaussian maps for high-fidelity human avatar modeling","venue":null,"work_id":"4eb390df-0532-4239-8889-6a7eabde5891","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:3c3112584d5321979ad9a9cd931c84766f011620311a72d5d74bb1df8e9b3217","observation_id":"f588f632-89b7-4004-80a6-2383245b6ef4","resolution":{"observed_at":"2026-05-19T07:27:09.458737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intergen: Diffusion-based multi-human motion generation under complex interactions","venue":null,"work_id":"78e69804-d506-4a55-927c-b9ce34990a32","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:78bba4ce623c64eb7a4f1294073e0e88a6be131557f9cfe99cf6068ca6ba8f7e","observation_id":"115bb29e-130f-4e5b-bd3f-2b358d905c90","resolution":{"observed_at":"2026-05-19T07:27:09.456774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":"2412.00131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-07-08T14:44:59.776032Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","venue":"cs.CV","work_id":"51c0ab25-66f7-4d1a-a028-86b9b1b9e313","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:d021fa7bde55df9e2c2d6f17c7878f87fec8f60594a388029a277994b433373a","observation_id":"34ca8adf-9162-44e3-8901-b29d53285c1a","resolution":{"observed_at":"2026-05-19T07:27:09.022234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models","venue":null,"work_id":"79bb9dca-058b-45e8-b81a-b901bc5afbd7","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:8bf1a99fa05a6aff818af6e2ca89a9d23771fc39cc6e1a1f05a8a58e0e0fbdda","observation_id":"189a6fe0-a962-4f45-b246-e815895e0b69","resolution":{"observed_at":"2026-05-19T07:27:09.462806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16714","last_updated":"2025-09-07T04:06:42Z","snapshot_observed_at":"2026-08-18T03:34:56.171391Z","submitted_at":"2025-01-28T05:40:20Z","title":"Separate Motion from Appearance: Customizing Motion via Customizing Text-to-Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2501.16714","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16714","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Separate motion from appear- ance: Customizing motion via customizing text-to-video diffusion models","venue":null,"work_id":"9202a2ec-5626-4696-a0de-5332bbff8bce","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.16714","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:624398ccaa1b8599244861f1e524c322a1ae6fb515d9db553edaa9b58dc70f93","observation_id":"5f29e41d-f228-456c-88b1-cfec2d8fa30f","resolution":{"observed_at":"2026-05-19T07:27:09.001999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phantom: Subject- consistent video generation via cross-modal alignment","venue":null,"work_id":"e01a1b8e-9583-4a2b-942d-01458bba1618","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:523bde4053d1fe36a28cc77ccdc656a49b5207cc640b01dbfb41f7fe01a58677","observation_id":"1be80dee-8757-4f06-a69e-df212fd69564","resolution":{"observed_at":"2026-05-19T07:27:09.452798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"fd7eb815-fa59-4124-8df9-ba6bc86709e8","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:b84bdcdb5493627384d86847bd471c4e30b93bef92c5399338bd59610c9b8dac","observation_id":"2d7f362f-8694-427e-b6e4-b59211684046","resolution":{"observed_at":"2026-05-19T07:27:09.454779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a9c2a502-bc31-48d3-b229-d20a70cd445b","year":2015},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7b3300fa58fb56707337b64fb3c5a37f4c0641a2cd93820aafc60241c8acacaa","observation_id":"39061465-73aa-4e5a-b3a5-af5efd170eed","resolution":{"observed_at":"2026-05-19T07:27:09.358337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smpl: A skinned multi-person linear model","venue":null,"work_id":"be6e0cb6-1998-4efe-8e62-5e9365040f69","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:dee53849a0a43592c453629f62f6312b0bf8a53b15d6bf2fae04df61d9beaeaa","observation_id":"96cf5621-27a3-4696-bea5-df3c0801f1de","resolution":{"observed_at":"2026-05-19T07:27:09.446574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:a5a0cc4563f3ae5fbcbb844334b5eb8867e85d8db508b9aed2bab0e352f6f6c9","observation_id":"0d4a097e-ebf6-431b-9307-90e7333825a0","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trailblazer: Trajectory control for diffusion-based video generation","venue":null,"work_id":"05eabbcc-6106-4087-9d45-911187016677","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:6cb01e8e279bef511f9967b6b3399c37dc44ccb46f061bf296e86664a5cbf2c6","observation_id":"1d152e8b-37c2-4b57-bcc9-ad345fa439e4","resolution":{"observed_at":"2026-05-19T07:27:09.464690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15642","last_updated":"2024-07-23T01:35:07Z","snapshot_observed_at":"2026-08-16T13:32:08.610804Z","submitted_at":"2024-07-22T14:00:03Z","title":"Cinemo: Consistent and Controllable Image Animation with Motion Diffusion Models","version":2},"cited_work":{"arxiv_id":"2407.15642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15642","snapshot_observed_at":"2026-07-01T13:25:44.776981Z","title":"Cinemo: Consis- tent and controllable image animation with motion diffu- sion models","venue":null,"work_id":"00d9186f-bc87-4cbf-800c-6822025cc5c5","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2407.15642","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7f0ad9666770107f966afea7cb896e26fcc61f70dc3cc2ce0f8a400750908e23","observation_id":"16e914aa-bf57-4099-b717-a41c5f3bbeab","resolution":{"observed_at":"2026-05-19T07:27:08.974069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05059","last_updated":"2024-06-15T03:10:59Z","snapshot_observed_at":"2026-08-19T01:36:35.997881Z","submitted_at":"2024-06-07T16:31:41Z","title":"GenHeld: Generating and Editing Handheld Objects","version":3},"cited_work":{"arxiv_id":"2406.05059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05059","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genheld: Generating and editing handheld objects","venue":null,"work_id":"0cc0be1f-a852-4061-9c12-04182241dfe6","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2406.05059","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:c3bdcd1109e17a0e1bff35902bfc453adc2a732fced70a4b225f0d629c4cf975","observation_id":"4bfec488-8c34-49e8-b044-e6fbfcdd13ee","resolution":{"observed_at":"2026-05-19T07:27:08.990992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatgpt-4o","venue":null,"work_id":"31741dd3-75fa-45f9-8a33-7d20a53bb68d","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:544c7f06ac6e40d77871012dfe83e0deca35cc980e5aaeecf148d734c14cf031","observation_id":"300ce8fe-0613-4839-9536-e790d8bb5566","resolution":{"observed_at":"2026-05-19T07:27:09.466611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1b7332bd753b1d9925be5ae5df15e2ae5577631664e7ce33108786d878a815a7","observation_id":"c4e4a262-85db-4ee2-8300-f1c4f750e3ca","resolution":{"observed_at":"2026-05-19T07:27:08.873264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text2place: Affordance-aware text guided human placement","venue":null,"work_id":"5ef52c11-2064-4b15-933f-e8c04f13daf1","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:0cf2f219b05d7a63fb8e302252d24cda8b17027bddd9f4ebac542e2e96c8acd8","observation_id":"0aa829ac-d6d5-4bb9-a7ca-3fedc685819d","resolution":{"observed_at":"2026-05-19T07:27:09.389822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expressive body capture: 3d hands, face, and body from a single image","venue":null,"work_id":"b974ad20-c305-4b1d-a69f-e2beedc5b445","year":2019},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:8bd3573b5d3f3b8bebfb2754465bdac5b57f01b61ba8281b00d78f6424389ae2","observation_id":"71e92500-4790-482e-923f-fd7e378ded66","resolution":{"observed_at":"2026-05-19T07:27:09.450669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b7b9357d-cbb7-4994-b357-94c268cfceea","year":2019},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:b318b1842654e318add55502ebbca4e92214e0ceb692778545a888693cbd09c1","observation_id":"b0877edb-f0a7-4c78-947a-deec8120059e","resolution":{"observed_at":"2026-05-19T07:27:09.393722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06553","last_updated":"2025-07-07T05:09:32Z","snapshot_observed_at":"2026-08-16T14:35:48.170640Z","submitted_at":"2023-12-11T17:41:17Z","title":"HOI-Diff: Text-Driven Synthesis of 3D Human-Object Interactions using Diffusion Models","version":3},"cited_work":{"arxiv_id":"2312.06553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06553","snapshot_observed_at":"2026-07-10T16:17:21.682636Z","title":"Hoi-diff: Text-driven syn- thesis of 3d human-object interactions using diffusion mod- els","venue":"cs.CV","work_id":"7a68c4d2-5d8e-4e97-a3ef-47ab042ae72e","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2312.06553","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:0337ad6890ac0e735e07d743b6d7d7fe435d5a7cc99e0555c41088f3d5314277","observation_id":"5591942f-fc0b-4541-b148-251f5b228a7d","resolution":{"observed_at":"2026-05-19T07:27:09.035768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"c74eb1ea-7362-413a-b763-8b413ab8efd2","year":2022},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:42bcbc37953e3ba2db03e15249b2d9dcb23e5f4a555b0065a5ac41ca0dd210bd","observation_id":"bf2fba20-6a2a-449f-b352-c2ea3df051f5","resolution":{"observed_at":"2026-05-19T07:27:09.385354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreambooth: Fine 11 tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"f41598f0-cb60-426c-ad70-156931bd9e35","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1e5eeb286fb5be02926635d10c6eba43caa7ef90e546f17543190d26fef330bd","observation_id":"e902d4ca-924e-4236-aabc-db5fc03a42e6","resolution":{"observed_at":"2026-05-19T07:27:09.375906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02489","last_updated":"2024-07-02T17:59:50Z","snapshot_observed_at":"2026-08-16T13:37:39.189532Z","submitted_at":"2024-07-02T17:59:50Z","title":"Magic Insert: Style-Aware Drag-and-Drop","version":1},"cited_work":{"arxiv_id":"2407.02489","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.02489","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magic insert: Style-aware drag-and-drop","venue":null,"work_id":"bdf17c82-7c11-4f74-b69e-4ef052c7b4e4","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2407.02489","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:e115bcef5efccf6350c99f7fed21df5b3b77922d71f23ca2eac2601c7e825236","observation_id":"22bc4474-9940-4e22-83ba-eb914b642d16","resolution":{"observed_at":"2026-05-19T07:27:09.009377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14403","last_updated":"2025-01-02T18:59:09Z","snapshot_observed_at":"2026-08-19T00:31:28.742354Z","submitted_at":"2024-04-22T17:58:36Z","title":"GeoDiffuser: Geometry-Based Image Editing with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2404.14403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14403","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geodiffuser: Geometry-based im- age editing with diffusion models","venue":null,"work_id":"ead8c563-ff70-4a52-bd38-448c54f4776b","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2404.14403","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:df5c19409bea9cf7eb06d5c2ae2aa44ed26d3653983f5c517144915dc44ce985","observation_id":"81b99bce-39b2-49de-8bae-4f071099b6c4","resolution":{"observed_at":"2026-05-19T07:27:09.043662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15977","last_updated":"2024-01-31T07:41:04Z","snapshot_observed_at":"2026-08-18T09:34:26.255484Z","submitted_at":"2024-01-29T09:06:43Z","title":"Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion Modeling","version":2},"cited_work":{"arxiv_id":"2401.15977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.15977","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, Manyuan Zhang, Ka Chun Cheung, Simon See, Hongwei Qin, Jifeng Da, and Hong- sheng Li","venue":null,"work_id":"26d80b1f-8520-4075-8ace-cdc04afa9e5f","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2401.15977","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:d48548a45d409c3296a8e077fdf2251fdc6bcfeaa2d0d8e01c02830f48761239","observation_id":"7bacf2e7-fe99-4746-8a9e-19a8c7e2727c","resolution":{"observed_at":"2026-05-19T07:27:08.917643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dragdiffusion: Harnessing diffusion models for interac- tive point-based image editing","venue":null,"work_id":"4fb8e3f2-96c5-4302-aadd-b25af807dac8","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:1adf1a8b736cfb0e7165c05deec270d741b8ff14997aa04888cc6810d48540a0","observation_id":"7efac2ba-12ec-46e9-b146-7442b8da72ea","resolution":{"observed_at":"2026-05-19T07:27:09.367844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:07db6f80ba4b360c3d489127f34f5fd946ca627b05fda95037fe700e424f63cd","observation_id":"f7b39e52-d76b-492b-9d47-b0adf1258b4a","resolution":{"observed_at":"2026-05-19T07:27:08.920941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sound to visual scene gener- ation by audio-to-visual latent alignment","venue":null,"work_id":"c1c80cd7-0598-4ee9-9b9b-ab703f2e37c9","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:808140ea964b3cb799ae9ee349033c1f8c25fdbfae1295021db113d75a9988f9","observation_id":"4620c837-2869-44c6-af38-f5cd775c838c","resolution":{"observed_at":"2026-05-19T07:27:09.340214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07232","last_updated":"2024-11-12T07:49:39Z","snapshot_observed_at":"2026-08-16T13:01:03.683249Z","submitted_at":"2024-11-11T18:50:09Z","title":"Add-it: Training-Free Object Insertion in Images With Pretrained Diffusion Models","version":2},"cited_work":{"arxiv_id":"2411.07232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07232","snapshot_observed_at":"2026-07-01T14:25:46.030765Z","title":"arXiv preprint arXiv:2411.07232 , year=","venue":null,"work_id":"7ad26308-3c67-4558-b93e-486a1fecd946","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2411.07232","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:05e248cbd26894f1ca4ab722857b63ba11e6b8ce300591a16ae119246fbcaff3","observation_id":"e1b32098-9779-423d-82a5-4c6ce7bf9df8","resolution":{"observed_at":"2026-05-19T07:27:09.013480Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-15T01:14:53.670017Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"cited_work":{"arxiv_id":"2412.09856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09856","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lingen: Towards high-resolution minute- length text-to-video generation with linear computational complexity","venue":null,"work_id":"05a946c3-128b-4972-b09e-65191eb37b5d","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.09856","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:0363d945366b710abe5c72b5f59daceb2340deb5349a249669e5defe73349ca9","observation_id":"d2d1e529-6b84-4fb0-92c2-28dede2602f8","resolution":{"observed_at":"2026-05-19T07:27:08.877210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20193","last_updated":"2024-10-16T18:35:31Z","snapshot_observed_at":"2026-08-16T14:05:11.646157Z","submitted_at":"2024-03-29T14:14:22Z","title":"Motion Inversion for Video Customization","version":2},"cited_work":{"arxiv_id":"2403.20193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.20193","snapshot_observed_at":"2026-06-30T13:44:40.581238Z","title":"Motion inversion for video customization","venue":null,"work_id":"eb92c9d2-6778-40ba-8d96-ccd3e12c3422","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2403.20193","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:77b4134f08c698c03480aace9a3652b23bad5a3f59bf03c611999821f09c9e58","observation_id":"c3f32616-caa4-40b8-a3aa-2f27f420d4f9","resolution":{"observed_at":"2026-05-19T07:27:08.946885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19115","last_updated":"2025-04-15T06:33:45Z","snapshot_observed_at":"2026-08-16T13:06:08.804118Z","submitted_at":"2024-10-24T19:29:02Z","title":"MoGe: Unlocking Accurate Monocular Geometry Estimation for Open-Domain Images with Optimal Training Supervision","version":3},"cited_work":{"arxiv_id":"2410.19115","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19115","snapshot_observed_at":"2026-07-10T01:46:41.316792Z","title":"Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision","venue":"cs.CV","work_id":"f448b8f3-4ea5-46af-a336-f7953b2dfb17","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2410.19115","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:bad75683c78f071c1445b902db7f6214d65c5b55dd301b4726ddeefbfebee4c3","observation_id":"925e6259-f10e-4e01-9422-6020090b9be7","resolution":{"observed_at":"2026-05-19T07:27:08.895161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-17T12:21:00.357059Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2309.15103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-06-29T18:43:51.114876Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":"e26464f0-6aed-49c2-b00f-e3639b1da5b1","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:683e796ff01aa07ee2ca1abc476112d70234788c22c9766e84e8836120a3f82b","observation_id":"50ce6ba8-6eed-4fe4-a2ae-a9a976fec222","resolution":{"observed_at":"2026-05-19T07:27:08.958137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Humanise: Language-conditioned hu- man motion generation in 3d scenes","venue":null,"work_id":"7c448260-e0a4-4cc6-a5ba-7ec7a91d164a","year":2022},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:069e9b499b7ebaa591d2b1143aaea96db83cb5f223d1e5a48d5211336d5482b8","observation_id":"27d965a2-5d41-472a-8f55-7d87a2629c64","resolution":{"observed_at":"2026-05-19T07:27:09.420514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"59db025b-d18d-470d-9435-aae6871c3cc2","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:e4ae710278c679c6adaafa8da0bc50c6a4146459eca96b988cf89eb4383e646b","observation_id":"c249ca28-d251-4837-b1b9-5beb53033a29","resolution":{"observed_at":"2026-05-19T07:27:09.468603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Move as you say interact as you can: Language-guided human motion generation with scene af- fordance","venue":null,"work_id":"d5d2c2f2-5fe5-4b74-a8c4-426a01f03008","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:b22175bdfd26de179a126a38af568396fd61875a7cdc931eb99c2d0f40bc622d","observation_id":"f9bb6f49-3570-46f7-8380-9ba05f467d6f","resolution":{"observed_at":"2026-05-19T07:27:09.426869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18605","last_updated":"2024-12-24T18:58:43Z","snapshot_observed_at":"2026-08-17T14:49:01.554106Z","submitted_at":"2024-12-24T18:58:43Z","title":"Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models","version":1},"cited_work":{"arxiv_id":"2412.18605","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18605","snapshot_observed_at":"2026-07-04T08:59:43.205863Z","title":"Orient anything: Learn- ing robust object orientation estimation from rendering 3d models","venue":null,"work_id":"c5b7666c-e46a-4729-b933-1457ddcf103a","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.18605","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:47bee853538d0ac5dda1089c866eb4eb6ad3f18f0a9c9d527e6c477b39d0e837","observation_id":"e9760be3-30a2-4784-9777-75f367f9a1bb","resolution":{"observed_at":"2026-05-19T07:27:08.891900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamvideo: Composing your dream videos with customized subject and motion","venue":null,"work_id":"880b520d-cb1a-43b3-acc4-e076e68536b4","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:276ab7d2cdde7a70e719283b7b230b28bd1caab02284d8937742c5dfecafd28a","observation_id":"88e19441-c22e-44dc-858e-1a9cb996cf0d","resolution":{"observed_at":"2026-05-19T07:27:09.429085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detectron2","venue":null,"work_id":"bac6f22f-af03-4be8-b5b0-718f44b62a6b","year":2019},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:be30011dee06571d8c01d24f0fb2a83740f3cdb0a0e4106847a8d1a2c3ad09f2","observation_id":"64cbe6db-137f-44c0-9de4-4844d727dc9f","resolution":{"observed_at":"2026-05-19T07:27:09.436871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05263","last_updated":"2025-03-08T01:36:55Z","snapshot_observed_at":"2026-08-18T22:48:02.270695Z","submitted_at":"2024-12-06T18:52:20Z","title":"Mind the Time: Temporally-Controlled Multi-Event Video Generation","version":2},"cited_work":{"arxiv_id":"2412.05263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05263","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind the time: Temporally-controlled multi-event video generation","venue":null,"work_id":"a7f3df9e-8015-4ec6-9432-29c74ebd9306","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.05263","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:2f901936e6661f310f232c47f323c5b87a11edd1274652935cd9f34084fa6c93","observation_id":"43fc0743-f735-4ecd-87f2-75b0dc7b0efb","resolution":{"observed_at":"2026-05-19T07:27:08.907092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01506","last_updated":"2025-05-30T11:13:13Z","snapshot_observed_at":"2026-08-17T11:46:18.301015Z","submitted_at":"2024-12-02T13:58:38Z","title":"Structured 3D Latents for Scalable and Versatile 3D Generation","version":3},"cited_work":{"arxiv_id":"2412.01506","doi":"10.48550/arxiv.2412.01506","metadata_source":"pith","pith_arxiv_id":"2412.01506","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Structured 3D Latents for Scalable and Versatile 3D Generation","venue":"cs.CV","work_id":"6ce98e46-048f-47fa-917a-0c001eaae143","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.01506","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:6c0c63a1c8161f50943e3d1033305b05c03bb93411e6fb8353ec1a679d65252a","observation_id":"8290e019-f9b5-49cc-afa5-b322e83843f7","resolution":{"observed_at":"2026-05-19T07:27:08.978037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.568006+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.568006+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06173","last_updated":"2025-06-07T09:44:59Z","snapshot_observed_at":"2026-08-17T18:59:43.416106Z","submitted_at":"2025-01-10T18:52:11Z","title":"VideoAuteur: Towards Long Narrative Video Generation","version":2},"cited_work":{"arxiv_id":"2501.06173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06173","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoauteur: Towards long narrative video generation","venue":null,"work_id":"e65d381c-1002-458d-a1ff-2e129bd9b784","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.06173","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:4b74a5b6d27677cc3795d55319ec53fb4892ccc0f94cf2a73b2a2bacc85bca54","observation_id":"49fb1186-151a-4121-86a4-0fe4be1d0868","resolution":{"observed_at":"2026-05-19T07:27:08.885606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-08-16T14:51:02.499752Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":"2310.12190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-07-04T14:59:55.949933Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"cd60d897-1a74-482c-84b4-93dfa38c1c33","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:2b32074b242f9cc2bec5642933211bf265182595d320cd749e6d9a54011bee7d","observation_id":"43bde310-09d2-4678-88eb-0cfe5a0906bf","resolution":{"observed_at":"2026-05-19T07:27:09.040021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"ef9acbea-1140-40cc-a608-5da28a201ffb","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:de4d514401c9fc391faf81fa2476a249e92cd0149751db55b401d04d40ac5d76","observation_id":"ebf16d2e-4af2-4012-8a34-6ea564663f14","resolution":{"observed_at":"2026-05-19T07:27:09.422556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17383","last_updated":"2025-06-23T06:27:21Z","snapshot_observed_at":"2026-08-16T09:32:44.099692Z","submitted_at":"2024-11-26T12:42:13Z","title":"AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation","version":2},"cited_work":{"arxiv_id":"2411.17383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anchorcrafter: Animate cyberanchors sal- ing your products via human-object interacting video gen- eration","venue":null,"work_id":"d0853815-241f-45a2-9ca3-b04b9432e7a8","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2411.17383","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:18d6e739928bf0119cbcbc144d5b050be0ed89d2da1cce97a5eacd209329f8d4","observation_id":"37457f85-25e3-4d6e-956d-77a39d7f0d06","resolution":{"observed_at":"2026-05-19T07:27:08.931807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Person in place: Generating associa- tive skeleton-guidance maps for human-object interaction image editing","venue":null,"work_id":"db17f2d1-6c91-4f6f-9d63-f5624048bae3","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7e2dd184de449d98007ef60e936e96558447b770cf7e46d674b8c837cc5f5e0d","observation_id":"88d53b2d-cad6-438f-a4b7-61efa9a77901","resolution":{"observed_at":"2026-05-19T07:27:09.410778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating human interaction motions in scenes with text control","venue":null,"work_id":"34cf544e-69d7-491e-a769-b47a5c1529e7","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:17d1fc5c8b3dfb6d1c061a159a9d8a827eb74b877a5d7c37d680e0c3a626bb9e","observation_id":"fb632a70-f0a9-4d66-b20e-c4f0989dbe53","resolution":{"observed_at":"2026-05-19T07:27:09.418152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"599bfa67-f24d-4f2f-898e-e990d1185484","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:3215997084a48ddf85da05ac5e63c55e1466c963ab5dc8d106d38b48fc16ad86","observation_id":"b675014c-3183-4d0e-9b43-feb2333148a4","resolution":{"observed_at":"2026-05-19T07:27:09.413583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07563","last_updated":"2025-01-13T18:53:08Z","snapshot_observed_at":"2026-08-18T01:23:57.142778Z","submitted_at":"2025-01-13T18:53:08Z","title":"Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss","version":1},"cited_work":{"arxiv_id":"2501.07563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07563","snapshot_observed_at":"2026-07-03T16:28:38.472435Z","title":"Training-free motion-guided video genera- tion with enhanced temporal consistency using motion consistency loss","venue":null,"work_id":"8ba0a72d-4c16-4095-b49d-3ab8b43612ab","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2501.07563","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:75a073cf80fa280ca690b02b0aacc406bb22ddf88208506c10b818ac34ee1869","observation_id":"04faad48-d1f5-4bff-8960-98b4b22362f1","resolution":{"observed_at":"2026-05-19T07:27:09.055448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating 3d people in scenes with- out people","venue":null,"work_id":"7a4e13dc-cc74-4bb5-adca-555a57a515aa","year":null},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:dae3983d68d907059e71bc7ed8f96c7a71b60676f864b36dd951d0e9c4eff7c4","observation_id":"171c67e9-8747-4036-b9ea-b0410b11eb38","resolution":{"observed_at":"2026-05-19T07:27:09.405656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T01:01:22.391755Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":5,"verified_exact":37,"verified_fuzzy":52},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 2 inbound Pith citation observations for arXiv:2506.19840."}