{"as_of":"2026-08-18T06:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f3eaa3a0ce0171b08001c751e5ecf1140cd1df82c26a6a7d0dc9a41c6f22ec3","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:45:10.247547Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:16:44.469541Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T18:16:44.762071Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"cited_work":{"arxiv_id":"2412.04189","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04189","snapshot_observed_at":"2026-08-15T18:16:44.762071Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","venue":"cs.CV","work_id":"2da749c1-011e-4eba-a590-dbd02336b166","year":2024},"citing_paper":{"arxiv_id":"2507.18374","last_updated":"2025-07-24T12:50:46Z","snapshot_observed_at":"2026-08-17T14:08:04.449326Z","submitted_at":"2025-07-24T12:50:46Z","title":"Towards Effective Human-in-the-Loop Assistive AI Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:44.469541Z"},"links":{"cited_paper":"/paper/2412.04189","citing_paper":"/paper/2507.18374"},"observation_digest":"sha256:df492a81dd100993133625e3e34adf1714c95a8a6aeba31d8ba128fab138fd1b","observation_id":"8d701ebc-adbb-4fda-a20e-b6f577056511","resolution":{"observed_at":"2026-08-15T18:16:44.766696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04189/citation-record","integrity":"/paper/2412.04189/integrity","json":"/paper/2412.04189/citation-record.json","paper":"/paper/2412.04189"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.848461Z","title":"The mug facial expression database","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.848461Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:0cd193ec3dda2aa4f4b5f210c65ceb015cb4e4fe86b147de49f18dad94f8e39d","observation_id":"f642428d-8390-4af5-9e2e-5c12478cec54","resolution":{"observed_at":"2026-08-11T21:45:09.848461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.853490Z","title":"Detours for navigating instructional videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.853490Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:a2d1eea5b4bc84f9bc11234c275164d4af05dbbaea64e4792cfa1cfd1a394a1d","observation_id":"3729c403-f6e6-4ebd-be85-0bfa87f6a5b4","resolution":{"observed_at":"2026-08-11T21:45:09.853490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.857437Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.857437Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:6324923e49025c7f0f5955fa23f0a5d411100c2c0e9826ad550d66a666519349","observation_id":"0d056796-4471-4d98-8e3a-c9b3035531ba","resolution":{"observed_at":"2026-08-11T21:45:09.857437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.507417Z","title":"Hrs-bench: Holistic, reliable and scalable benchmark for text-to-image models","venue":null,"work_id":"0a93121b-6af9-45f9-b71e-8e9998b31cd3","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.860935Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:44f2793eb5bbc72e4fb37fe0e678dd8934e474d6b4dbf375b096eb258b1e10ac","observation_id":"ef9e9c3f-5e94-4e05-ae3d-8469909202c7","resolution":{"observed_at":"2026-08-11T21:45:11.512917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02426","last_updated":"2023-10-03T20:46:10Z","snapshot_observed_at":"2026-08-16T14:55:20.395869Z","submitted_at":"2023-10-03T20:46:10Z","title":"EditVal: Benchmarking Diffusion Based Text-Guided Image Editing Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02426","snapshot_observed_at":"2026-08-11T21:45:09.864718Z","title":"Editval: Benchmarking diffusion based text-guided image editing methods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.864718Z"},"links":{"cited_paper":"/paper/2310.02426","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:b1912239f02935bb8f6931ae43c038a674ebb10e7eac1ffe0c41c91418c92631","observation_id":"081a8a1c-63a7-44b8-916d-1cb2173a61ee","resolution":{"observed_at":"2026-08-11T21:45:09.864718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.492499Z","title":"Brooks, A","venue":null,"work_id":"c9753734-9e03-4846-a7ab-200d83d5f12f","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.868784Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:a927df314eda92894fe06c932bdbfc603057a8bdeeb8756fccc1344a48d18191","observation_id":"ea11565d-4198-43ef-8e98-275e2cda8b11","resolution":{"observed_at":"2026-08-11T21:45:11.496580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.478816Z","title":"Gener- ating human motion in 3d scenes from text descriptions","venue":null,"work_id":"f3096c07-1b87-4703-b111-5d5769c9e79a","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.873338Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:883e6194682aa173acab14532ecbb8bdd78787965787be78ed73ed519ccf190e","observation_id":"31a2ed05-e1eb-4f98-a350-6f0915c6de41","resolution":{"observed_at":"2026-08-11T21:45:11.483499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.466035Z","title":"Ceylan, C.-H","venue":null,"work_id":"3a1ecb81-2371-46cc-8686-ea21a6df902d","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.876682Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:21ceb931097aafb2cb8bba3adc68cfa4dc782f7953eceaa4d39ba6db8872449a","observation_id":"164c07f7-1778-4547-9ded-584d90d528d5","resolution":{"observed_at":"2026-08-11T21:45:11.469388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.453297Z","title":"Cognitive load theory and the format of instruction","venue":null,"work_id":"348526e1-cf75-41cc-850e-92d54e02e3e5","year":1991},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.883210Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:4fe0ffa95e7cac028ef9addb1dfde0fa04d6b6020b8943291307249b96a0dc35","observation_id":"653a53e4-930a-455c-9b5c-2321bfceb89d","resolution":{"observed_at":"2026-08-11T21:45:11.457298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.435233Z","title":"Learning video-conditioned policies for unseen manipula- tion tasks","venue":null,"work_id":"6687c555-be77-4e93-b7a8-2e340cd4ce0a","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.887050Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:a8ccc13c4063053a996b7c33f1b4c5ff3577e9ea76d7b8ebf145be0bc747d561","observation_id":"2446aa98-4e4f-453a-84e2-436b1a2a8a33","resolution":{"observed_at":"2026-08-11T21:45:11.439261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.420560Z","title":"Cheikh Youssef, A","venue":null,"work_id":"a232ca6b-897d-4a9c-9df2-137f8626da69","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.892699Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:ac72562d5397daacfcc6710c08d776b1efdf87ef5ff8866916d9508cb57d3e07","observation_id":"3bf0f642-0624-4c18-b885-de977ce05134","resolution":{"observed_at":"2026-08-11T21:45:11.425456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.897586Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.897586Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:d234b8ce8ed99a449f5f2c09794f558d18a8e1be4c003149e4719ac94a93e1f5","observation_id":"f1dc980f-22a6-483d-b76c-4f6416783538","resolution":{"observed_at":"2026-08-11T21:45:09.897586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.902375Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.902375Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:f8a3da492c40bd1bd634a7132eb28f66de6211332365e9207b2a0ad78e9ab7ce","observation_id":"d422d952-13fb-484c-8976-fac8f8d821a2","resolution":{"observed_at":"2026-08-11T21:45:09.902375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12886","last_updated":"2023-12-04T05:43:53Z","snapshot_observed_at":"2026-08-16T14:41:38.350285Z","submitted_at":"2023-11-21T03:47:54Z","title":"AnimateAnything: Fine-Grained Open Domain Image Animation with Motion Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12886","snapshot_observed_at":"2026-08-11T21:45:09.906734Z","title":"Fine-grained open do- main image animation with motion guidance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.906734Z"},"links":{"cited_paper":"/paper/2311.12886","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:027cd674aaab290a4de5ff66307ed6a573e7fa085b8c9c9951a6625593be001c","observation_id":"b93ae10d-05e5-4231-aa50-6a683b3c535d","resolution":{"observed_at":"2026-08-11T21:45:09.906734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.377419Z","title":"Rescaling egocentric vision: Collection, pipeline and chal- lenges for epic-kitchens-100","venue":null,"work_id":"f5ffa442-cc06-48db-8003-29a7acc91817","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.914009Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:7068b2af185ad10f0106c4289c4393e837f3b0169e51187be840d0fccf330fea","observation_id":"a078f0a4-2dce-4c56-95c3-d08364ef75ad","resolution":{"observed_at":"2026-08-11T21:45:11.384219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.362742Z","title":"Learning universal policies via text-guided video genera- tion","venue":null,"work_id":"f6149691-3b27-4290-933f-e712a5e0fbc1","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.919008Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:85a78a2c87e74ed12cad68cc0f17b485a04105bebb6210b69e583d05cdabfd3a","observation_id":"af9eabd8-b54e-4094-8547-fa15793678a9","resolution":{"observed_at":"2026-08-11T21:45:11.367378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.924083Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.924083Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:7554ba71bc1bccefb8522909a15a04448943d2d4f0a17cb8983bfde9c0e1ebef","observation_id":"66797e2b-787c-43e0-ba36-820b7eeb3cd5","resolution":{"observed_at":"2026-08-11T21:45:09.924083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.337270Z","title":"Handrawer: Lever- aging spatial information to render realistic hands using a conditional diffusion model in single stage, 2025","venue":null,"work_id":"2a9582f7-af2e-4add-a583-974f63c030e7","year":2025},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.927920Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:f0bccca2162eb9d2f05462c52a8a8c1e580400cec18e6baebe9395be83bd4afd","observation_id":"c68ac1b6-f258-4cdc-a606-cdcb743c14bb","resolution":{"observed_at":"2026-08-11T21:45:11.342122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.324503Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"cd07d1e1-eafe-49b3-8e9c-9dbd47dbddf4","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.932703Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:48fd5b199e4233a5a8f5d8145164f144f75bdb9928ec18cd8e6019bde4590e36","observation_id":"5be0a0e2-f208-4406-9f00-0b9e5df9ebd9","resolution":{"observed_at":"2026-08-11T21:45:11.328972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.310880Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":"9bc6b9d7-4145-438f-a672-ab29da6a3ad4","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.937048Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:f025c3fcd90f711d14c4ff1d939f8271aa877a5f32c75bd0c92309d7d1e590a4","observation_id":"300d4442-7dcd-420d-9ed7-4b57719550eb","resolution":{"observed_at":"2026-08-11T21:45:11.315625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.941469Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.941469Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:756627b82f88362f49eb1427dfedce9f6154b9996814c1762154c27fbd0b3ce8","observation_id":"c172d233-926b-4cbf-be3a-8421f482e350","resolution":{"observed_at":"2026-08-11T21:45:09.941469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.947071Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.947071Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:7cd941a5f868e97c7f138243174894436c6609e3434edeca7199707824956e56","observation_id":"ec3f5388-06bb-44f9-8e5e-8ffcae4ad229","resolution":{"observed_at":"2026-08-11T21:45:09.947071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.272248Z","title":"Video dif- fusion models","venue":null,"work_id":"dd17c49e-5d99-4451-8e83-a23026f97a60","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.952593Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:3ee34a090825980c4d429253cc6c0e9a6285ec686ce2833c1e55c2574a3de0e5","observation_id":"0c3099ee-0f63-4835-b28c-08df527f70b3","resolution":{"observed_at":"2026-08-11T21:45:11.278384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.256125Z","title":"T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- tion","venue":null,"work_id":"6043fb56-deef-4b59-9938-8217932a251f","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.957306Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:4b6e824e7b5be39ce1cd44e25dc7b04f8f8f53d08895c79c9d7d94cbabc6f318","observation_id":"a0aa761a-7ed0-40bf-9aec-66ccbc44ea45","resolution":{"observed_at":"2026-08-11T21:45:11.261520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.239942Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"13c44443-0ec2-40a2-a086-837cc8ab2e2e","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.961560Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:27d64797124d65b37169976bca736d483b4d8bf81fe10deb63439f28b106b461","observation_id":"5824e7d4-8696-4c6c-a8a4-8a053a525956","resolution":{"observed_at":"2026-08-11T21:45:11.246127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-08-11T21:45:09.965337Z","title":"Vbench++: Comprehensive and ver- satile benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.965337Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:11413f07b598435b0f3ab8bfb8dfa5da8eb65623988af3524896048521cfcc04","observation_id":"8f37f44a-9c29-430d-85bf-2d5840cbbf56","resolution":{"observed_at":"2026-08-11T21:45:09.965337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.225834Z","title":"Vid2robot: End-to- end video-conditioned policy learning with cross-attention transformers, 2024","venue":null,"work_id":"a76a0dc9-9756-40f8-bbcf-be6d7c2caf50","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.970349Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:cdf80fe889faaaac43dc2ae468ef5d2f6819fb9d14b3a9eab5f6c32708310a13","observation_id":"c817a730-3f91-4b55-8beb-f5f1a6508de5","resolution":{"observed_at":"2026-08-11T21:45:11.230494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03849","last_updated":"2024-03-22T05:03:34Z","snapshot_observed_at":"2026-08-16T14:37:02.394146Z","submitted_at":"2023-12-06T19:02:40Z","title":"LEGO: Learning EGOcentric Action Frame Generation via Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03849","snapshot_observed_at":"2026-08-11T21:45:09.974729Z","title":"Lego: Learning egocentric action frame generation via visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.974729Z"},"links":{"cited_paper":"/paper/2312.03849","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:75e546246fdd68ced01eb4801a46a650b147e71df6bde8c7f27b7b39a972c43e","observation_id":"eb93ff5f-db30-46f1-9b59-6d6aebd881da","resolution":{"observed_at":"2026-08-11T21:45:09.974729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.213749Z","title":"Temporal convolutional networks for ac- tion segmentation and detection","venue":null,"work_id":"8a0934fd-1efc-45c0-92c3-84c2663dee59","year":2017},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.979486Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:d63058f68eeaf29dd16946b6ba09b004be3239442edea7d707f3c5c3652a1329","observation_id":"680d6f3b-8e02-4a57-b672-610afca8998b","resolution":{"observed_at":"2026-08-11T21:45:11.217323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.198300Z","title":"Gradient-based learning applied to document recog- nition","venue":null,"work_id":"4761d065-7193-4e5b-8d92-25ac58ae4b87","year":1998},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.983851Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:594783eab32c44e2a917c03eb90786b01ccca85cccbc7fce3c8b711501db144a","observation_id":"e39195db-2bee-4e88-8eb2-6b62179a1336","resolution":{"observed_at":"2026-08-11T21:45:11.203636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:09.988588Z","title":"Holis- tic evaluation of text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.988588Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:08030833638a8d33fa679a9b392bd3ba109dbe8f72be2a0370d6f757f78eda3d","observation_id":"7b190191-8e12-4d35-ae9e-5f8621dff8e6","resolution":{"observed_at":"2026-08-11T21:45:09.988588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.170687Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"ce30cbab-59e6-4c98-ac6e-6491ce7a71f3","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.993512Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:26f2385bdcc5add0f585eb9665487a6edbfb3053bcc2f931b01a27b814311f05","observation_id":"ca687851-383c-4a8d-984f-15c92b7ccb87","resolution":{"observed_at":"2026-08-11T21:45:11.175203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.155081Z","title":"Egocentric video-language pretraining","venue":null,"work_id":"9ece51eb-fe4c-4ace-83f4-40bf0ae63c72","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:09.997890Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:6c5687ed9698ea1a6ca48bbc32cb6d538c1d5bca06458b7e4a9b2295e5f57f94","observation_id":"f94d3f16-8793-46ab-8654-9082073dac07","resolution":{"observed_at":"2026-08-11T21:45:11.160981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.002519Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.002519Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:9763ac2ef526a8ecae161195a708714cd35d94432abb7c7409466d31369851c4","observation_id":"98c6eb90-b37a-4244-8bf4-5efb8029c341","resolution":{"observed_at":"2026-08-11T21:45:10.002519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-08-17T21:34:28.362812Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-11T21:45:10.007032Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.007032Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:bd6131e94e1afafe70fcc74ebf9cd6636e66cc43fff2f04eed7237bc5b6a8486","observation_id":"8d20e3a2-82c3-40c9-824d-5b1d9fec4651","resolution":{"observed_at":"2026-08-11T21:45:10.007032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.126982Z","title":"Handrefiner: Refining malformed hands in generated images by diffusion-based conditional inpainting","venue":null,"work_id":"43adfefc-ca10-4905-b938-38dba82031db","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.011270Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:897ea786b5245bdd098d265e4562d2cd9c05454138a649332e46c4205f52e960","observation_id":"50bc3a62-629e-481a-8aa1-fbb9cc8b7afb","resolution":{"observed_at":"2026-08-11T21:45:11.132941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-15T17:22:09.610128Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-11T21:45:10.017361Z","title":"Medi- apipe: A framework for building perception pipelines","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.017361Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:2285a2256603fd9e4ebe05a7cdbb9d73eeaf676b1793c8f1c0278fcea49db4ce","observation_id":"df996d96-a8ef-47e7-a982-d9058f18d572","resolution":{"observed_at":"2026-08-11T21:45:10.017361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.113200Z","title":"Dexvip: Learning dexterous grasping with human hand pose priors from video","venue":null,"work_id":"8d5527af-a7ff-474f-a8e7-0e0cb9e4785e","year":2021},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.021924Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:2d4b2d121a8d9dd053b3ef1e66fe3f69055c7918af12e0542b37996513e1f7df","observation_id":"49015ec3-e604-4884-8243-cf92068f8b29","resolution":{"observed_at":"2026-08-11T21:45:11.117322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.06553","last_updated":"2019-07-09T20:25:22Z","snapshot_observed_at":"2026-08-15T18:42:59.646143Z","submitted_at":"2018-10-14T20:51:41Z","title":"Recipe1M+: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.06553","snapshot_observed_at":"2026-08-11T21:45:10.025263Z","title":"Recipe1m+: a dataset for learning cross-modal embeddings for cooking recipes and food images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.025263Z"},"links":{"cited_paper":"/paper/1810.06553","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:3553af68734a57cf0ae6588b77318131537b2060aa8baa079e99cc40febd9c43","observation_id":"bf88c734-6f0a-4a9f-aa4c-b6d1cf86dbce","resolution":{"observed_at":"2026-08-11T21:45:10.025263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.028678Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.028678Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:76f40ad03fd9d2ed0da0643bfbaf5d551075e04e50beb9ea806f9c496a04cac5","observation_id":"86664d79-ab7f-40d2-b01b-9fddadd615b9","resolution":{"observed_at":"2026-08-11T21:45:10.028678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.088529Z","title":"Han- diffuser: Text-to-image generation with realistic hand ap- pearances","venue":null,"work_id":"dd72dc69-9883-4d28-a5d2-d3d81ad21cf8","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.032120Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:f0e1886858014992ec97a91361aa1417b1c30740e21059b30cdaebedfe80b91d","observation_id":"fa91b37d-daa1-4561-938b-4830fd64619d","resolution":{"observed_at":"2026-08-11T21:45:11.095541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.072950Z","title":"Conditional image-to-video gener- ation with latent flow diffusion models","venue":null,"work_id":"97a24489-0d43-4574-a3f6-12bbe45db3b3","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.036469Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:a6cc1638ba1601823461fee8dc39f91c64c8753ac350a9def1e922c4afe24e92","observation_id":"0af6a45f-b2e8-4f19-9e17-be6b9a04bc55","resolution":{"observed_at":"2026-08-11T21:45:11.078521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:11.056162Z","title":"Ti2v-zero: Zero-shot image condition- ing for text-to-video diffusion models","venue":null,"work_id":"88f6a817-e54f-4f8f-bb86-d62a0cace6b1","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.040254Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:8f42c6b9776674c89be444a450cf22e2393fc42240d7a90cdc49924a5bd4fc31","observation_id":"f6768da8-c1d6-4744-bbc8-cf575ce84005","resolution":{"observed_at":"2026-08-11T21:45:11.061746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.043511Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.043511Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:074211e6cc7a0e04b762bf76e75eac4ce72c9c79da0335cceca886edfde7550f","observation_id":"78ee2f4e-1f22-4847-8472-d2e9bcb3e993","resolution":{"observed_at":"2026-08-11T21:45:10.043511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.046644Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.046644Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:28174b8ddac59f5917d4410a8e4ee8855c8eaa65fb93c90ab6e61265e3b85bf8","observation_id":"a4102e6b-ab42-4357-a7fb-06d1fcc38034","resolution":{"observed_at":"2026-08-11T21:45:10.046644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.050808Z","title":"The meccano dataset: Understanding human-object interactions from egocentric videos in an industrial-like domain","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.050808Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:39463b3bb81e86dfa07ad27bab2d2cef6ae4014bfca9fb38980d63805eb6f48e","observation_id":"e52dd587-8d4e-46dc-b45b-69cbee120526","resolution":{"observed_at":"2026-08-11T21:45:10.050808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.986657Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"fac44a87-f01b-4058-a2b7-08a96c1ffd7a","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.055175Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:1a109c26eab5900e067a6ecda69e0c953e323a5dcb912582ec87cc81929a7234","observation_id":"ef77aa70-7a2d-415a-9c0f-a102233f68e6","resolution":{"observed_at":"2026-08-11T21:45:10.991089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.058737Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.058737Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:c313be77241a2cdbfa57c69e1852eff2b57ea1cd67936eb4710bac9c36b5a4d1","observation_id":"bc4e86e4-e2c6-4ed0-89e9-ecd873b53b03","resolution":{"observed_at":"2026-08-11T21:45:10.058737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-11T21:45:10.063091Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.063091Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:a094b43765e6b7c880f69441cc727a5dbb99365c63cd98c1a018890f98fd3156","observation_id":"6c642cb2-8f57-4ffd-9513-3129aa1ebdb9","resolution":{"observed_at":"2026-08-11T21:45:10.063091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.067305Z","title":"As- sembly101: A large-scale multi-view video dataset for un- derstanding procedural activities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.067305Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:1a7bbdf672dc614a47947eb443320b9b09db7fc9c42ff33097cd990f97cacbfb","observation_id":"53feb2f4-ee4d-4333-943d-3dbf01ed72a6","resolution":{"observed_at":"2026-08-11T21:45:10.067305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T21:45:10.071463Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.071463Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:d911b3817e2ce7ef3d8507356a4d2298aabae3937bd1939a98dc478a0f74585c","observation_id":"db523071-473f-4964-9366-d7e124177089","resolution":{"observed_at":"2026-08-11T21:45:10.071463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.954099Z","title":"Many turn to youtube for children’s content, news, how-to lessons.Pew Research Center, 7, 2018","venue":null,"work_id":"f442bdb3-6bd9-4cdd-b4e5-85d637f8160a","year":2018},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.079620Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:392c0fa909e5587b71e8d16dc9776ef89b201e8f43c7c5804a88717e591627ae","observation_id":"c4df0f93-d0e2-4c0e-b988-69f5664eb36d","resolution":{"observed_at":"2026-08-11T21:45:10.959083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T21:45:10.084373Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.084373Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:6836dd482e70d920db1e1c1b4c65aa2ac27a8483a4279df7bf9f99257b87278f","observation_id":"66cdd9d8-2910-4151-a238-2f0e5b04c7f3","resolution":{"observed_at":"2026-08-11T21:45:10.084373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10076","last_updated":"2025-02-09T05:57:42Z","snapshot_observed_at":"2026-08-16T13:09:48.416451Z","submitted_at":"2024-10-14T01:39:56Z","title":"VideoAgent: Self-Improving Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10076","snapshot_observed_at":"2026-08-11T21:45:10.088431Z","title":"Videoagent: Self-improving video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.088431Z"},"links":{"cited_paper":"/paper/2410.10076","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:2e04899854191a1420b2d5522fe3e6ba0bfdb0b5cb7981cc2464099b5e3c452f","observation_id":"a897df8d-f6e3-4e7a-8dfe-13e88d87d733","resolution":{"observed_at":"2026-08-11T21:45:10.088431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.940478Z","title":"Genhowto: Learning to generate actions and state transformations from instructional videos","venue":null,"work_id":"4ef7357a-f164-4c42-a99e-fd781624ccf5","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.092424Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:b95ba40582724319916484e12cad5955e59746515b1937ce23fd9532c99f4cb7","observation_id":"c95c5cdd-8d6b-448d-83a9-3522f8228f47","resolution":{"observed_at":"2026-08-11T21:45:10.944483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.924576Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"8c2de4ff-4345-463a-9e7c-ac4679e4b512","year":2019},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.097624Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:94129df575e886ad44be4f1a7aae6849e19e62b4e4535ac5d12e3bb2c8f6abca","observation_id":"c43752f6-ee06-4057-b6f4-c3d3a596b5f7","resolution":{"observed_at":"2026-08-11T21:45:10.929599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.907071Z","title":"Long-term temporal convolutions for action recognition","venue":null,"work_id":"b92524aa-cdca-4d8c-a30a-976aa5b0060d","year":2017},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.101769Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:847b60dea8bc42bad5b316d51bcc0b878981be0d29dd5b563f23ccaffab52f9f","observation_id":"1b24bb18-76bf-4fe2-9906-07aeb04a19af","resolution":{"observed_at":"2026-08-11T21:45:10.911202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.108198Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.108198Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:060d286645e1d4548248d7d0441743d730946f7ffe1ba28065d713562479786e","observation_id":"31ee753b-b15c-464d-88bb-54425c944b60","resolution":{"observed_at":"2026-08-11T21:45:10.108198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.113909Z","title":"Imagen editor and editbench: Advancing and evaluating text-guided im- age inpainting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.113909Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:96924c349ff443009222847125d209d68de28e6176587360a60fafae110c84b6","observation_id":"0b87055f-1e6c-4f93-8fb3-8744c03b4455","resolution":{"observed_at":"2026-08-11T21:45:10.113909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.869926Z","title":"Holoassist: an egocentric human interaction dataset for interactive ai assistants in the real world supple- mentary material","venue":null,"work_id":"4ad6109f-22c9-465f-96f5-1b047b3628ad","year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.118962Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:07c1d0b847ae82c85ce62221093ef46ec594993dcb1cfef316df405fa5c73b23","observation_id":"57f8ec96-e070-4281-9377-522da41f2d4e","resolution":{"observed_at":"2026-08-11T21:45:10.878103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.853133Z","title":"Multi- modal augmented-reality assembly guidance based on bare- hand interface","venue":null,"work_id":"6e60eeb4-e966-4aa6-bcbc-d9a79eab467a","year":2016},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.123297Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:bcffeb914607586efe7f2e50ee18ea608d4eec397d81e5f9be9cac172714cdfd","observation_id":"31f1c55b-a807-4f1e-80fe-b475490bfc37","resolution":{"observed_at":"2026-08-11T21:45:10.859282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.127496Z","title":"Holoassist: an egocen- tric human interaction dataset for interactive ai assistants in the real world","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.127496Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:0f606fad17639605a4613b7984326ef1dbe55a394d004f066eda21ef7f6c4802","observation_id":"01d2e141-519f-4a36-bfba-906867de73c2","resolution":{"observed_at":"2026-08-11T21:45:10.127496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.132365Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.132365Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:23335da8ba251740facf9bc61348491b4342c5d26394ef5fbe9f4a47c46aea31","observation_id":"d2f5d3fa-986b-484a-b3ef-a2dd0c6c8b6b","resolution":{"observed_at":"2026-08-11T21:45:10.132365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-11T21:45:10.136640Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.136640Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:379cf92938b9cab4817bd81c2b08a4884cd9344b2efe4ae78db44a638819ac27","observation_id":"6f5f1db1-2755-4779-a441-58553b189d1e","resolution":{"observed_at":"2026-08-11T21:45:10.136640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.820006Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"5cfe2941-76c1-4373-9301-c30c88a4882d","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.141927Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:e27cd1d49e7d8d95b3d0031f45b8154b042da2cf984dc3eebc48696ca50e86f3","observation_id":"95626d99-19c3-4dac-a75d-04c1eacc7e6c","resolution":{"observed_at":"2026-08-11T21:45:10.825113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-11T21:45:10.147322Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.147322Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:6bb96c964d15fa0fd7fd9339b748cb1b5d25a5fdbbacf338c2dab80ada124434","observation_id":"c3a86d49-5613-41b7-80cf-553565c35d36","resolution":{"observed_at":"2026-08-11T21:45:10.147322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.804300Z","title":"Freeinit: Bridging initialization gap in video dif- fusion models","venue":null,"work_id":"4edf6d08-55ce-4d33-b943-61abf7deb143","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.152539Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:6de9171edbbdab019b5742794ba952442d0cb0977aab4aa328e4bd06a7faa07f","observation_id":"c2d1a377-f961-4b2d-9d36-2c0252e97de2","resolution":{"observed_at":"2026-08-11T21:45:10.809310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.786622Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"654a2b8d-e42c-4098-9498-aa1e0a73a857","year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.156459Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:0e97dbc4bb8cc2c062e057fefa1233340989aebef7ff157478806866445c8125","observation_id":"a319beee-3af4-4f41-ba47-b358f3743d64","resolution":{"observed_at":"2026-08-11T21:45:10.791674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.770930Z","title":"X-gen: Ego-centric video prediction by watching exo-centric videos","venue":null,"work_id":"65c9a82c-9c15-41e4-a8cc-55b6f8c3a846","year":2025},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.161433Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:dc7a585bc2bf02a16d22c51837ed90387e30351bfac4d7ffc8376c09cd9edcc9","observation_id":"69cbdec1-6388-4ac8-b1f9-b99551f26838","resolution":{"observed_at":"2026-08-11T21:45:10.775728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.754274Z","title":"Ad- vancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"f0f8af3c-49ae-4844-9784-a675b8f87233","year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.166491Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:af4d5d5636a4938888b2760ab48ac61e3ba19bf91cd7e38f4a442523238fbf00","observation_id":"1ed1cdca-47e3-4de5-aa48-68d8ba40aacb","resolution":{"observed_at":"2026-08-11T21:45:10.761706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.734103Z","title":"Stat: Spatial-temporal attention mechanism for video cap- 11 tioning","venue":null,"work_id":"19b563cb-16bf-45e8-9079-b399f69b23fe","year":null},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.172257Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:3a2f357bfb7c07fb6f10d7bea8cae23dbc2a0042a2d80b1269c6b8e137747cd8","observation_id":"f616454d-f686-4b37-812b-d70680323439","resolution":{"observed_at":"2026-08-11T21:45:10.739904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-08-13T12:06:46.989903Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-11T21:45:10.177014Z","title":"Learn- ing interactive real-world simulators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.177014Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:7baea06b5df88969a09b159b75df75fe90d216f2ea969f6361d55ecb0f3cc755","observation_id":"7fe80857-1b75-4ccd-bb03-8787d860ba96","resolution":{"observed_at":"2026-08-11T21:45:10.177014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15075","last_updated":"2024-01-26T18:57:54Z","snapshot_observed_at":"2026-08-16T14:24:09.251599Z","submitted_at":"2024-01-26T18:57:54Z","title":"Annotated Hands for Generative Models","version":1},"cited_work":{"arxiv_id":"2401.15075","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.15075","snapshot_observed_at":"2026-08-11T21:45:10.364563Z","title":"Annotated Hands for Generative Models","venue":"cs.CV","work_id":"e9cacb09-c0bd-4446-9448-0c03ca180a26","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.184737Z"},"links":{"cited_paper":"/paper/2401.15075","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:fee316d19059c2d8e2b22718e908eda7586317c1abba5a305f72e52db022d38b","observation_id":"d4d2ce0d-5e36-412d-9e67-848dc9fd2a39","resolution":{"observed_at":"2026-08-11T21:45:10.372031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T21:45:10.192103Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.192103Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:4e81d47b50b075a37fdf49ae13346da9ce33a4ff2265c47de878a15ecfc7aad3","observation_id":"3b0d8d95-bca7-4ccd-9b57-b725e623dc4f","resolution":{"observed_at":"2026-08-11T21:45:10.192103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.713161Z","title":"Learning universal policies via text-guided video generation","venue":null,"work_id":"d2e36edd-f36c-48f8-9f5a-8d88f8bb164a","year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.200996Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:90d875a53077f8b97c3127d8940e62868d6c73e41dbb59a5b4810579c7d061fc","observation_id":"eb9af77c-8673-4a21-9319-b37c2a7c5d11","resolution":{"observed_at":"2026-08-11T21:45:10.718568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-08-11T21:45:10.209618Z","title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.209618Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:582eda1bea23410bb0486010360926c219c87373fc960590856779949a9fad75","observation_id":"833fe562-249e-434f-8fb5-ff90f3d117ad","resolution":{"observed_at":"2026-08-11T21:45:10.209618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.699168Z","title":null,"venue":null,"work_id":"c8899daf-f2c8-465f-b90b-985935bd6ee4","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.215010Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:29e8eaacf4284a76ca74f95271ef297b31e36e3e1aaca237bf40098d4d06bcef","observation_id":"34151f3a-bd05-4fbf-9a39-1978b2539da7","resolution":{"observed_at":"2026-08-11T21:45:10.703802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-16T16:35:36.335456Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-11T21:45:10.224664Z","title":"Motiondif- fuse: Text-driven human motion generation with diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.224664Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:b0947ab107da6ca9da29d5378c080b12121106d4a4e532136628d6115ae52246","observation_id":"1800aa40-4ab1-4cab-85ee-30f1711d8c9e","resolution":{"observed_at":"2026-08-11T21:45:10.224664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.678300Z","title":"Pia: Your personalized image animator via plug-and-play modules in text-to-image models","venue":null,"work_id":"071b6de8-0fc7-4a37-8663-5a039742cb98","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.231845Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:886ab0431cf2623a5f84c6e79218c6ff47373c11d4298d667b846f1ebfa242d6","observation_id":"def0720d-1a4a-4ebb-835e-c95ad5a8c746","resolution":{"observed_at":"2026-08-11T21:45:10.683823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.663452Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"94261fac-4485-49b5-aea5-ede1020cd263","year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.237158Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:2d19c29b2c5a039446f8eef7cc0b7d7b4015ee2f5f4a9f8bfbd682864b2ecf5f","observation_id":"503325e1-b18b-4b60-b170-f8db274132fb","resolution":{"observed_at":"2026-08-11T21:45:10.668299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:45:10.638129Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"bbd11a47-ab2f-4561-9187-014f6c52eec5","year":2018},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.243509Z"},"links":{"citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:eb8540fc655440af4ceb5ff8ad5c6cb6477596570af80a901df2e2f3bae1c0fb","observation_id":"180a3c7e-14d0-45b2-bee9-7b78ef2a8c7f","resolution":{"observed_at":"2026-08-11T21:45:10.645763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08328","last_updated":"2024-11-13T04:20:45Z","snapshot_observed_at":"2026-08-18T03:54:34.713687Z","submitted_at":"2024-11-13T04:20:45Z","title":"Motion Control for Enhanced Complex Action Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08328","snapshot_observed_at":"2026-08-11T21:45:10.247547Z","title":"Motion control for enhanced complex action video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:10.247547Z"},"links":{"cited_paper":"/paper/2411.08328","citing_paper":"/paper/2412.04189"},"observation_digest":"sha256:85f9d4eb3c3f9a46771d66cb043be8df3a61fad76234de53a7881e52453c0fe3","observation_id":"e119dd37-e116-46a1-90e5-68fbe57e7a6b","resolution":{"observed_at":"2026-08-11T21:45:10.247547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.04189","last_updated":"2025-07-14T02:27:36Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T06:57:10.202945Z","submitted_at":"2024-12-05T14:29:10Z","title":"HANDI: Hand-Centric Text-and-Image Conditioned Video Generation"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 1 inbound Pith citation observation for arXiv:2412.04189."}