{"as_of":"2026-08-09T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:444dcc9b4ccbc8cc3d0e9caa3f757fce5b8da33161480933df8bebe30566dc25","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:13:02.830263Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:17:57.923573Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-08T17:13:02.830263Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05979","last_updated":"2025-04-01T07:54:57Z","snapshot_observed_at":"2026-08-09T01:59:21.861980Z","submitted_at":"2025-02-09T18:12:25Z","title":"VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T17:13:02.830263Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2502.05979"},"observation_digest":"sha256:1ef8f2dc0266f6ea2a317b8be1b146133c27f059e16fa4c5dcd5679ae8c89ac3","observation_id":"c4e1569f-f756-46ad-ac06-7e32472102b4","resolution":{"observed_at":"2026-08-08T17:13:02.830263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-08T10:09:43.498982Z","title":"Motionbooth: Motion-aware customized text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08189","last_updated":"2025-05-21T05:46:18Z","snapshot_observed_at":"2026-08-09T05:09:02.211543Z","submitted_at":"2025-02-12T07:59:41Z","title":"AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T10:09:43.498982Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2502.08189"},"observation_digest":"sha256:75cd2d5314b361835cafb7deaaf08b22f1ebe26d055cb10d6a0c93f4d7cda68d","observation_id":"c785492b-bcdf-4d12-a3ec-55f18c3d6f3d","resolution":{"observed_at":"2026-08-08T10:09:43.498982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-07T19:40:21.387136Z","title":"Motionbooth: Motion-aware customized text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.387136Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:38bd7a31a5a7fce9edba7b1c410994f9c50c3a07b9d4cedd90e5974834b1586b","observation_id":"2c3e4e67-a0b9-42eb-9399-72863f46e516","resolution":{"observed_at":"2026-08-07T19:40:21.387136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2406.17758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-07-03T10:17:57.923573Z","title":"Mo- tionbooth: Motion-aware customized text-to-video genera- tion","venue":null,"work_id":"f0160eed-d753-4fc7-becc-433843258af9","year":2024},"citing_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T17:51:41.947939Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2504.17816"},"observation_digest":"sha256:4b00c4cd40fbcdd192c1555e85604056219064e389498b6c10fe4cd1fb740c57","observation_id":"7ca8527e-05c0-4db9-aa44-1708b1f4e363","resolution":{"observed_at":"2026-05-22T17:51:54.344375Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-07T14:01:14.134507Z","title":"Mo- tionbooth: Motion-aware customized text-to-video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20255","last_updated":"2025-07-07T17:56:30Z","snapshot_observed_at":"2026-08-07T13:53:53.640300Z","submitted_at":"2025-05-26T17:32:10Z","title":"AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:14.134507Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2505.20255"},"observation_digest":"sha256:5ad63b1250092b9047470b54b7255469c94cfb37404880ae0e1c49fc1af970dc","observation_id":"7205628a-6ab7-4b7e-ba1a-18b6be8eb7ba","resolution":{"observed_at":"2026-08-07T14:01:14.134507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-07T13:59:35.677086Z","title":"Motionbooth: Motion-aware customized text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.677086Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:7a2e0096e54afe80dd3cea45829280df849b4a182cbe5b43577a01baa4d51de3","observation_id":"0b5ae721-ba87-40ff-bab8-71e9c71c1738","resolution":{"observed_at":"2026-08-07T13:59:35.677086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-07T14:29:20.226647Z","title":"Motionbooth: Motion-aware customized text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21541","last_updated":"2025-09-01T09:14:35Z","snapshot_observed_at":"2026-08-08T13:38:50.524989Z","submitted_at":"2025-05-24T16:08:04Z","title":"DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:20.226647Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2505.21541"},"observation_digest":"sha256:02a2c34d23c5760f661bb6d0b47022bc559ace9e26597874886da85f1f4e7139","observation_id":"0ffb9d92-39d4-4c32-bf3d-0e2db203c2bc","resolution":{"observed_at":"2026-08-07T14:29:20.226647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2406.17758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-07-03T10:17:57.923573Z","title":"Mo- tionbooth: Motion-aware customized text-to-video genera- tion","venue":null,"work_id":"f0160eed-d753-4fc7-becc-433843258af9","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:5057e9eadd4522d5aed1201f6081870cf473f0c4fe968c194d90ce993ad3774e","observation_id":"8b73aebd-0140-40db-8b6b-30be63da433c","resolution":{"observed_at":"2026-05-19T08:02:10.614007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-06T20:25:28.608683Z","title":"Motionbooth: Motion-aware customized text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.608683Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:f1076cac645c2195740959c00cee1acefa9017d3ebe2440448a0d63646006ecb","observation_id":"39f036ab-5588-464d-8392-59af76ab3bf2","resolution":{"observed_at":"2026-08-06T20:25:28.608683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-06T19:25:28.587239Z","title":"Motionbooth: Motion-aware customized text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05678","last_updated":"2025-07-08T05:00:17Z","snapshot_observed_at":"2026-08-06T19:17:57.988428Z","submitted_at":"2025-07-08T05:00:17Z","title":"LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:28.587239Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2507.05678"},"observation_digest":"sha256:2a5414bc2afade070b9c478805eb7335075b90c0fc99bd8f57a225f254ba74ee","observation_id":"35cbd15c-cd64-46a2-81bf-f4de539d0907","resolution":{"observed_at":"2026-08-06T19:25:28.587239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-06T19:19:32.810973Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05963","last_updated":"2025-07-09T07:01:34Z","snapshot_observed_at":"2026-08-08T15:17:23.406292Z","submitted_at":"2025-07-08T13:11:40Z","title":"Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:32.810973Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2507.05963"},"observation_digest":"sha256:cfa918e2def26b0acbe91bdb200df52544070d7def186c3d5db5cb07b3fb0a49","observation_id":"3d14095e-a6ca-47ed-967e-2f705de22637","resolution":{"observed_at":"2026-08-06T19:19:32.810973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2406.17758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-07-03T10:17:57.923573Z","title":"Mo- tionbooth: Motion-aware customized text-to-video genera- tion","venue":null,"work_id":"f0160eed-d753-4fc7-becc-433843258af9","year":2024},"citing_paper":{"arxiv_id":"2606.11783","last_updated":"2026-06-10T08:15:52Z","snapshot_observed_at":"2026-07-06T23:50:49.040880Z","submitted_at":"2026-06-10T08:15:52Z","title":"A Comprehensive Ecosystem for Open-Domain Customized Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T10:06:33.572182Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2606.11783"},"observation_digest":"sha256:cae90832d05a94afbcf8b0e15fc0ea29de72db3e3226b5956098abfaa7174c6d","observation_id":"1e0c8980-af4d-4c0f-a55f-7dace62a2c9d","resolution":{"observed_at":"2026-07-03T10:17:57.924924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.17758/citation-record","integrity":"/paper/2406.17758/integrity","json":"/paper/2406.17758/citation-record.json","paper":"/paper/2406.17758"},"outbound":[],"paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2406.17758."}