{"as_of":"2026-08-18T07:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b77c2130ffa5bc7582db1a5bc6e193aad2ebd98b07ee0873a59c7263b448e78","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:14:21.141496Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:56:37.419836Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T13:47:57.492670Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15800","snapshot_observed_at":"2026-08-06T19:56:37.419836Z","title":"Interspatial attention for efficient 4d human video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04285","last_updated":"2025-07-06T07:58:36Z","snapshot_observed_at":"2026-08-14T04:55:37.010503Z","submitted_at":"2025-07-06T07:58:36Z","title":"SeqTex: Generate Mesh Textures in Video Sequence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:56:37.419836Z"},"links":{"cited_paper":"/paper/2505.15800","citing_paper":"/paper/2507.04285"},"observation_digest":"sha256:6fba177ae0e614a857184fdf4866c27fa356bce34993a91ec701272813b2d3cf","observation_id":"75286c7c-d3dd-48ec-9ae6-27b5a5124065","resolution":{"observed_at":"2026-08-06T19:56:37.419836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"cited_work":{"arxiv_id":"2505.15800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15800","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interspatial attention for efficient 4d human video generation","venue":null,"work_id":"5bd417e2-aac6-4bda-8c71-351e75b7f1e2","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-08-16T20:35:09.241083Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2505.15800","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:b14708dbe9d07724b90f8646794e1a6e92711d924e6d7708d16ce06a14a9bd3a","observation_id":"dc25338d-09cd-418e-89cc-6ec6572503dc","resolution":{"observed_at":"2026-05-16T13:47:57.494183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15800/citation-record","integrity":"/paper/2505.15800/integrity","json":"/paper/2505.15800/citation-record.json","paper":"/paper/2505.15800"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-16T17:39:09.604516Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-07T15:14:20.881817Z","title":"arXiv:2404.02101 [cs.CV] Li Hu, Xin Gao, Peng Zhang, Ke Sun, Bang Zhang, and Liefeng Bo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.881817Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:ce4b1b5a9975a9b98733286cd5bdbcda2a21f9bef61ea4b97e613b136437d54d","observation_id":"b6239fae-ae38-4e93-a09d-33564c016c3a","resolution":{"observed_at":"2026-08-07T15:14:20.881817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.557412Z","title":"Johanna Karras, Aleksander Holynski, Ting-Chun Wang, and Ira Kemelmacher- Shlizerman","venue":null,"work_id":"4f7d2060-3179-4443-91c6-3e700751d2b6","year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.885990Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:2c35271a03faabf26611f61c10fd575dce947ff4a3459e67ad88a42557e80f5a","observation_id":"6cef821d-3a50-48ff-8fda-c0973c853a3b","resolution":{"observed_at":"2026-08-07T15:14:21.562225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.545232Z","title":null,"venue":null,"work_id":"846c61cf-dc92-4a12-bde8-917c9d3fed6c","year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.898138Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:e0cfe5db090f9d754c67812f885c86697b7f7cd7e3b0efdc14d7c0bf86b6c821","observation_id":"9147cc3b-ffab-49af-891a-d47529084a5d","resolution":{"observed_at":"2026-08-07T15:14:21.549659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T15:14:20.902286Z","title":"https://arxiv.org/abs/2412.03603 Jimmy Lei Ba, Jamie Ryan Kiros, and Geoffrey E Hinton","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.902286Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:9375447180e4642a4a63c00ece23315941a22dc3901e8e40e63f65bad3e9e6a2","observation_id":"eab4921b-185b-4ee9-8c7f-7c0ea52dec20","resolution":{"observed_at":"2026-08-07T15:14:20.902286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:20.910446Z","title":"SIGGRAPH Asia) 36, 6 (2017), 194:1–194:17","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.910446Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:5a00209e8532e3332e92ef49d45cb02a9056573463d8bbd1f1fbf3e5588fc26d","observation_id":"bf9465c4-d180-425e-91db-e2c1764a60d6","resolution":{"observed_at":"2026-08-07T15:14:20.910446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.515775Z","title":"ArXiv (Aug 2023)","venue":null,"work_id":"6ccf703c-2f4b-49df-9956-38af1561ed90","year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.914289Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:e60c0a2a818391a73a33d3d4ac3ca93b9600e954a60fbe5850454a45ece604d8","observation_id":"e57f9b6f-a5c9-4e66-b3b7-f6f3af69fa05","resolution":{"observed_at":"2026-08-07T15:14:21.520249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17061","last_updated":"2024-03-14T17:58:14Z","snapshot_observed_at":"2026-08-16T14:39:30.762474Z","submitted_at":"2023-11-28T18:59:58Z","title":"HumanGaussian: Text-Driven 3D Human Generation with Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17061","snapshot_observed_at":"2026-08-07T15:14:20.921921Z","title":"arXiv preprint arXiv:2311.17061 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.921921Z"},"links":{"cited_paper":"/paper/2311.17061","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:01614dfdef7343ade86ae9468211e50e26ad5307464f2fa358e3ea6cb89cdc8a","observation_id":"e01e995b-08d6-4d1d-a720-eb807ca6d877","resolution":{"observed_at":"2026-08-07T15:14:20.921921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.494981Z","title":"https://lumalabs.ai/dream-machine","venue":null,"work_id":"f165b30d-3426-4e25-8818-49631c331d62","year":2025},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.926134Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:96b0525d4a6c5d167d9374b46bae926a14165237cade9d7827f9f0280046945c","observation_id":"dec0274e-8fec-4b52-a36f-8c25f1e85185","resolution":{"observed_at":"2026-08-07T15:14:21.498687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-07T15:14:20.930688Z","title":"arXiv preprint arXiv:2409.04410 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.930688Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:3839fd5109895dd5beb5612f302a545a12ff0cb216c6175c3ae5f745327a804f","observation_id":"ee8e6a07-bc63-4621-a9a3-e1ad4c00bdc1","resolution":{"observed_at":"2026-08-07T15:14:20.930688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.1784","last_updated":"2014-11-06T22:33:22Z","snapshot_observed_at":"2026-08-16T19:10:09.657437Z","submitted_at":"2014-11-06T22:33:22Z","title":"Conditional Generative Adversarial Nets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.1784","snapshot_observed_at":"2026-08-07T15:14:20.935571Z","title":"arXiv preprint arXiv:1411.1784 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.935571Z"},"links":{"cited_paper":"/paper/1411.1784","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:21b1dfb9313d53717582563d1fe90162df940a908baaf77d47bf70fe102e0b0f","observation_id":"09c62ae5-6dcc-4c4a-92b5-02c461370250","resolution":{"observed_at":"2026-08-07T15:14:20.935571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-07T15:14:20.940481Z","title":"arXiv preprint arXiv:2407.02371 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.940481Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:1045cf529a3936170e1eacc221451a7c0a6ddb9ea1cb52ee04a1692ad7634929","observation_id":"5809b363-7172-42d8-862b-3d6148a14388","resolution":{"observed_at":"2026-08-07T15:14:20.940481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.482638Z","title":"https://openai.com/index/ video-generation-models-as-world-simulators/","venue":null,"work_id":"ad4a6a25-3917-4667-8bbc-706fa9d49baf","year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.944377Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:e05a128144fd67338481a3e98ebe0b287f47aa7c45d7ce74474e4ac7dc8e8ede","observation_id":"9c6009eb-cdc6-47f0-b11b-0f23f82f9598","resolution":{"observed_at":"2026-08-07T15:14:21.487517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T15:14:20.947641Z","title":"arXiv preprint arXiv:2408.00714 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.947641Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:7923d509b766cf72de164517290c1bd4039e4e9e9687cd9c4dfe3ff095beb45e","observation_id":"d2b22999-146d-4c91-a893-31f0fe859468","resolution":{"observed_at":"2026-08-07T15:14:20.947641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.469089Z","title":"https://runwayml.com/","venue":null,"work_id":"c818b50d-20d5-47eb-80be-f2863cc49cd7","year":2025},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.952048Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:61d3b88176dd28e210b23150f5a475ef6f43408c63c6eb57e029c4d9209207ba","observation_id":"3601bd8d-0f34-4b88-8b5d-86c78aa4d5ac","resolution":{"observed_at":"2026-08-07T15:14:21.473424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17405","last_updated":"2024-09-23T20:52:01Z","snapshot_observed_at":"2026-08-16T13:48:56.392885Z","submitted_at":"2024-05-27T17:53:29Z","title":"Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17405","snapshot_observed_at":"2026-08-07T15:14:20.956062Z","title":"arXiv preprint arXiv:2405.17405 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.956062Z"},"links":{"cited_paper":"/paper/2405.17405","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:be8ac453593924526d9370eedc0cf582719f513fa25b8699645c1bef44e646c6","observation_id":"07e229a5-1a13-417a-8382-a1bcef632100","resolution":{"observed_at":"2026-08-07T15:14:20.956062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10306","last_updated":"2024-12-11T02:55:31Z","snapshot_observed_at":"2026-08-17T02:05:24.887374Z","submitted_at":"2024-10-14T09:06:55Z","title":"Animate-X: Universal Character Image Animation with Enhanced Motion Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10306","snapshot_observed_at":"2026-08-07T15:14:20.968100Z","title":"arXiv preprint arXiv:2410.10306 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.968100Z"},"links":{"cited_paper":"/paper/2410.10306","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:7ff2a74a0cf53c3fb5ffad8c8c543b22c7ed2c66990548332c8b6a6607672868","observation_id":"6fdb87e1-6eb0-420c-8a9e-8d249d0901aa","resolution":{"observed_at":"2026-08-07T15:14:20.968100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.443147Z","title":"Advances in Neural Information Processing Systems (2023)","venue":null,"work_id":"1e2cbaf0-6d86-41f1-b20d-6cf6bc24be2b","year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.971824Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:333320a7b847c82203c9692f47cc11460dc3b75020524bf417c3eecaef5ed4b1","observation_id":"11572eaa-aa6d-4df7-99e3-014009fc7496","resolution":{"observed_at":"2026-08-07T15:14:21.447826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.15069","last_updated":"2021-04-30T15:38:41Z","snapshot_observed_at":"2026-08-16T18:27:50.672545Z","submitted_at":"2021-04-30T15:38:41Z","title":"A Good Image Generator Is What You Need for High-Resolution Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.15069","snapshot_observed_at":"2026-08-07T15:14:20.975374Z","title":"arXiv preprint arXiv:2104.15069 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.975374Z"},"links":{"cited_paper":"/paper/2104.15069","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:9c7429105ed07b55fa003cd2ddb38d4df2972a73d5461caef2777ad9df3cb98c","observation_id":"7935306d-5b7d-4b59-be41-76012901b0bb","resolution":{"observed_at":"2026-08-07T15:14:20.975374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.427238Z","title":"arxiv (2024)","venue":null,"work_id":"a1e42e36-fc70-44be-8f75-46e62338d108","year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.979462Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:ac52eca3f5e705a72add63457d942419e0b1ba510c1b269cb58da9e96c7b4ff4","observation_id":"9ee5288e-e4bd-48eb-8abb-f3abd9eb837f","resolution":{"observed_at":"2026-08-07T15:14:21.431666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-14T07:06:06.462400Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-07T15:14:20.987951Z","title":"arXiv:2408.14837 [cs.LG] https://arxiv.org/ abs/2408.14837 Aaron Van Den Oord, Oriol Vinyals, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.987951Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:8d0211c27ac4adb8bf24d5b548cf4ea8800984e9be675bb479177df4cde7a452","observation_id":"4ff4a29b-f449-4a04-b54e-3eab52d80162","resolution":{"observed_at":"2026-08-07T15:14:20.987951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.399174Z","title":"Advances in neural information processing systems 30 (2017)","venue":null,"work_id":"0c4d051b-2a53-42b3-81dc-0da46061dc62","year":2017},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.992915Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:cd51e398e3818b42242a0323e38984270a26ac91c7eebc6fbba76cbd902f08e5","observation_id":"fa7034db-14b8-4b3f-9916-1eed14ebefa9","resolution":{"observed_at":"2026-08-07T15:14:21.403774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.385766Z","title":"Ruben Villegas, Mohammad Babaeizadeh, Pieter-Jan Kindermans, Hernan Moraldo, Han Zhang, Mohammad Taghi Saffar, Santiago Castro, Julius Kunze, and Dumitru Erhan","venue":null,"work_id":"fff93c2c-cd1e-46fb-9b01-b6f95d113241","year":2017},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.996944Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:26d625e30ec8c8f8af94b4599aa2f467a2ca1e2100c4bef4182072699a2a33be","observation_id":"1143eb30-379d-4fde-8f4d-8c5007beab39","resolution":{"observed_at":"2026-08-07T15:14:21.390527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T15:14:21.116346Z","title":"arXiv preprint arXiv:2503.20314 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.116346Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:36d2da210cd6832a15b4a937f5af6113ddee889e80dfe1ab7c4fcea4d538a0be","observation_id":"d8dffc06-6e27-4d6d-8639-5578b7b264c9","resolution":{"observed_at":"2026-08-07T15:14:21.116346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-16T13:10:35.398679Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-07T15:14:21.120530Z","title":"arXiv preprint arXiv:2410.08260 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.120530Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:4b2cdba2c7965cb74b61bec75604452b7feb6fdf684e1acd47b5b6b5ba0280c3","observation_id":"b790cc10-4fcf-4fb9-86a1-097a7c700402","resolution":{"observed_at":"2026-08-07T15:14:21.120530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.373453Z","title":"arXiv e-prints (2023), arXiv–2307","venue":null,"work_id":"704f1f8d-6746-4f52-a08a-fcc5d4d259c0","year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.125191Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:397eed78859a421628b4a4622caa8980f0fd029e549a509e4a2659edec2aee2b","observation_id":"7f315fbe-7e58-4ee5-9c28-fff435321da8","resolution":{"observed_at":"2026-08-07T15:14:21.378126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-07T15:14:21.128538Z","title":"arXiv preprint arXiv:2104.10157 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.128538Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:794fe5395b80800080a3152d65a2552ecc57876b8f44e89dd635b57cb2ee5c6f","observation_id":"c3cc951e-8f7d-4f3c-96d8-4d41af75e8cd","resolution":{"observed_at":"2026-08-07T15:14:21.128538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-08-17T22:14:12.219954Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T15:14:21.132572Z","title":"arXiv preprint arXiv:2110.04627 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.132572Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:8846ed77079aa88d6cb86966f378224e1c1a9ba201dc160714c24b26347a62f2","observation_id":"8c7ef8fe-4417-4cfc-adc0-953ea8ef0bf8","resolution":{"observed_at":"2026-08-07T15:14:21.132572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20279","last_updated":"2024-10-23T02:38:44Z","snapshot_observed_at":"2026-08-16T13:47:39.869046Z","submitted_at":"2024-05-30T17:33:10Z","title":"CV-VAE: A Compatible Video VAE for Latent Generative Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20279","snapshot_observed_at":"2026-08-07T15:14:21.136900Z","title":"https://arxiv.org/abs/2405.20279 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.136900Z"},"links":{"cited_paper":"/paper/2405.20279","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:1386d75c909f631d4aba198082eef16f2a7a7345dd0b4e0c5adfdd71960cab26","observation_id":"99ab9c85-0178-4c01-9f02-1f10d5ed141b","resolution":{"observed_at":"2026-08-07T15:14:21.136900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.359666Z","title":"https://github.com/hpcaitech/Open-Sora Zerong Zheng, Xiaochen Zhao, Hongwen Zhang, Boning Liu, and Yebin Liu","venue":null,"work_id":"6e8b5571-e680-42a3-935c-caa1f08c3c91","year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:21.141496Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:f34a964052268cd159e95a7c42ff3e1adc26004576777c04fd6403fb8da707e9","observation_id":"b4aa259f-5456-4da3-b4b0-2780deeb3d5c","resolution":{"observed_at":"2026-08-07T15:14:21.365377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.455793Z","title":null,"venue":null,"work_id":"ddf02ac0-bc50-4d5e-9e03-cac574221546","year":2019},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":1171,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.959701Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:2c53f803a925b5f03581c1e810604b56042a926f1abb534ca13d225ed1adbfe1","observation_id":"97c9b1c0-9454-4ebc-94e7-c7d16af60fdd","resolution":{"observed_at":"2026-08-07T15:14:21.461037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T15:14:20.894090Z","title":"arXiv preprint arXiv:1312.6114 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.894090Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:ce9a972da221d9bcc7e4970b454d36e0563b81a63e0e63cd39dd8bf19422b294","observation_id":"7c5793d6-f42f-44c8-8e93-658695e968a5","resolution":{"observed_at":"2026-08-07T15:14:20.894090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.569996Z","title":"Advances in neural information processing systems 27 (2014)","venue":null,"work_id":"b48ec2c5-dba2-4f37-8879-dbb01854e468","year":2014},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.873064Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:d0243e1fd1a7948d5d8e0c741259a1ad218c497cbc0113c4c7e7e67c85f28eb9","observation_id":"3ae10458-c167-4302-8de3-4b05b2884e4d","resolution":{"observed_at":"2026-08-07T15:14:21.574832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.532143Z","title":"ArXiv e-prints (2016), arXiv–1607","venue":null,"work_id":"c79a5e34-f2de-4cc9-b387-72008ef8fe03","year":2016},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.907044Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:bcdcef1b1fe9b3bb46c29a4de8ff33bd20b82495c01e58927de4d0108f35d94c","observation_id":"cd70aa4b-2bc8-4378-be0f-f85723300b97","resolution":{"observed_at":"2026-08-07T15:14:21.538398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T15:14:20.889980Z","title":"arXiv preprint arXiv:1705.06950 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.889980Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:6ace59c67ee1acfb6f772f8b961c8700fde8335d758cf4ce86fc47f21edf6ca2","observation_id":"9a5a089e-9c7c-458f-939d-a465f6299439","resolution":{"observed_at":"2026-08-07T15:14:20.889980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.414219Z","title":null,"venue":null,"work_id":"b0634c5e-eaf2-4d7b-94a0-e2484fa6baf0","year":2019},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.983697Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:59d7023017924634924071ce9c7882b78359b69c82f549a4923d8fbffcc26c81","observation_id":"4c9eebb3-2e05-4cee-b54f-b2e4ae6bd589","resolution":{"observed_at":"2026-08-07T15:14:21.418927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T15:14:20.964178Z","title":"arXiv:2010.02502 (October 2020)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.964178Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:2e147b86a3153af37321588118736cf98a5338e295b04e1f057d3a2dd12f93b3","observation_id":"435fbdb8-026c-4d93-b412-334287693bfa","resolution":{"observed_at":"2026-08-07T15:14:20.964178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.505084Z","title":"ACM transactions on graphics (TOG) 40, 6 (2021), 1–16","venue":null,"work_id":"0c40757d-16a9-4e46-9d4c-2a198731e185","year":2021},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.918554Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:c3ee4102350e088cacaf86bf91cae07ab8c319463b3296d56938e93abee08edd","observation_id":"d768f3de-edf5-46d0-90a1-4a6f61b30005","resolution":{"observed_at":"2026-08-07T15:14:21.508866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.593240Z","title":"Advances in Neural Information Processing Systems 35 (2022), 19900–19916","venue":null,"work_id":"cdfca219-6e0c-49f8-be1d-4a3263d348dd","year":2022},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.864873Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:aa554d2e7b5b8eba9e1adcbe20ac1229255d4762370fc59fb9c1193c01f3801a","observation_id":"a2b10016-b3d5-4808-aaa5-db964be69dfe","resolution":{"observed_at":"2026-08-07T15:14:21.596816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06662","last_updated":"2023-12-11T18:59:57Z","snapshot_observed_at":"2026-08-16T14:35:45.631393Z","submitted_at":"2023-12-11T18:59:57Z","title":"Photorealistic Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06662","snapshot_observed_at":"2026-08-07T15:14:20.876919Z","title":"arXiv preprint arXiv:2312.06662 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.876919Z"},"links":{"cited_paper":"/paper/2312.06662","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:9d4c37e95de99668baf68d38743ae85a061c7f643348e950bc9ae9b1417fac22","observation_id":"61bf796b-3e09-4c2e-87b7-cc8273bb1b61","resolution":{"observed_at":"2026-08-07T15:14:20.876919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:21.581848Z","title":"In Forty-first International Conference on Machine Learning, ICML 2024, Vienna, Austria, July 21-27,","venue":null,"work_id":"da9c628b-40f9-4518-ad5f-a8e9b78ef445","year":2024},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.869424Z"},"links":{"citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:942f7cf3881f7f90ed89cc5fcd863552e86c366f6d66a7b458fd60b945d08486","observation_id":"be854e3e-7591-4e3c-9919-f709ff0aad51","resolution":{"observed_at":"2026-08-07T15:14:21.586535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T15:14:20.861002Z","title":"arXiv preprint arXiv:2501.03575 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:20.861002Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2505.15800"},"observation_digest":"sha256:b0f83e5b035411b13030783ff11c23ba3f08bf68b4172b1f7a6f6ec1af261f99","observation_id":"e75c1a73-b4f3-4a38-878b-ce2f6d7f4a94","resolution":{"observed_at":"2026-08-07T15:14:20.861002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15800","last_updated":"2025-05-25T17:44:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:52:59.675375Z","submitted_at":"2025-05-21T17:53:47Z","title":"Interspatial Attention for Efficient 4D Human Video Generation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2505.15800."}