{"as_of":"2026-08-24T04:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1051b93cc7a19741b21a99624d91b09fd113000814c7de5d1f22729c0c960488","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:30:34.764898Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T00:22:55.503532Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T00:25:32.931076Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"cited_work":{"arxiv_id":"2507.13344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13344","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dif- fuman4d: 4d consistent human view synthesis from sparse- view videos with spatio-temporal diffusion models","venue":null,"work_id":"9eae9727-8296-418f-a6ef-58623eeb4d56","year":2025},"citing_paper":{"arxiv_id":"2511.05152","last_updated":"2026-04-20T10:48:10Z","snapshot_observed_at":"2026-08-15T10:39:56.128261Z","submitted_at":"2025-11-07T11:07:34Z","title":"Splatography: Sparse multi-view dynamic Gaussian Splatting for filmmaking challenges","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T00:22:55.503532Z"},"links":{"cited_paper":"/paper/2507.13344","citing_paper":"/paper/2511.05152"},"observation_digest":"sha256:37a6002f08f899dbd9ae54f934d43c51035b4cc50136beb65719c9d56c230741","observation_id":"1cc16329-431c-4af8-8058-054d349c6e10","resolution":{"observed_at":"2026-05-18T00:25:32.934331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"cited_work":{"arxiv_id":"2507.13344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13344","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dif- fuman4d: 4d consistent human view synthesis from sparse- view videos with spatio-temporal diffusion models","venue":null,"work_id":"9eae9727-8296-418f-a6ef-58623eeb4d56","year":2025},"citing_paper":{"arxiv_id":"2603.26481","last_updated":"2026-04-07T06:59:09Z","snapshot_observed_at":"2026-08-17T09:21:39.261869Z","submitted_at":"2026-03-27T14:44:52Z","title":"SparseCam4D: Spatio-Temporally Consistent 4D Reconstruction from Sparse Cameras","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T23:41:24.423859Z"},"links":{"cited_paper":"/paper/2507.13344","citing_paper":"/paper/2603.26481"},"observation_digest":"sha256:541c27fd1000a3a7203cf6055b82e240d629ca3306228447e6a67bf9ccca1ead","observation_id":"026f7edc-e9a8-445e-ad1e-15107d66761c","resolution":{"observed_at":"2026-05-14T23:43:18.026626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13344/citation-record","integrity":"/paper/2507.13344/integrity","json":"/paper/2507.13344/citation-record.json","paper":"/paper/2507.13344"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.420799Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.420799Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:38c21749b1de8044c7bf1b74cf60194d0ff39f793c3dbc0d3a83966b14704c46","observation_id":"8571a637-e73d-4f7f-855d-d5a9b3b2307b","resolution":{"observed_at":"2026-08-06T16:30:34.420799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.425120Z","title":"Creation of 3d human avatar using kinect","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.425120Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:2fe46dfd7f768dc9e6dc7cc8e5e7f0b0ab84bce61ba306d60aa7ccd3608dad76","observation_id":"b9608fa7-51de-47d9-aa6d-230bc712c26f","resolution":{"observed_at":"2026-08-06T16:30:34.425120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.429227Z","title":"Tc4d: Trajectory-conditioned text-to-4d generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.429227Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:c6233ca77b82bec597f338e3a42f21a92ec6446a53694f7b29c08e0eca81882a","observation_id":"37df16ba-3007-4cda-8f54-942195d81f19","resolution":{"observed_at":"2026-08-06T16:30:34.429227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.433775Z","title":"4d-fy: Text-to-4d generation using hybrid score dis- tillation sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.433775Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:2561b68de7ab0ba38225834049126d75ac1fcb52ac86b302918ca79f34b353e4","observation_id":"f1515e09-b1b1-4f20-827c-c2fa1ab62330","resolution":{"observed_at":"2026-08-06T16:30:34.433775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.437662Z","title":"Detailed full-body reconstructions of moving peo- ple from monocular rgb-d sequences","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.437662Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:8a41808b08dcf9a49181f9468a2b96d6ba2289dc81c0fb167d98e6bd57ea6136","observation_id":"8e6c181b-52a0-45f0-8d1e-2bbfcfc8f81a","resolution":{"observed_at":"2026-08-06T16:30:34.437662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.441532Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.441532Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:4a74510764c2b9819cc6cb26a012085c94d24db4f9a90ea2d57b5d1231fa0530","observation_id":"3e90e633-72a8-449c-a8d7-26581edcb1e1","resolution":{"observed_at":"2026-08-06T16:30:34.441532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.445677Z","title":"Hexplane: A fast representa- tion for dynamic scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.445677Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:d35719ca382bcc9e57a82ca2c3ce1ca8f47cecf4cb7ea749966af92aa7632b92","observation_id":"7f9d07fd-e859-4e60-9c03-e96119de7221","resolution":{"observed_at":"2026-08-06T16:30:34.445677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.738377Z","title":"pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction","venue":null,"work_id":"451b47f2-a3b6-49be-a838-6ffc43631a57","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.450060Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:ae97f56bfba1f93d52cd3fcd2e71724b1f8c35d923f1bc43e576d5591984635f","observation_id":"35acfce3-5e25-4342-a3e4-6988038785cf","resolution":{"observed_at":"2026-08-06T16:30:35.742244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14627","last_updated":"2024-07-18T13:10:22Z","snapshot_observed_at":"2026-08-18T09:51:43.724737Z","submitted_at":"2024-03-21T17:59:58Z","title":"MVSplat: Efficient 3D Gaussian Splatting from Sparse Multi-View Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14627","snapshot_observed_at":"2026-08-06T16:30:34.453665Z","title":"Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.453665Z"},"links":{"cited_paper":"/paper/2403.14627","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:dcb0ccf64138ffc144b7372123e3e506df85ac2655b4dfd77b2c6232e8b0048c","observation_id":"5ed6c430-2746-45c9-8dbe-79c1b92c16ce","resolution":{"observed_at":"2026-08-06T16:30:34.453665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10173","last_updated":"2023-09-30T06:24:23Z","snapshot_observed_at":"2026-08-18T12:01:26.987874Z","submitted_at":"2023-07-19T17:58:03Z","title":"DNA-Rendering: A Diverse Neural Actor Repository for High-Fidelity Human-centric Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10173","snapshot_observed_at":"2026-08-06T16:30:34.457845Z","title":"Dna- rendering: A diverse neural actor repository for high-fidelity human-centric rendering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.457845Z"},"links":{"cited_paper":"/paper/2307.10173","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a446cc2c1c9035c81eb6ba6e79d02c029392444710e5cc65e445cab245481b48","observation_id":"41e765d0-2b3f-47a7-a50c-f944d2ee17b8","resolution":{"observed_at":"2026-08-06T16:30:34.457845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.463175Z","title":"High-quality streamable free-viewpoint video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.463175Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:ffced4bc7f3a5f2f34484577cd46d1df4f0e748e310bc0b12eb15e72b7af2ef4","observation_id":"3487a70a-6586-4f65-94e6-11311f655dce","resolution":{"observed_at":"2026-08-06T16:30:34.463175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08051","last_updated":"2022-12-15T18:56:53Z","snapshot_observed_at":"2026-08-16T16:08:20.723586Z","submitted_at":"2022-12-15T18:56:53Z","title":"Objaverse: A Universe of Annotated 3D Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08051","snapshot_observed_at":"2026-08-06T16:30:34.468225Z","title":"Obja- verse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.468225Z"},"links":{"cited_paper":"/paper/2212.08051","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:7b41eba15f466e339e78d4dda45fbc940289e181563affc3ea7391175598802e","observation_id":"57b4a544-a3ba-4c54-b5c4-de162356275a","resolution":{"observed_at":"2026-08-06T16:30:34.468225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05663","last_updated":"2023-07-11T17:57:40Z","snapshot_observed_at":"2026-08-17T00:31:15.553571Z","submitted_at":"2023-07-11T17:57:40Z","title":"Objaverse-XL: A Universe of 10M+ 3D Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05663","snapshot_observed_at":"2026-08-06T16:30:34.473031Z","title":"Objaverse-xl: A universe of 10m+ 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.473031Z"},"links":{"cited_paper":"/paper/2307.05663","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:b17be5496888fe5c2d3e8d9f5a5a4680232f2ed67f59639dd10cb684d03b5c97","observation_id":"07c93530-0bef-4680-9950-d5a12ea4c3b3","resolution":{"observed_at":"2026-08-06T16:30:34.473031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.478269Z","title":"4d-rotor gaussian splatting: towards efficient novel view synthesis for dynamic scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.478269Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:6a3522029fa62b0d4543150100e60280e6f536fa856c4b2bfaa6abde16be02e1","observation_id":"3c9e237d-1edb-4b47-b239-9cba292a755c","resolution":{"observed_at":"2026-08-06T16:30:34.478269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.482394Z","title":"Fast dynamic radiance fields with time-aware neural vox- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.482394Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:f57cc885daed9ae8fb920a0c31b6e8dbcf6c7b77289db687fa6174be549bfcde","observation_id":"63044d39-968e-4b00-8c94-4cb1d275358f","resolution":{"observed_at":"2026-08-06T16:30:34.482394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.486116Z","title":"K-planes: Explicit radiance fields in space, time, and appearance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.486116Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a77bea9dd106fc3c99cf1d140ad45167a9d8f37205c4f01a8bf28a4a374de6b9","observation_id":"ebab4608-131e-46c1-b912-45a500bcd16f","resolution":{"observed_at":"2026-08-06T16:30:34.486116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.698663Z","title":"Massively parallel multiview stereopsis by surface normal diffusion","venue":null,"work_id":"dde953c9-711c-49bd-844a-79e9e96c0164","year":2015},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.489747Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:14b8b6188d2e050722ff55622876485aaac6e0f2b6bfc23d5d4cc9873253b719","observation_id":"412dcaad-27c0-451c-ae6d-b8eb5798775e","resolution":{"observed_at":"2026-08-06T16:30:35.702801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.687852Z","title":"Srinivasan, Jonathan T","venue":null,"work_id":"79614307-59e2-4fee-b933-d8e28c6e9bba","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.493299Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:396ab004f277619d2b7e63ef5e86ddd8076753d63717c242bfc3028a861ab8da","observation_id":"e5a64fc4-8fd2-41f3-b092-fa094ce8fcc8","resolution":{"observed_at":"2026-08-06T16:30:35.691475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.675886Z","title":"Studio production system for dynamic 3d con- tent","venue":null,"work_id":"654a7cff-5417-4619-8736-43ca81ac98d5","year":2003},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.497112Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:416c972c910d8274193be4841ab1e32a7a463c906f0b5496a92236d221f7b418","observation_id":"7398098b-d54f-40be-98ac-d56d3e690634","resolution":{"observed_at":"2026-08-06T16:30:35.680019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.500818Z","title":"Viewdiff: 3d-consistent image generation with text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.500818Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:edf158034a8e05833fc9db855521e07ba17fe119a181b1a6789f0b51c3856173","observation_id":"4a3206aa-25ad-4a9d-ba32-0d9fee30c9bf","resolution":{"observed_at":"2026-08-06T16:30:34.500818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-06T16:30:34.505019Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.505019Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a1ca8d0a892ed3602fab636748f721f80cd66fb76d795e1663ef0da2a0294340","observation_id":"9ce25f9d-15f4-4aab-a6a4-28439adf213a","resolution":{"observed_at":"2026-08-06T16:30:34.505019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.651249Z","title":"Gauhuman: Articulated gaus- sian splatting from monocular human videos","venue":null,"work_id":"727b7a62-4a2a-4d8d-8cc4-2da5b527490b","year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.509099Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:e3d95a6f696bff792a433d368565077bc2920bd66b3a85f7607329a430c2aed1","observation_id":"c42cf2d4-c328-43b1-b609-b938e70a2715","resolution":{"observed_at":"2026-08-06T16:30:35.658452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.637117Z","title":"Humanrf: High-fidelity neural radiance fields for humans in motion","venue":null,"work_id":"9f7b76d8-c3d3-44cc-830c-8a0a60c745c6","year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.513178Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:416d60d239cb1109dee2e9c0c8428cac162b7be6c7caa2031658b9c2afa5d415","observation_id":"82d4f14e-363a-4454-b731-3c1f90dfd63c","resolution":{"observed_at":"2026-08-06T16:30:35.641401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.623760Z","title":"Pl ¨ucker coordinates for lines in the space.Prob- lem Solver Techniques for Applied Computer Science, Com- S-477/577 Course Handout, 3, 2020","venue":null,"work_id":"e55a8549-3c40-4bfe-86a6-93e52d3ad8a7","year":2020},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.517297Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:4335d1123e3af00164f416104bfb2d3f670e7ea82a9619c3e567dba1547d9752","observation_id":"c329a7ff-e1fd-4c29-91fd-4d5bde5f8707","resolution":{"observed_at":"2026-08-06T16:30:35.628383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.612162Z","title":"Virtualized reality: Constructing virtual worlds from real scenes","venue":null,"work_id":"d020472f-bb98-46c9-91cb-c835eeedd0a6","year":1997},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.521154Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:97dd51f8b3f2b840cc79e6c31699f265fdd0b015a7cc593a9f965d8aa153cc82","observation_id":"c1115a64-0404-4544-b732-75954c1545f3","resolution":{"observed_at":"2026-08-06T16:30:35.616211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.599589Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"eaf9f4ce-5b18-4b3b-aa28-baa564e53b9e","year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.524599Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:5cfe542644e10758243dbb676d1e3fef726905dc8b6e9a867805cb23f77ca1b7","observation_id":"819f7afa-a1b7-40c0-b24d-b68a3d82104b","resolution":{"observed_at":"2026-08-06T16:30:35.603769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12569","last_updated":"2024-08-27T02:31:42Z","snapshot_observed_at":"2026-08-18T14:59:58.697879Z","submitted_at":"2024-08-22T17:37:27Z","title":"Sapiens: Foundation for Human Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12569","snapshot_observed_at":"2026-08-06T16:30:34.528734Z","title":"Sapiens: Foundation for human vision mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.528734Z"},"links":{"cited_paper":"/paper/2408.12569","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:043c8e141dfb98dd50a8a511f9a8f953c59f541a248a427054f8efa903f9223d","observation_id":"6ef0743c-0968-4fe6-b29d-cadef456ac28","resolution":{"observed_at":"2026-08-06T16:30:34.528734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T16:30:34.532489Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.532489Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:c4a364f71003d7917c6f5063cf8f5f679f9fb7e1cb7e2ba9c8b7b8d5612c9c94","observation_id":"00ad95cc-d284-4256-8955-d3ed759e87b9","resolution":{"observed_at":"2026-08-06T16:30:34.532489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T16:30:34.536274Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.536274Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:f5934cdfe603bf88c270b2bb0f6d59666716479a692dbf3c1e08d3f0f23dc86b","observation_id":"6e6b6568-9bab-4190-9aec-bc1f1ead95c3","resolution":{"observed_at":"2026-08-06T16:30:34.536274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.586326Z","title":"A theory of shape by space carving","venue":null,"work_id":"31f031e5-95ba-4cf6-beac-9ef64c9a4bcd","year":2000},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.540369Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:4ec9ec86b88c4de3c8d893758bc7fe54ab9687319578ed7a7c9c7609d91f0807","observation_id":"770f6a6c-308c-4c7a-973c-45dc1bdeb87a","resolution":{"observed_at":"2026-08-06T16:30:35.590851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.573081Z","title":"Vivid-zoo: Multi-view video generation with diffusion model.Advances in Neural Information Processing Systems, 37:62189–62222,","venue":null,"work_id":"d285296c-dde9-48a3-be05-92c7c6c9e495","year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.543908Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:9c82996eabbc6a7ff7622eb1e59478ec66a377e617512646f9c67afd4a58c4cd","observation_id":"aa7ce023-2622-481b-b80b-4f6d67963812","resolution":{"observed_at":"2026-08-06T16:30:35.577477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.547337Z","title":"Neural 3d video synthesis from multi-view video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.547337Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:07fc18ba22ec173645bb9cfbf6ddd322051df85342ab438a3fa98c62b5b3ae88","observation_id":"29b26c72-bd8d-49b8-b107-93cf2560d301","resolution":{"observed_at":"2026-08-06T16:30:34.547337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.553447Z","title":"Ani- matable gaussians: Learning pose-dependent gaussian maps for high-fidelity human avatar modeling","venue":null,"work_id":"cea5f88c-c6b3-4aa4-afde-0bd1b356204c","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.551854Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:15dc9429d178fb60844bfb0a9a509c658d09ec92955193da75b7a52b361bd578","observation_id":"84bb4f8a-9083-4fc6-87f4-9c849252f5c4","resolution":{"observed_at":"2026-08-06T16:30:35.557675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.541893Z","title":"Efficient neural radiance fields for interactive free-viewpoint video","venue":null,"work_id":"4b521a80-0732-40bf-a14c-60139cf8235a","year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.555847Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:307e718ceb7e2230f6f50267d208738070ce405fc274a13a4c4ec9b4e295d337","observation_id":"cd2ac44b-3338-4bf8-ae12-f587abed1008","resolution":{"observed_at":"2026-08-06T16:30:35.545973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.530661Z","title":"Real-time high-resolution background matting","venue":null,"work_id":"c6a082e6-2ed1-4656-91d5-5d709b645820","year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.560525Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:813d53162924b736d1b5388e2768efbb5c642e7abf46df9c0e48b498a6c45d44","observation_id":"7df6b6d9-b38f-4d19-bda8-baf082d481d9","resolution":{"observed_at":"2026-08-06T16:30:35.534476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.564842Z","title":"Raft-stereo: Multilevel recurrent field transforms for stereo matching","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.564842Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:aa872c06f7a6aa7707aa826ae1c3584b88126d4c8f09a07e780be018350a06fe","observation_id":"4e1b59c8-bc22-4328-8b9e-4d310fc6d246","resolution":{"observed_at":"2026-08-06T16:30:34.564842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.510635Z","title":"Zero-1-to-3: Zero-shot one image to 3d object, 2023","venue":null,"work_id":"ae262e24-a1a0-44df-b031-97a2a80e5d27","year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.569260Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:05b50dfc8c2d140009b2aaadc4cfb4f12e119c7c8439e69bfa2bb02abe1e455d","observation_id":"eca86fea-97ca-430e-a778-5bd85a7cc633","resolution":{"observed_at":"2026-08-06T16:30:35.514838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.497236Z","title":"Mvsgaussian: Fast generalizable gaussian splatting recon- struction from multi-view stereo","venue":null,"work_id":"7923cc36-0672-4a50-8199-f17857de6ece","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.574009Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:99bb9496c5f41b644bea1998cf7a2a2f1fdeeb65f1bd34e37dd9096fd1df4a98","observation_id":"ca18d8f5-57fc-4cae-a43b-475f194e0e6e","resolution":{"observed_at":"2026-08-06T16:30:35.502262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-08-12T22:52:54.817720Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-08-06T16:30:34.578276Z","title":"Syncdreamer: Gen- erating multiview-consistent images from a single-view im- age","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.578276Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:79a18698ffa1237234e3a57939fea963a9da4e2f32c41ec96b7ee79547f27d40","observation_id":"b85b8ff9-775d-4be5-a5dc-5a943bc29cae","resolution":{"observed_at":"2026-08-06T16:30:34.578276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.582315Z","title":"Smpl: A skinned multi- person linear model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.582315Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:14a595f91899edc792174ee82c3e88e792a19592b06aa2b7613c03dbd4c23966","observation_id":"6df977f3-65a2-4882-9929-0db30d540cd6","resolution":{"observed_at":"2026-08-06T16:30:34.582315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00927","last_updated":"2022-10-13T12:04:36Z","snapshot_observed_at":"2026-08-20T12:54:48.114323Z","submitted_at":"2022-06-02T08:43:16Z","title":"DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00927","snapshot_observed_at":"2026-08-06T16:30:34.586204Z","title":"Dpm-solver: A fast ode solver for diffu- sion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.586204Z"},"links":{"cited_paper":"/paper/2206.00927","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:2f94169eb43ff5d9febf489b9d1fb26120af7e763261a8c90bff419b3407f657","observation_id":"6df2aee7-a11a-408d-86ed-6d762fd7be18","resolution":{"observed_at":"2026-08-06T16:30:34.586204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.590395Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.590395Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:2ca24313f822b546be986e7f9a7d34da23c8b6d411a4615e188913a5afa23e65","observation_id":"3da23ece-d28f-44a0-b728-6337a9acfe48","resolution":{"observed_at":"2026-08-06T16:30:34.590395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.471051Z","title":"Dynamicfusion: Reconstruction and tracking of non-rigid scenes in real-time","venue":null,"work_id":"cc929fa2-0579-4b9b-8d63-75604cb727df","year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.594323Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:9ece87f0ad4bd0c13b9b4353aae023ee8b2a1c47a599b4a80cb6079ccf1b0906","observation_id":"e8523673-e024-4775-b9a8-779c17c5f045","resolution":{"observed_at":"2026-08-06T16:30:35.475108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.598925Z","title":"Effi- cient4d: Fast dynamic 3d object generation from a single- view video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.598925Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:32f3c5f90fb94b99cedb18f33c49875b8adfe21340bac8bb99105c2be5947176","observation_id":"d8eee92d-9d03-4e63-8bf0-ac7a052f6fc8","resolution":{"observed_at":"2026-08-06T16:30:34.598925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.602436Z","title":"Barron, Sofien Bouaziz, Dan B Goldman, Steven M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.602436Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:fd639859496d227da3204c887d4f6ba82a386f398090a4343418cf551e81c2ae","observation_id":"2b4724ea-e076-402b-a305-ebb61c952642","resolution":{"observed_at":"2026-08-06T16:30:34.602436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.452086Z","title":"Barron, Sofien Bouaziz, Dan B Goldman, Ricardo Martin- Brualla, and Steven M","venue":null,"work_id":"4740375e-5aa7-4f9e-9de5-2b0a05b53e69","year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.605845Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a694edfa41a7ba69f98a25f5fc1101f0a8dd043adfb1d4fa81344960428f9ac3","observation_id":"fbe7732f-c675-4c74-ba8d-535217bf7715","resolution":{"observed_at":"2026-08-06T16:30:35.456265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.440174Z","title":"Ani- matable neural radiance fields for modeling dynamic human bodies","venue":null,"work_id":"6b7c2a4d-04d7-4a48-8df8-9ade1daf5ec4","year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.609625Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:c182ad6dbd76e878e011acdd17afe4b94bc171101cd4ecf888927bbd5cf088c9","observation_id":"0d08a2b5-a4f7-48c2-9398-b13573a35f82","resolution":{"observed_at":"2026-08-06T16:30:35.444141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.613234Z","title":"Neural body: Implicit neural representations with structured latent codes for novel view synthesis of dynamic humans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.613234Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:fd42bad2301df09c96fc9211ec53935de815a853252f6bca239d0656bd14ed43","observation_id":"da7146fd-6d79-4243-85e4-db4e97ea0cba","resolution":{"observed_at":"2026-08-06T16:30:34.613234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-06T16:30:34.616681Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.616681Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:ec1d8c133e65e65afee8483e7fb4b43c3d984bc0531b465e459160c00c935076","observation_id":"d75891c5-45a7-4007-b204-f625daac911a","resolution":{"observed_at":"2026-08-06T16:30:34.616681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.419248Z","title":"D-NeRF: Neural Radiance Fields for Dynamic Scenes","venue":null,"work_id":"a4a8b3b9-8bc4-4daf-9ac4-f73473c48677","year":2020},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.620537Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:41f3572de80ffa9631e0d2526a0cd9846c565f9779883708c27242e4798ace40","observation_id":"6c6535d4-9fcf-44f8-896c-5510a5e0cb09","resolution":{"observed_at":"2026-08-06T16:30:35.424968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17142","last_updated":"2024-06-10T14:07:53Z","snapshot_observed_at":"2026-08-21T19:53:44.541045Z","submitted_at":"2023-12-28T17:16:44Z","title":"DreamGaussian4D: Generative 4D Gaussian Splatting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17142","snapshot_observed_at":"2026-08-06T16:30:34.624666Z","title":"Dreamgaussian4d: Genera- tive 4d gaussian splatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.624666Z"},"links":{"cited_paper":"/paper/2312.17142","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1e3d46b4966b0aaf264ff622b9f9c72fe91ebca75f53216ea727c5a4f4cb5e87","observation_id":"d88181dc-54f9-44c7-ba87-cac7c5bec71f","resolution":{"observed_at":"2026-08-06T16:30:34.624666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.405387Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"dcf17365-5de7-464c-9e42-e7ab3fb187cf","year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.628519Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:acd854014e5652c29b65883b814e921c6401fb81b0742a1433054f806320fa9f","observation_id":"6fb2c1b8-9158-42b5-873e-d34c29d1f12b","resolution":{"observed_at":"2026-08-06T16:30:35.410653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.393682Z","title":"Structure-from-motion revisited","venue":null,"work_id":"5ef08dce-df54-4b92-b3ba-ca6ed4e2f2a8","year":2016},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.632269Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:dfa9d94809469fc4b89412b6d0269b3013c5ed405c8f99cfa47ef0f5d3352804","observation_id":"7c2900e9-3051-4dd5-8801-8eeac70d29f8","resolution":{"observed_at":"2026-08-06T16:30:35.397435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.382427Z","title":"Pixelwise view selection for un- structured multi-view stereo","venue":null,"work_id":"3a02c82c-296c-4eaa-a589-f1ce9f2ad5be","year":2016},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.636478Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:fb6fbdcff88302618edcaefeabf93d3c14f334b4749cbb34705a33e0c91ffb04","observation_id":"85467ce6-6700-4754-a610-6ba810eae861","resolution":{"observed_at":"2026-08-06T16:30:35.386295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.640007Z","title":"Tensor4d: Efficient neural 4d decomposition for high-fidelity dynamic reconstruction and rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.640007Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:32726d9d8dd42ce2003507193dc466191b332c7c7f9a23519bd64c0cdf2cc392","observation_id":"109f7b72-5c41-49ff-8fed-6b6d6dc0bb7f","resolution":{"observed_at":"2026-08-06T16:30:34.640007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.362595Z","title":"Rapid avatar capture and simulation using commodity depth sensors","venue":null,"work_id":"ba375ba9-2e44-48fc-a049-6ccb05ff2e12","year":2014},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.643880Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:9a6abe3079764437b5843a3ef0f3faabbcc6434cf9070e8c3ca50800a4319961","observation_id":"36f7a853-d23e-4e47-96e4-e7f94e51d0c4","resolution":{"observed_at":"2026-08-06T16:30:35.367216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-08-17T23:11:03.362702Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-08-06T16:30:34.647825Z","title":"Mvdream: Multi-view diffusion for 3d gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.647825Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a18aa877c071191a6da3a7c2825d55672aa2cfda5f347f92befb3f1150e6e46f","observation_id":"c8afb796-2adf-4e6a-8e56-566a988e6d4c","resolution":{"observed_at":"2026-08-06T16:30:34.647825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11280","last_updated":"2023-01-26T18:14:32Z","snapshot_observed_at":"2026-08-18T04:43:05.718051Z","submitted_at":"2023-01-26T18:14:32Z","title":"Text-To-4D Dynamic Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11280","snapshot_observed_at":"2026-08-06T16:30:34.652426Z","title":"Text-to-4d dy- namic scene generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.652426Z"},"links":{"cited_paper":"/paper/2301.11280","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:db511fa8b855fc7eb34b3c894256de0ceca4af6554764d900e5ab0c3501ca030","observation_id":"d67ffa65-560f-45f4-8755-0c07a3b4cf69","resolution":{"observed_at":"2026-08-06T16:30:34.652426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.351061Z","title":"Virtual view synthesis of people from multiple view video sequences","venue":null,"work_id":"4a304c29-9c2e-4df5-95db-19ff959e9241","year":2005},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.656745Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:91a4152db50670b3af8e440eed496e21b5891e1e1131456441d9b08520b772c3","observation_id":"e81720c4-0c83-4348-a42b-d4935844e092","resolution":{"observed_at":"2026-08-06T16:30:35.355417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.340289Z","title":"Surface capture for performance-based animation","venue":null,"work_id":"c4083632-a68a-4d38-bd98-3cba9f6078a7","year":2007},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.660850Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:cf2ba3897601054701433fafc58d6bc535ab180b228f968893023825c2ef0da0","observation_id":"5c534f71-c523-48a8-a77a-d6b5d7159a72","resolution":{"observed_at":"2026-08-06T16:30:35.343986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.329259Z","title":"Scanning 3d full human bodies using kinects","venue":null,"work_id":"7f7aea4d-cce3-4355-b6cd-74e66432a686","year":2012},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.664462Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:0a06d93e8e026b9f5d9d78bedf386179d6dfd7fa24abb05c22abcc92bb9611f5","observation_id":"fb674737-27b8-4ded-ae19-96bf00061333","resolution":{"observed_at":"2026-08-06T16:30:35.332853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.668115Z","title":"Diffusers: State-of-the-art diffu- sion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.668115Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:db44ca47404f3118903d065e9c7702fde660312ebaf8f4f39cfb6eece6d26c75","observation_id":"37ba4bb2-3918-4330-87f1-b3a0e036720c","resolution":{"observed_at":"2026-08-06T16:30:34.668115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.309047Z","title":"Fourier plenoctrees for dynamic radiance field ren- dering in real-time","venue":null,"work_id":"0745447d-b9b2-4cc1-b355-e0395b6660e8","year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.672266Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:4ece7f730b328a4cef80e6fb3cc5325234992d7166daea6dda0fd0a694129a71","observation_id":"34eab7ac-c5f1-4ba1-99f3-005bee505737","resolution":{"observed_at":"2026-08-06T16:30:35.312840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02201","last_updated":"2023-12-02T20:41:27Z","snapshot_observed_at":"2026-08-18T09:35:49.318861Z","submitted_at":"2023-12-02T20:41:27Z","title":"ImageDream: Image-Prompt Multi-view Diffusion for 3D Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02201","snapshot_observed_at":"2026-08-06T16:30:34.675972Z","title":"Imagedream: Image-prompt multi-view diffusion for 3d generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.675972Z"},"links":{"cited_paper":"/paper/2312.02201","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:5102a7e145cbf388a1e3feb05320399262663b4d30b5511a033434d75a8121ba","observation_id":"adc958c2-78f9-4542-8d6a-645e4139ff0d","resolution":{"observed_at":"2026-08-06T16:30:34.675972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07860","last_updated":"2025-04-20T04:48:38Z","snapshot_observed_at":"2026-08-20T02:19:06.174502Z","submitted_at":"2024-07-10T17:23:33Z","title":"Controlling Space and Time with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07860","snapshot_observed_at":"2026-08-06T16:30:34.679622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.679622Z"},"links":{"cited_paper":"/paper/2407.07860","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:d69e8cadeac46a7927e05cca5e9014a3ef33310c0b538f127ab1f245fc194fd7","observation_id":"59f7878a-1b95-44ba-a5b8-a5049e69896e","resolution":{"observed_at":"2026-08-06T16:30:34.679622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.683825Z","title":"Hu- mannerf: Free-viewpoint rendering of moving people from monocular video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.683825Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:85895249904353c664d234d61790af20e68f62fe9098eb2eea33ab7499660304","observation_id":"bc604099-22a5-4753-8bc1-3224b8a45be5","resolution":{"observed_at":"2026-08-06T16:30:34.683825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.290852Z","title":"4d gaussian splatting for real-time dynamic scene render- ing","venue":null,"work_id":"44961403-7e88-4404-8aae-16215d1d07b4","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.688073Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:ca971be007f25935d3a0ff24616799aa089cbfe1a7c6e1084a6bba39905a2635","observation_id":"08c4c103-43fd-4a18-884c-7c2d26f98bb0","resolution":{"observed_at":"2026-08-06T16:30:35.294926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18613","last_updated":"2024-12-18T21:21:07Z","snapshot_observed_at":"2026-08-20T08:18:02.465597Z","submitted_at":"2024-11-27T18:57:16Z","title":"CAT4D: Create Anything in 4D with Multi-View Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18613","snapshot_observed_at":"2026-08-06T16:30:34.692191Z","title":"Barron, and Aleksander Holynski","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.692191Z"},"links":{"cited_paper":"/paper/2411.18613","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1d9de36da2d46cfe5801823d9db2969e63c0f64c1fbb0f3fc181e8c9950d8e56","observation_id":"791357f3-5e62-4e85-b0e5-dd097bf68ffb","resolution":{"observed_at":"2026-08-06T16:30:34.692191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17470","last_updated":"2025-02-27T21:52:39Z","snapshot_observed_at":"2026-08-18T18:18:22.721632Z","submitted_at":"2024-07-24T17:59:43Z","title":"SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View Consistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17470","snapshot_observed_at":"2026-08-06T16:30:34.696845Z","title":"Sv4d: Dynamic 3d content generation with multi-frame and multi-view consistency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.696845Z"},"links":{"cited_paper":"/paper/2407.17470","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:d7ccc5679ce4a3553dcd8d065c4c0ed1d62af5ef1e663c45a27ed9a52b36b4a6","observation_id":"185d1a01-d5b7-4354-a110-2222020e9d07","resolution":{"observed_at":"2026-08-06T16:30:34.696845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.279936Z","title":"Easyvolcap: Accelerating neural volumetric video research","venue":null,"work_id":"a7a60c55-9370-4cca-8c65-95c2747edd3d","year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.700951Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:bc534ef06ad58366f51581faf53b7ed7ba230834c7ffd85eca51cae0a9a7eb7a","observation_id":"39c07d01-d3e0-4685-b97b-b45c7187bd69","resolution":{"observed_at":"2026-08-06T16:30:35.283732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.704528Z","title":"Relightable and animatable neural avatar from sparse-view video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.704528Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:aefd812ac7dd18db477b308c65f969724754dc2813af5bb2fc337683dcb6175b","observation_id":"a70031ba-c695-4a77-9dfc-fa5e4c2d674a","resolution":{"observed_at":"2026-08-06T16:30:34.704528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.260433Z","title":"4k4d: Real-time 4d view synthesis at 4k resolution","venue":null,"work_id":"39915b6d-75c9-4415-af50-8efcf9a95fb9","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.708737Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1f8e10bc5368bf714cdfffe40bed95688b90049dac71c6c4e6be5d39c68d4e61","observation_id":"3a52ecad-f94e-4650-b2d9-c9b2d96a5b26","resolution":{"observed_at":"2026-08-06T16:30:35.264293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.248532Z","title":"Representing long volumet- ric video with temporal gaussian hierarchy","venue":null,"work_id":"9f00eb81-ff0a-42c6-a6a7-273c8588414b","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.712365Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1a96887fb41491c3cfe0b4929be76ee6ad30f158e261093756dec8db5a529c5e","observation_id":"b428c9b2-58f8-413f-9c12-45a569c91d1e","resolution":{"observed_at":"2026-08-06T16:30:35.252346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.235936Z","title":"Diffusion2: Dynamic 3d content generation via score composition of orthogonal diffusion models","venue":null,"work_id":"4620609d-3c77-42a7-846d-2065d5719f21","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.715946Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1632dd032894a59e33b108bc816ab1939e1873aec073ab00bfb5155487130750","observation_id":"eb6042ec-0c17-4911-83d9-1702e3ca5368","resolution":{"observed_at":"2026-08-06T16:30:35.240943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T16:30:34.720259Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.720259Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:5e5fe4fd8e8da20881dcf649eb0fafcc13a1295096c5ddb5ae48c7bc0b2b4d26","observation_id":"185457a4-e58a-42e4-8b12-9ab04db6eff9","resolution":{"observed_at":"2026-08-06T16:30:34.720259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.221485Z","title":"Real- time photorealistic dynamic scene representation and render- ing with 4d gaussian splatting","venue":null,"work_id":"f2de2d5d-e196-437c-bb18-99bb27d3e975","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.725313Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:beab0d755fc2980ef296f96904516ec4ab9985092879bcc62a8c333c9093004f","observation_id":"4ed2c0d3-3c54-404f-bce2-82d27be50d6f","resolution":{"observed_at":"2026-08-06T16:30:35.226367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.208364Z","title":"Mvsnet: Depth inference for unstructured multi-view stereo","venue":null,"work_id":"2ad741d7-0bdb-4628-b57d-befbc60fff0e","year":2018},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.728762Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:bdf9e046c95dfe3a9ab50a0191478f0bb2857f9268436b69df2494867dfcd106","observation_id":"68e6eebc-89f4-4db3-a0b3-ed439169d524","resolution":{"observed_at":"2026-08-06T16:30:35.212285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.195389Z","title":"Recurrent mvsnet for high-resolution multi-view stereo depth inference","venue":null,"work_id":"91f08f23-1dde-48f4-9f53-bd6adeb4d8bb","year":2019},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.732702Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:105d4d679dc7116f55fb08d7744159dd12da981e32089d68adfb79e9cd5bfb0c","observation_id":"3c1f007c-f168-4c06-9255-ed07bb53c4fd","resolution":{"observed_at":"2026-08-06T16:30:35.200000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17225","last_updated":"2024-12-04T06:11:50Z","snapshot_observed_at":"2026-08-20T03:31:46.218615Z","submitted_at":"2023-12-28T18:53:39Z","title":"4DGen: Grounded 4D Content Generation with Spatial-temporal Consistency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17225","snapshot_observed_at":"2026-08-06T16:30:34.736671Z","title":"4dgen: Grounded 4d content gen- eration with spatial-temporal consistency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.736671Z"},"links":{"cited_paper":"/paper/2312.17225","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:bcba72b7397045f0e79157161f35d6a0701ae93b6e8b84c4d8852d7ecb1ad2c0","observation_id":"88bc8735-bdfe-495f-9fb7-1a061878c8eb","resolution":{"observed_at":"2026-08-06T16:30:34.736671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.184237Z","title":"Stag4d: Spatial-temporal anchored generative 4d gaussians","venue":null,"work_id":"291722c7-ade9-4ffe-bce6-cafa13896b0e","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.741102Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:5957685a6f6bd71060c9f2eeeb12a026a128ebb525e8d173688637da9f067192","observation_id":"3ddff97b-ce40-4da3-a71a-cb32d626f213","resolution":{"observed_at":"2026-08-06T16:30:35.188208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.171541Z","title":"4diffusion: Multi-view video dif- fusion model for 4d generation","venue":null,"work_id":"68eae4af-55a4-4502-a81c-863e5d5a2554","year":2025},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.745262Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:d25b38d02e8aba4b0913ff52cc9b239e4ec3f7bfca4b1e62b9d39fd16cb032ff","observation_id":"e2d7be86-4861-458a-85c0-c2dde556a466","resolution":{"observed_at":"2026-08-06T16:30:35.175996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14817","last_updated":"2024-04-04T16:27:06Z","snapshot_observed_at":"2026-08-16T14:16:07.149885Z","submitted_at":"2024-02-22T18:59:56Z","title":"Cameras as Rays: Pose Estimation via Ray Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14817","snapshot_observed_at":"2026-08-06T16:30:34.749251Z","title":"Cameras as rays: Pose estimation via ray diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.749251Z"},"links":{"cited_paper":"/paper/2402.14817","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a9f0f33e2fe8b6c1b35d9c62f61aa6f992d9df8300e33003fd34f979226c902e","observation_id":"61ec5bc2-708c-44ce-b4ce-4c3fa398894a","resolution":{"observed_at":"2026-08-06T16:30:34.749251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14603","last_updated":"2024-02-19T02:30:14Z","snapshot_observed_at":"2026-08-16T14:40:36.338308Z","submitted_at":"2023-11-24T16:47:05Z","title":"Animate124: Animating One Image to 4D Dynamic Scene","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14603","snapshot_observed_at":"2026-08-06T16:30:34.753710Z","title":"Animate124: Animating one im- age to 4d dynamic scene","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.753710Z"},"links":{"cited_paper":"/paper/2311.14603","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a399a0c2ec3d1c77f3e597dcd1d365fcc954e0d1bc8c31f1c6f56f49fa17f757","observation_id":"f84d5aed-3a19-4720-abed-d554226d3f24","resolution":{"observed_at":"2026-08-06T16:30:34.753710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.757492Z","title":"Bilateral refer- ence for high-resolution dichotomous image segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.757492Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:99b70460cbc2fa181d4f003d7f6c0b1430426496c05a98edfdea9b51645ee900","observation_id":"13578719-044e-47d8-8176-daf2a4d380f8","resolution":{"observed_at":"2026-08-06T16:30:34.757492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.152470Z","title":"Gps- gaussian: Generalizable pixel-wise 3d gaussian splatting for real-time human novel view synthesis","venue":null,"work_id":"45a0d8e2-27f3-48ac-982e-139790b59f3a","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.761142Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:bf3140c3af96b9c24e30ca7dd2f2a90fabaf9240f31da17338b5cad8f1229d32","observation_id":"3231362c-a61f-4779-aab8-491d4ca0f60e","resolution":{"observed_at":"2026-08-06T16:30:35.156419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.135024Z","title":"A unified approach for text- and image-guided 4d scene generation","venue":null,"work_id":"6c8b5e34-4fc2-4fab-98d3-7dd2cc45cbf9","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.764898Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:eb13c3765cac6c2bf0a01e89c249b7757b38c218bd194d81d241603087fb66ed","observation_id":"57c8a991-f2bd-4308-b0ac-7061bb2d9260","resolution":{"observed_at":"2026-08-06T16:30:35.140720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T06:10:19.461579Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 2 inbound Pith citation observations for arXiv:2507.13344."}