{"as_of":"2026-08-10T06:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e04d298c447408c9ac02ead573233e40c2af7946b3905657ec898dfbc5262c49","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:59:28.175667Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T21:59:43.755956Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T14:21:06.813117Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"cited_work":{"arxiv_id":"2505.23085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23085","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geoman: Temporally consistent human geometry estimation using image-to-video diffusion.arXiv preprint arXiv:2505.23085, 2025a","venue":null,"work_id":"1e60b36d-f798-4bd5-8489-bb4901cb1b3d","year":null},"citing_paper":{"arxiv_id":"2604.21681","last_updated":"2026-04-23T13:45:32Z","snapshot_observed_at":"2026-08-01T17:21:19.902700Z","submitted_at":"2026-04-23T13:45:32Z","title":"Sapiens2","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T21:59:43.755956Z"},"links":{"cited_paper":"/paper/2505.23085","citing_paper":"/paper/2604.21681"},"observation_digest":"sha256:b60a166e61fbe19039b9b096608a4f93e6bd48337750593bb5ec48512fac7644","observation_id":"e42001aa-f210-455b-b801-30b8bb9a1ca1","resolution":{"observed_at":"2026-05-11T14:21:06.816106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23085/citation-record","integrity":"/paper/2505.23085/integrity","json":"/paper/2505.23085/citation-record.json","paper":"/paper/2505.23085"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:39.718584Z","title":"Photorealistic monocular 3d reconstruction of humans wear- ing clothing","venue":null,"work_id":"f67cd510-295e-4fb8-9f9a-492473f91c32","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:20.930873Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:1addb3cca757c618aa0ba9af31bb7611b34f80cb301673f0827164eea176c2b7","observation_id":"49941d42-b991-47f8-8fde-a70a8c25d5a9","resolution":{"observed_at":"2026-08-07T12:59:39.780982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-08T15:14:24.281572Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-07T12:59:20.994210Z","title":"Lumiere: A space- time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:20.994210Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:0de3ba54a7aa1621247a66bb6fd0e103cbb8a4629840b121bab7bfa46dd7ac6d","observation_id":"367974e2-3c0b-494b-9592-b44c88e3edad","resolution":{"observed_at":"2026-08-07T12:59:20.994210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-07T12:59:21.107495Z","title":"Zoedepth: Zero-shot trans- fer by combining relative and metric depth","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.107495Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:48227ca77b8f1f536c7bb31972d68f6f1d5c0acb2286ce730033896653ab3144","observation_id":"34b33b62-3e13-48f7-a25c-febeff7487d5","resolution":{"observed_at":"2026-08-07T12:59:21.107495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:59:21.225920Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.225920Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:eb1596b8b4ceee6a9da52f6306251a8fb25c608d6f508059abf8eaa1459e34f1","observation_id":"5eeb489c-94f3-4068-90fd-ef64ce9dc5bb","resolution":{"observed_at":"2026-08-07T12:59:21.225920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-08-07T12:59:21.343777Z","title":"Richter, and Vladlen Koltun","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.343777Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:71f766a4e6c37eb3113f01225ca3bb13094986abf4b8e6772b40355257a5d8db","observation_id":"761a963f-c4dd-4e56-8b3a-b1be18517d16","resolution":{"observed_at":"2026-08-07T12:59:21.343777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:21.482823Z","title":"Video generation models as world simulators,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.482823Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:411c1356fc5cb142824de15bf50facc0bda07c5457889b09da17dcd0d2300e6b","observation_id":"3f355d39-2a11-42f3-af29-3aed37b395c5","resolution":{"observed_at":"2026-08-07T12:59:21.482823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:39.526054Z","title":"High accuracy optical flow estimation based on a theory for warping","venue":null,"work_id":"98fda0fc-8a82-4ef9-add6-65a42946fc29","year":2004},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.585722Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:a2be52967adad0144baa35a97f2a015176fb5468dcc17eff29b793a0c2ce10d1","observation_id":"472d4005-bd5f-4931-80a7-7d08cb53fa49","resolution":{"observed_at":"2026-08-07T12:59:39.611170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:39.367136Z","title":"Stable- video: Text-driven consistency-aware diffusion video edit- ing","venue":null,"work_id":"ca9abb01-6adc-4eb4-ba28-5feb78f299ce","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.742575Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:66f67c0a57a8c87c2bafe800d7d772c2041d1c0bd2b59fddba99b594c58edadd","observation_id":"e60237ce-cecf-49a6-9e0a-a7594c0d0c74","resolution":{"observed_at":"2026-08-07T12:59:39.442026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-07T12:59:21.840777Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.840777Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:dde3ae7a685205495f80588325867c578a5aaa85a6ac0e729fc615659fc78242","observation_id":"b1b1a472-c114-448c-b728-2b231a1625c6","resolution":{"observed_at":"2026-08-07T12:59:21.840777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:39.176402Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"9c502846-279e-4968-8a7f-e7fb371f2978","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.956046Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:6c2fbfb2a141c9f4262daf4d6c637155f897052c62fa61dd8db5ea09edf1104b","observation_id":"f5894e7a-d201-4265-923d-2cb0cc62fd58","resolution":{"observed_at":"2026-08-07T12:59:39.235242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.944953Z","title":"Self-supervised learning with geometric constraints in monocular video: Connecting flow, depth, and camera","venue":null,"work_id":"0ef48b63-bd41-40ee-a4a9-52e51bf5158a","year":2019},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.077547Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:282268994b93d389bb5a10100c54a0b3339043841a016e19d314fea38cbd4235","observation_id":"4671f298-d307-4434-97d0-d02a079fa059","resolution":{"observed_at":"2026-08-07T12:59:39.104114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.716892Z","title":"Cogview2: Faster and better text-to-image generation via hi- erarchical transformers","venue":null,"work_id":"eccb1ea7-2a0d-45e3-bec9-f0fc41e4a8a3","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.208238Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:eb23cb1ffc8ab106e8302bec38ac7f1ccc5d898fbc03946e7d0eff11be59eb05","observation_id":"29448567-24b0-4ad9-8531-348f540a34cc","resolution":{"observed_at":"2026-08-07T12:59:38.826291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.515756Z","title":"Depth map prediction from a single image using a multi-scale deep net- work","venue":null,"work_id":"03aa4a41-35bb-410c-adee-c3c1bef8cbc0","year":2014},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.296951Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:b598daa6a4ca2e3cbe7dda5f664c22e9173afbd9f92f6f9d8269fc51adc9a498","observation_id":"a65020e1-9b5f-4763-be62-1b7958887b6b","resolution":{"observed_at":"2026-08-07T12:59:38.623717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.328135Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"14d59496-467a-4347-82a5-d5ef485cfc0e","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.365317Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:0ed06ad7fb5475506467cd80ed00516ac50e59bf60a807c744117a378a784bcc","observation_id":"330baaba-8581-4169-b767-c241eb71aedc","resolution":{"observed_at":"2026-08-07T12:59:38.389610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.202198Z","title":"GeoWiz- ard: Unleashing the diffusion priors for 3d geometry estima- tion from a single image","venue":null,"work_id":"68b2af7b-cacc-4d6a-8abb-47af9764cf77","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.458937Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:b9a9b07ec4850a43930bbae407e83c1c9745547aff1e55861bac5e73957eef5b","observation_id":"098ae50c-bc3d-4f47-a039-bf1d6b073d83","resolution":{"observed_at":"2026-08-07T12:59:38.252183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.072539Z","title":"Humans in 4D: Re- constructing and tracking humans with transformers","venue":null,"work_id":"12c92907-7069-428d-b570-5594d8675852","year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.597289Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:9ec295cf40611b844ba2aecfb61fab146c69cd9a4acb5672955cfc3c5260101a","observation_id":"a57da66e-926d-49ab-91ad-d91136b814be","resolution":{"observed_at":"2026-08-07T12:59:38.131541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.973847Z","title":"High-fidelity 3d human digitization from single 2k resolution images","venue":null,"work_id":"97d74d94-fab2-487e-a808-b3f2a43e6733","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.692204Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:1f3b291898b6bc6719db690afe7e11b895e223832c45006ea4ed8bdd8a6fa22a","observation_id":"a3564360-2e18-4929-ad3f-7e35594a9d46","resolution":{"observed_at":"2026-08-07T12:59:38.024814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18124","last_updated":"2025-01-18T20:14:54Z","snapshot_observed_at":"2026-08-04T16:50:25.699602Z","submitted_at":"2024-09-26T17:58:55Z","title":"Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18124","snapshot_observed_at":"2026-08-07T12:59:22.779637Z","title":"Lotus: Diffusion-based visual foundation model for high-quality dense prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.779637Z"},"links":{"cited_paper":"/paper/2409.18124","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f35a612d429d22a19a3e3f42c4d187106ecc7c045dae05505d200288ce2d20ee","observation_id":"180f7715-6b33-47ed-a81d-1f40606278b3","resolution":{"observed_at":"2026-08-07T12:59:22.779637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-10T00:51:42.114461Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-07T12:59:22.901882Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.901882Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:07d29cf8dd8836d72325dde253fdfb7d3eecaac9e92d3d059c7dfc03eb8bb9ad","observation_id":"862928a1-904f-4c57-acad-c5d91e36df0f","resolution":{"observed_at":"2026-08-07T12:59:22.901882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.857548Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"b1703107-41f0-4fcf-be27-173e323b4d60","year":2020},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.018296Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f855b9aef30d31cc3f15095b1578bf05cd0ee0ca7011bbf44423ada218132db0","observation_id":"38c55ea5-a2ac-40b3-b5b4-e22544322618","resolution":{"observed_at":"2026-08-07T12:59:37.901721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-08-07T12:59:23.141059Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.141059Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:9c8656ce786b57be7e63f69cba29d769645e6630171632ed6f76bcd499818d80","observation_id":"ff12a275-d4bb-475c-b9d0-8c0273694b09","resolution":{"observed_at":"2026-08-07T12:59:23.141059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.706387Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":"3420bfab-994c-4562-ad3c-2ae16ffa32c6","year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.223405Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:553679e2e66220ebb2fcf671b42649fd2ed3eed9dc335194fc7959fbfc6bf0b4","observation_id":"1d0655c6-1b64-4688-905f-55c08ea4372e","resolution":{"observed_at":"2026-08-07T12:59:37.784968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15506","last_updated":"2025-01-03T15:39:16Z","snapshot_observed_at":"2026-07-06T18:04:42.102581Z","submitted_at":"2024-03-22T02:30:46Z","title":"Metric3Dv2: A Versatile Monocular Geometric Foundation Model for Zero-shot Metric Depth and Surface Normal Estimation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15506","snapshot_observed_at":"2026-08-07T12:59:23.363527Z","title":"Metric3d v2: A versatile monocular geomet- ric foundation model for zero-shot metric depth and surface normal estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.363527Z"},"links":{"cited_paper":"/paper/2404.15506","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:91ec64ff4a3f30b414352ebee0ce2dc421f6915f85cd3b0a14c128171cd6c7ab","observation_id":"4fe6de2f-4a3e-4eff-b9fd-a9a91d1f95da","resolution":{"observed_at":"2026-08-07T12:59:23.363527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-07T23:17:31.541423Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-07T12:59:23.490758Z","title":"DepthCrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.490758Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f3575df5575c9be7877cb67f3668c794d56a731b39e992d598ada55bf3e4cf61","observation_id":"c9d314d8-7044-45ca-a973-8831b2525b77","resolution":{"observed_at":"2026-08-07T12:59:23.490758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.378166Z","title":"ARCH: Animatable reconstruction of clothed humans","venue":null,"work_id":"999f274a-9dfd-458c-8477-9b061855df93","year":2020},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.710031Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:e5ce38b3321124d8207883c9dd5957d5f494cb29aab8148d74dcfa72f3a6057a","observation_id":"5f48e3d9-f51f-44ff-a2c0-eb692f198ae3","resolution":{"observed_at":"2026-08-07T12:59:37.448315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.165187Z","title":"Flowformer: A transformer architecture for optical flow","venue":null,"work_id":"45d1f0f0-6300-4f6f-a064-26be389f5551","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.844526Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:9936842d10de9fd9ba780e9408cbefe40a859244fb78a9abc88145cf764433eb","observation_id":"3ce18d9f-1d23-4551-b295-da670be10b2d","resolution":{"observed_at":"2026-08-07T12:59:37.215736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.031327Z","title":"HumanRF: High-fidelity neural radiance fields for humans in motion","venue":null,"work_id":"1d913206-a5b5-4bd5-b7c9-7fc940adb9d3","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.941445Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:fac416571e18cee10bfb5030e1720ae7946a9ebc1c192560aee69c3d1ec1d3dc","observation_id":"5e3d4528-7f7b-4b23-a769-4f5f35e85eb1","resolution":{"observed_at":"2026-08-07T12:59:37.098110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:36.830044Z","title":"Jafarian and H","venue":null,"work_id":"3ffd5fcf-5d06-4f81-a607-e1aa7d09f142","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.038240Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:3661357486625d78de36d9c25d3250d534cf5e17a1e0f561678d077d70fbbecb","observation_id":"5edd3c3b-c62a-4836-bcb2-b0bc54bc82f6","resolution":{"observed_at":"2026-08-07T12:59:36.950238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:36.629110Z","title":"Learning high fidelity depths of dressed humans by watching social media dance videos","venue":null,"work_id":"fad5a57e-69ea-408f-8570-ef20b4e5a2d1","year":2021},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.158543Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:dda4e67463711dc984fbe1e4bc5533db2f08d1a311f4d57a1451c1b38de80f37","observation_id":"65ad9760-e6e4-4e9b-a895-13947f567f5e","resolution":{"observed_at":"2026-08-07T12:59:36.671335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:36.409442Z","title":"Repurpos- ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":"cf127674-1ebe-413b-b208-a10c094dff4f","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.272479Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f03341e3240842153e7f72876bb43f016677ec4b8a48d4031f2960c2197a93b0","observation_id":"7ef05ac4-86e6-461b-9ca2-c88b95a586d6","resolution":{"observed_at":"2026-08-07T12:59:36.532733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:36.247348Z","title":"Sapiens: Foundation for human vision mod- els","venue":null,"work_id":"39e10713-4bfd-474f-8613-85c5991242ed","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.420233Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:c9daad15dde5e207c442f69bd0d4fd5a2d0494c4f1a80c7a002943ca58ee9b02","observation_id":"1b188c7c-7d3d-441e-a9c9-9d1942134c17","resolution":{"observed_at":"2026-08-07T12:59:36.304940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T12:59:24.519563Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.519563Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:5a29ce7f577494644f1fd34ee69196b61cdddd338129171c700411aadf69d1cc","observation_id":"ddab9752-2070-4210-beda-baa514076afb","resolution":{"observed_at":"2026-08-07T12:59:24.519563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T12:59:24.610161Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.610161Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:dbeeab7f33e9cc8a37f7bc4de7277c547a2bcc63741981dde8fa823851a25cd3","observation_id":"0eacca16-ca2e-49ed-9b1a-b7d76a46f35d","resolution":{"observed_at":"2026-08-07T12:59:24.610161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:36.094746Z","title":"Robust consistent video depth estimation","venue":null,"work_id":"eb8cb5c5-93b5-4f64-8153-0b1615cabfe5","year":2021},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.706712Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:d0b3758ce3c38c8748bfc78007447397d1469d7f7229725d21cb2ab3e48f885a","observation_id":"c02b8bbd-ff08-46f6-8dd8-0878a7f494a1","resolution":{"observed_at":"2026-08-07T12:59:36.168095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09967","last_updated":"2024-05-24T16:29:38Z","snapshot_observed_at":"2026-08-03T19:03:47.269374Z","submitted_at":"2024-04-15T17:45:36Z","title":"Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09967","snapshot_observed_at":"2026-08-07T12:59:24.778818Z","title":"Ctrl- Adapter: An efficient and versatile framework for adapt- ing diverse controls to any diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.778818Z"},"links":{"cited_paper":"/paper/2404.09967","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:6a24bf4db57b6ddde4a8ec12c341082816f2d93342b28d90b79f0bd2efae5969","observation_id":"9156ee3e-aa92-4401-ac86-7428000a56ec","resolution":{"observed_at":"2026-08-07T12:59:24.778818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:35.897193Z","title":null,"venue":null,"work_id":"65cbb9a4-9115-4dbf-8f3d-3777659acb5b","year":2015},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.879018Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:7a564a23d5da11aae889a843826ebd9003ada38385e1e0acc0259c4f4bc8d00f","observation_id":"aca88010-beee-4e50-8f11-1441357d59a2","resolution":{"observed_at":"2026-08-07T12:59:35.989939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:35.667399Z","title":"Consistent video depth estimation.ACM Transactions on Graphics (TOG), 39(4), 2020","venue":null,"work_id":"f8351817-7721-4acb-88ea-2799e325693e","year":2020},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.977142Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:d1180923b32289139e08d18e21b6fc248ffe9b8dee17f1d1691b5d92e479b568","observation_id":"83973606-f072-4174-b1ad-cadb94cd9cb4","resolution":{"observed_at":"2026-08-07T12:59:35.783342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:35.456168Z","title":"Jewett, Simon Ven- shtain, Christopher Heilman, Yueh-Tung Chen, Sidi Fu, Mo- hamed Ezzeldin A","venue":null,"work_id":"523b57f0-7d11-44f2-a75b-974df508cb58","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.067043Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:30b7d6a093883c5c6af9d418cce01f17df76501016a8a147d7b855e65b44656d","observation_id":"cbc13d4e-e859-4ed7-9445-24b28b22e216","resolution":{"observed_at":"2026-08-07T12:59:35.523612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:35.221613Z","title":null,"venue":null,"work_id":"c4865db9-e120-4b97-8a6d-a94386646a4a","year":2019},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.114459Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:27bf4c7cf79f3b93a9ad04b2e9e35d88bddd5060b2ac368fccb567d6d60a1e66","observation_id":"867a13c8-b40c-4a9a-9d4a-e4b41e60cd48","resolution":{"observed_at":"2026-08-07T12:59:35.350523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:35.054047Z","title":"UniDepth: Universal monocular metric depth estimation","venue":null,"work_id":"e3792c90-904c-44b2-adb3-3f089d1e0b69","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.183400Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:335acdf224ab0795b4af69ce1c9f24b6694f859c6c6aeafdc47681ed6a99ba94","observation_id":"d4af9a8c-a7b2-47d6-97dc-f46fcd957eee","resolution":{"observed_at":"2026-08-07T12:59:35.140737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:34.785694Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"6a7bab8e-a3f4-4342-afa6-b714da3b1e57","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.231414Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:e6d6a0372144be4f0166a5c225331476fc9e7908343674634808126cd96a4b4b","observation_id":"2987710d-1973-4166-aa8a-dea10b3e31b0","resolution":{"observed_at":"2026-08-07T12:59:34.925641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T12:59:25.277658Z","title":"Hierarchical text-conditional image gen- eration with clip latents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.277658Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:5a6dc0a22fa8e0c61c1835cf0c163290e3f7a58ff2d21b4529cdcabe70212871","observation_id":"b8fc48b4-11c9-4495-9c15-5f78d9a96f20","resolution":{"observed_at":"2026-08-07T12:59:25.277658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:34.583077Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":"8b341e0a-4e0f-439d-b24c-e3c126f5ac78","year":2020},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.340557Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:75a9ccc7d3c8ce974365d2c05609ef362ea2a580db2aaffa834321adbe134ed3","observation_id":"acec3087-4f57-44b1-b37e-effc5550f785","resolution":{"observed_at":"2026-08-07T12:59:34.651003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:34.445583Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"8ebea2ba-197f-4e42-8eb6-6a6584b805a0","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.393763Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:2a28342f5ac415f311e6894549007e12abb2e8c27bb3a8ceba62c560854b0a52","observation_id":"0ca20f74-3fb0-48dd-81a7-26e57ddd8f05","resolution":{"observed_at":"2026-08-07T12:59:34.524732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:34.223799Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"7fd5c68d-0af0-485e-9376-1de97e58ed04","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.463051Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:aac30e031063230628fce53ed18ffb135a9662ff26291026f88b405cd617d96b","observation_id":"4f78e827-66ea-4b05-8b91-f2a5c145f163","resolution":{"observed_at":"2026-08-07T12:59:34.315839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:34.050836Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"0cf6a2c7-b077-4358-89a7-1fadb40ccbc1","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.530959Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:01210e21ad122527b284a10edf28e03f7a77db424164ac43c2380a49e49744ba","observation_id":"f860c84d-9f30-4a5c-aa7d-1be88a0bd5ae","resolution":{"observed_at":"2026-08-07T12:59:34.127227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:33.866593Z","title":"Pifu: Pixel-aligned implicit function for high-resolution clothed human digitiza- tion","venue":null,"work_id":"9a0f0fda-59a3-4681-8fcd-d03a2bd018a6","year":2019},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.621719Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:e0fc4812187d8b1b64adefcc137ae7109708055d60bee9cf197eb72c2cc0b37b","observation_id":"862d2a01-f574-4b15-a755-2bb648e0e223","resolution":{"observed_at":"2026-08-07T12:59:33.956629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:33.693291Z","title":"Pifuhd: Multi-level pixel-aligned implicit function for high-resolution 3d human digitization","venue":null,"work_id":"88374ff3-1fc0-45ae-a7fb-8c4dfeb63ca0","year":2020},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.680799Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:5b4b5e8f91773e93eb981cc1e456610593b16509bc9b42f796a82f25297a4630","observation_id":"a0017d01-24ec-48c7-a2be-393dbf3feb68","resolution":{"observed_at":"2026-08-07T12:59:33.776720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:33.553252Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":"f4eee1c8-7c48-48f3-bdb1-ab99b3a27161","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.747364Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:afa11bc5378399050bdf730002d6d9b46edfecfd6880dead78ab74d4d8b140e5","observation_id":"88961aa5-be61-49d3-ac5a-ce28397d65a6","resolution":{"observed_at":"2026-08-07T12:59:33.632255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:33.267573Z","title":"X-Avatar: Ex- pressive human avatars","venue":null,"work_id":"165a6917-66b4-4399-b920-9f8863cef432","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.834387Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:84e78dc01d794d5161e3d8016fe2e341f809523d9d2f8be30abcf5e2a6be12a4","observation_id":"98bcd4a8-55b4-47ab-b3eb-8e6b35804c24","resolution":{"observed_at":"2026-08-07T12:59:33.395997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.965022Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"44823b06-e4b5-418e-b67a-d5055c510ce0","year":2015},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.919767Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:5db2a6f8e6a4602757edb963dcc35300d2e960c5db2c1ef2ef6af69f1f6a9fbe","observation_id":"1d8443e4-d83a-4c5a-85bd-205c0c06c2cc","resolution":{"observed_at":"2026-08-07T12:59:33.116872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.711093Z","title":"Diffusers: State-of-the-art diffu- sion models","venue":null,"work_id":"dc84732a-5fd5-4180-8e3a-12d445bc18cc","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.970093Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:31863332c7e4cd41d9f39f0d111adca936ecd36f8b42723a1254d7220712209e","observation_id":"ff0dd391-6b33-425b-a5b4-453ced72beaf","resolution":{"observed_at":"2026-08-07T12:59:32.825490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.452674Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":"7602f4ac-adca-4458-b7fb-a9aaaa1c1e7f","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.032794Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:ed4e68496b000891b193d0737973320b1f02eaac9a685faf0b16044828017bbd","observation_id":"961a342c-79f9-4bc0-a26a-3397d5b7b854","resolution":{"observed_at":"2026-08-07T12:59:32.568013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.136461Z","title":"4D-DRESS: A 4d dataset of real-world human clothing with semantic annotations","venue":null,"work_id":"0e79790c-e784-4808-a25b-a53dc564fa74","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.071652Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:d888048f67c892f0f6087bf146604b39c9b988e92506211018fe85ba4c5dfd6b","observation_id":"58349eb9-8492-4cc6-9e65-5e30617d8781","resolution":{"observed_at":"2026-08-07T12:59:32.308039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04468","last_updated":"2024-01-09T10:12:52Z","snapshot_observed_at":"2026-08-08T21:00:07.723397Z","submitted_at":"2024-01-09T10:12:52Z","title":"MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04468","snapshot_observed_at":"2026-08-07T12:59:26.160150Z","title":"MagicVideo-V2: Multi- stage high-aesthetic video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.160150Z"},"links":{"cited_paper":"/paper/2401.04468","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:6e69b7c7d19c3956a5bd63bf56887f78240c86012bfe1457773cac58ad5aa6df","observation_id":"1fa9faa1-24e3-409a-933b-90eb67cd7ed2","resolution":{"observed_at":"2026-08-07T12:59:26.160150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.892369Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"2759eb3c-b07c-45ac-9b80-79f84e191c9e","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.205797Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:2119e4a69daeaf749ae241b823b50abdd4bc302a6721101127a57be5b8f4928a","observation_id":"be46c9aa-c0a1-438e-86d5-da82c6780477","resolution":{"observed_at":"2026-08-07T12:59:32.016949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.525949Z","title":"Less is more: Consistent video depth estimation with masked frames modeling","venue":null,"work_id":"fc916203-5ed7-4210-af4d-425ff239d759","year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.280443Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:5057989ef3526cba618fa55c0cb1b22db4862cd82b7d352c578632a0d845b668","observation_id":"dfeaf70c-1b4a-4219-b331-b41c37b6b0db","resolution":{"observed_at":"2026-08-07T12:59:31.737807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.352241Z","title":"TRAM: Global trajectory and motion of 3d humans from in- the-wild videos","venue":null,"work_id":"be06d413-89c8-4a16-ac62-5119af255670","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.351944Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f3488efb720fe1a3108dae7634b579d665b17da13f231d6b383d74dca4eb62a6","observation_id":"edd21a6f-b0df-4956-b331-04c9a679840d","resolution":{"observed_at":"2026-08-07T12:59:31.453658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.106326Z","title":"ICON: Implicit clothed humans obtained from nor- mals","venue":null,"work_id":"c4036989-44a2-44cb-8364-67e56d549dde","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.425490Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:d2b0f40f351ecb21df18fb8dd4e3dda053b8ca14b933519c7eb612d105680446","observation_id":"0d9b665b-ae44-48b1-9c76-2fcb8cd12e02","resolution":{"observed_at":"2026-08-07T12:59:31.252652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.932513Z","title":null,"venue":null,"work_id":"50ed33e3-9e82-4852-b9e5-9f56be35dbdd","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.491077Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:158efd72a5b3a32722eafee3e0d00c067c09dd00c3f99d0163cf0c0c823ea8dd","observation_id":"dce71b8a-2f4a-43a4-9806-2ef4bf7cf110","resolution":{"observed_at":"2026-08-07T12:59:31.012696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10815","last_updated":"2025-03-12T09:16:59Z","snapshot_observed_at":"2026-08-02T03:23:18.701055Z","submitted_at":"2024-10-14T17:59:46Z","title":"Depth Any Video with Scalable Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10815","snapshot_observed_at":"2026-08-07T12:59:26.572903Z","title":"Depth any video with scalable synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.572903Z"},"links":{"cited_paper":"/paper/2410.10815","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:e012f3391795a34b3606feef9af9c03fbdf57fd60e12944123a63e9b655e343a","observation_id":"fbfb37ba-2077-416a-9b13-f6c4e8fad643","resolution":{"observed_at":"2026-08-07T12:59:26.572903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.703943Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"8ba3917e-f279-4905-b2be-911a6dd615f7","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.634045Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:aee40b7d2e91481cd9d4c1a622daeb93e6bb6b7425bcc19447c6e751860f29dd","observation_id":"907ed995-7673-44d8-b6c4-7662a0a9e360","resolution":{"observed_at":"2026-08-07T12:59:30.804175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-07T12:59:26.713658Z","title":"Depth any- thing v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.713658Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:20e2072dfcc677d9edc4d40853a0f8c4049c8f20315e8d4d2214f57b18c35de1","observation_id":"2fda88d2-6e6f-482a-ad69-38d26ce581be","resolution":{"observed_at":"2026-08-07T12:59:26.713658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.490930Z","title":"Metric3d: Towards zero-shot metric 3d prediction from a single image","venue":null,"work_id":"ab402960-58ff-48fb-8fb6-f22da3fb8b40","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.790452Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:c45345278015e83bb35d47aa7f09511d5b9a6020420874ebd8d065560dfe4975","observation_id":"d8e321ed-141b-4bb9-b7bb-2a68a195f911","resolution":{"observed_at":"2026-08-07T12:59:30.592483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.227902Z","title":"Function4d: Real-time human vol- umetric capture from very sparse consumer rgbd sensors","venue":null,"work_id":"d993a444-8c1e-4e26-a144-0750e9a73bc5","year":2021},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.845197Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:dab8f110cfc6e226313eaa0d78bba533358e10f19ecc51eae8490654e7e38881","observation_id":"5e4588df-5554-48bc-9615-3cc5b313e01b","resolution":{"observed_at":"2026-08-07T12:59:30.362228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.043736Z","title":"GLAMR: Global occlusion-aware human mesh recovery with dynamic cameras","venue":null,"work_id":"b676f3f7-96c0-43aa-bd6f-cd71f8a356da","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.919244Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:ede76b2b893244dd436c76d6a5f7211d999fb39589905162924085a816991470","observation_id":"3cd973db-6364-460c-b8e1-6482f89fcd0b","resolution":{"observed_at":"2026-08-07T12:59:30.093061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.972501Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.972501Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:9a40cf0a697f2e75ccd41e52ff923dca0b2b68eac7f8b481d212eb3257024b57","observation_id":"d0ff54db-8de9-4f3a-984c-bd65f7edc42b","resolution":{"observed_at":"2026-08-07T12:59:26.972501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.029876Z","title":"Adding conditional control to text-to-image diffusion models.ICCV,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.029876Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f1903c62233b96fb23d68bdad7487c90e2e5a761186a13ea8236c21c1bd7e990","observation_id":"5f650424-84f2-4430-97a0-a5a51ea0005b","resolution":{"observed_at":"2026-08-07T12:59:27.029876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.815767Z","title":"IC-light github page, 2024","venue":null,"work_id":"2f99418b-6172-41bc-9ac1-d22accdc5204","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.085835Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:7fa5c1e88c5e5ce7d58ccafdcb340efac383e8f1ec348207a9fefa4259e94343","observation_id":"5697c2bc-bf4a-4209-8275-bec6e5e5dd87","resolution":{"observed_at":"2026-08-07T12:59:29.954643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-07T12:59:27.197607Z","title":"I2VGen-XL: High-quality image-to-video syn- thesis via cascaded diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.197607Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:d51682e3382e4f2801537be76c85a8dbcfd3f12d4ee645dee73ad6a3e8951fa9","observation_id":"c4cc89b7-8c1b-4a7f-a543-4af6c43f4f6a","resolution":{"observed_at":"2026-08-07T12:59:27.197607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.574334Z","title":"Consistent depth of moving objects in video","venue":null,"work_id":"abda368d-a335-4723-891a-ad14717fb79f","year":2021},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.290642Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:92a35018b2d868919f60cbdcc3026345019f37f67c17be120878d2e0d5ddf222","observation_id":"551c7ffe-eca2-4e39-9245-198e351bb707","resolution":{"observed_at":"2026-08-07T12:59:29.688301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.364083Z","title":"SIFU: Side- view conditioned implicit function for real-world usable clothed human reconstruction","venue":null,"work_id":"59846c3a-72b4-4b02-9524-ecb8c75a109f","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.465300Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:eeb56133d26598b4a3d7b5475c8de90873c67b552bf23a47e6b00df8d61c7dc4","observation_id":"f2299730-b323-4bea-bfea-67b1ec70959b","resolution":{"observed_at":"2026-08-07T12:59:29.466161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.138871Z","title":"Bilateral refer- ence for high-resolution dichotomous image segmentation","venue":null,"work_id":"ebc407cc-d9ef-4939-bcde-8f43e06ee7cf","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.622635Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:1b8f9a71c6bc589b1e4d170f8c3ad63709f0714e65c6c15eef1ae6872e8b0552","observation_id":"3f8c97b7-cf18-42a5-91c6-8db32c16e8c8","resolution":{"observed_at":"2026-08-07T12:59:29.220649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.948614Z","title":"PaMIR: Parametric model-conditioned implicit representa- tion for image-based human reconstruction","venue":null,"work_id":"0d2f3eb8-5636-4d7b-bd1e-767c91169ea6","year":2021},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.745112Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:99785dc51216f8a23cb10b64e85279f28eba15024792764fcac43f0036665566","observation_id":"26fc7723-ac14-4cb9-9337-5a7c06e93f79","resolution":{"observed_at":"2026-08-07T12:59:29.038110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-07T12:59:27.891963Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.891963Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:50daa73afe0f3b03f0b96943776188e76afcc09e25c6af57e9d610003a4a31c7","observation_id":"4182cb87-e610-47f8-9822-d9ce8182df6b","resolution":{"observed_at":"2026-08-07T12:59:27.891963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.727469Z","title":"“1q ř ktPK,dtPDt ››dt´ dgt t ››2 RMSEplogq: b 1řpKt““1q ř ktPK,dtPDt ››log dt´ log dgt t ››2 δă thr: 1řpKt““1q ř ktPK,dtPDt Kt","venue":null,"work_id":"54f9f996-c409-48f8-9402-36c14e875f97","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.006204Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:071c59b9d55f44aa9cb526c518e05b1788bd90f8f97d9660398c15e8341b55a1","observation_id":"838da50b-0235-417d-b38b-897d9c48bdd3","resolution":{"observed_at":"2026-08-07T12:59:28.872014Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.473862Z","title":"24 Figure S18","venue":null,"work_id":"3e07eafd-3023-4f8e-acae-4de5a636f08d","year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.175667Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:fe2ffd5211461d5b7f96c42b36e83bc1e7770f858c7128fa80b98c4de3a71fb5","observation_id":"1cc54783-db91-4d93-9ed1-e99a46b31234","resolution":{"observed_at":"2026-08-07T12:59:28.563642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.554416Z","title":null,"venue":null,"work_id":"efc57d6a-7d28-435a-a2ad-3d6bd78b6b45","year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.588927Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:da2537648c854aaafda0618e8496cf007d36ef1dcd8875c7c89ff90a6820b2b9","observation_id":"3644b666-5d63-48a1-be02-28e9bf3e2bb4","resolution":{"observed_at":"2026-08-07T12:59:37.639984Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":25,"verified_exact":0,"verified_fuzzy":51},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2505.23085."}