{"as_of":"2026-08-11T00:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2555a984a20d3e336a17d5ecd0b39cb4ffea2371d7bd2dad17c46f06ebd8f571","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:41:39.824941Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04606/citation-record","integrity":"/paper/2506.04606/integrity","json":"/paper/2506.04606/citation-record.json","paper":"/paper/2506.04606"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:41:39.714323Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.714323Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:142d2c58f8527bdbba1cc031fec1bb74d3c67a3fac2e962afd25e9b76a5c5ee7","observation_id":"ee0b2cfa-35cf-4910-93c5-1836c154d872","resolution":{"observed_at":"2026-08-07T10:41:39.714323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17606","last_updated":"2023-08-21T06:04:24Z","snapshot_observed_at":"2026-07-06T15:10:15.773528Z","submitted_at":"2023-03-30T17:59:59Z","title":"AvatarCraft: Transforming Text into Neural Human Avatars with Parameterized Shape and Pose Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17606","snapshot_observed_at":"2026-08-07T10:41:39.736092Z","title":"Ruixiang Jiang, Can Wang, Jingbo Zhang, Menglei Chai, Mingming He, Dongdong Chen, and Jing Liao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.736092Z"},"links":{"cited_paper":"/paper/2303.17606","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:2ae4aa4fe9f9efd09d0b7226228596b1bfee1845689e2629e5c342ce9fa25b81","observation_id":"e68f483f-94a4-47ae-9c1d-88bd9c6501d6","resolution":{"observed_at":"2026-08-07T10:41:39.736092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T10:41:39.740007Z","title":"URL https://arxiv.org/abs/2301.12597","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.740007Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:791dfe683b75abc62c9c008a2652b44e23b7f5dacab271b002493d46d82b14ca","observation_id":"c37a48f8-18fc-446c-a3df-fe125ff6eb97","resolution":{"observed_at":"2026-08-07T10:41:39.740007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10899","last_updated":"2023-08-21T17:59:10Z","snapshot_observed_at":"2026-08-02T07:51:26.688680Z","submitted_at":"2023-08-21T17:59:10Z","title":"TADA! Text to Animatable Digital Avatars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10899","snapshot_observed_at":"2026-08-07T10:41:39.744076Z","title":"Chen-Hsuan Lin, Jun Gao, Luming Tang, Towaki Takikawa, Xiaohui Zeng, Xun Huang, Karsten Kreis, Sanja Fidler, Ming-Yu Liu, and Tsung-Yi Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.744076Z"},"links":{"cited_paper":"/paper/2308.10899","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:849d61a856a50f5555c2e284ce021fde8d8447163cada20f80ff148b28000689","observation_id":"ac184a21-3bb7-450a-a9d8-33504e110371","resolution":{"observed_at":"2026-08-07T10:41:39.744076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T10:41:39.747720Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.747720Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:6b2f9f5bcd8b70e6837153c5acddcd9c04737a26de7e5ffe76ef898314199e92","observation_id":"795b7840-cf2a-4cf9-9c5b-0025bdffbbe3","resolution":{"observed_at":"2026-08-07T10:41:39.747720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-07T10:41:39.751445Z","title":"Agentbench: Evaluating large language models as agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.751445Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:246fcac314ad2827a484b316d6aed1296d02854b70b28ae9678ae56a9a447bec","observation_id":"464db041-1c9c-472b-9cc4-221915909147","resolution":{"observed_at":"2026-08-07T10:41:39.751445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-08-07T10:41:39.759301Z","title":"Joon Sung Park, Joseph C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.759301Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:b29c435ac2714816a910b4fdf60079eadf45dc38513b6862f80dafcd701f5300","observation_id":"9d43d8c9-e1b8-403a-ad63-96d2acb49759","resolution":{"observed_at":"2026-08-07T10:41:39.759301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:39.762937Z","title":"URL https://arxiv.org/abs/ 2304.03442","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.762937Z"},"links":{"citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:b02fc685cfca8211a632daa71bb6be78cdbf3da883dfed4da198f3ed35f72671","observation_id":"1353627b-702d-4fee-9e35-aedf2b9feafa","resolution":{"observed_at":"2026-08-07T10:41:39.762937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17214","last_updated":"2024-07-10T14:25:08Z","snapshot_observed_at":"2026-08-05T19:34:22.527582Z","submitted_at":"2024-02-27T05:10:59Z","title":"CharacterGen: Efficient 3D Character Generation from Single Images with Multi-View Pose Canonicalization","version":3},"cited_work":{"arxiv_id":"2402.17214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17214","snapshot_observed_at":"2026-08-07T10:41:40.009197Z","title":"CharacterGen: Efficient 3D Character Generation from Single Images with Multi-View Pose Canonicalization","venue":"cs.CV","work_id":"98f234dc-7ef4-4175-b548-f733913c1872","year":2024},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.771357Z"},"links":{"cited_paper":"/paper/2402.17214","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:76b07f829fb8110d69490f72d4cb533f5d95673aa86e7294d3b021cd10399106","observation_id":"f6aec695-2dc4-42fe-9694-2ba047b30b1c","resolution":{"observed_at":"2026-08-07T10:41:40.013907Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12618","last_updated":"2024-10-01T17:50:25Z","snapshot_observed_at":"2026-08-04T13:31:30.342476Z","submitted_at":"2024-09-19T09:44:17Z","title":"Iteration of Thought: Leveraging Inner Dialogue for Autonomous Large Language Model Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12618","snapshot_observed_at":"2026-08-07T10:41:39.775381Z","title":"org/abs/2409.12618","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.775381Z"},"links":{"cited_paper":"/paper/2409.12618","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:1099b3d2df5e0b61530990b55eae3c713d33f05e0d49c2e9e7a9f4177297fe14","observation_id":"0ae27a19-bb7d-45c8-a90a-163c9f79c48d","resolution":{"observed_at":"2026-08-07T10:41:39.775381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-07T10:41:39.784487Z","title":"Yawar Siddiqui, Tom Monnier, Filippos Kokkinos, Mahendra Kariya, Yanir Kleiman, Emilien Garreau, Oran Gafni, Natalia Neverova, Andrea Vedaldi, Roman Shapovalov, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.784487Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:9c3432aff7d4c06c7660b361d156d7bc523a051ed45924302f783dc5c415f8c9","observation_id":"2440ee96-9bca-442c-bc12-f83a7e3550d0","resolution":{"observed_at":"2026-08-07T10:41:39.784487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16653","last_updated":"2024-03-29T08:39:23Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:55:05Z","title":"DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16653","snapshot_observed_at":"2026-08-07T10:41:39.788222Z","title":"Dreamgaussian: Generative gaussian splatting for efficient 3d content creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.788222Z"},"links":{"cited_paper":"/paper/2309.16653","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:690127b0cc11df9d9b10c2f678888895f0ff633fbbf2ce2e8547771068229e87","observation_id":"109e1a66-33b1-4ffd-80fb-7bf8336653d3","resolution":{"observed_at":"2026-08-07T10:41:39.788222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T10:41:39.792243Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.792243Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:7040f567d00b68967e1150493212700f587892765c3d843f4bf9508e324dbe71","observation_id":"672510bf-4af3-49a9-8d90-f75f67a417b1","resolution":{"observed_at":"2026-08-07T10:41:39.792243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-07T08:29:46.650400Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-07T10:41:39.799981Z","title":"11 Jianfeng Xiang, Zelong Lv, Sicheng Xu, Yu Deng, Ruicheng Wang, Bowen Zhang, Dong Chen, Xin Tong, and Jiaolong Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.799981Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:f4ab9f46981172d19b016cc3e1d86823ae48a7823015070904f6385372e0bf32","observation_id":"179e2aa8-ddb8-47f0-8e3e-2f727b916229","resolution":{"observed_at":"2026-08-07T10:41:39.799981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01506","last_updated":"2025-05-30T11:13:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-02T13:58:38Z","title":"Structured 3D Latents for Scalable and Versatile 3D Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01506","snapshot_observed_at":"2026-08-07T10:41:39.804402Z","title":"Deshun Yang, Luhui Hu, Yu Tian, Zihao Li, Chris Kelly, Bang Yang, Cindy Yang, and Yuexian Zou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.804402Z"},"links":{"cited_paper":"/paper/2412.01506","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:0c5557f211e115abb2fabee397ae6e1631905e7de95fb52496321f56573e10a7","observation_id":"ab2b0cbd-497b-4bef-aee8-4226b831beeb","resolution":{"observed_at":"2026-08-07T10:41:39.804402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07944","last_updated":"2024-03-10T16:09:02Z","snapshot_observed_at":"2026-07-06T17:43:31.874919Z","submitted_at":"2024-03-10T16:09:02Z","title":"WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs","version":1},"cited_work":{"arxiv_id":"2403.07944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.07944","snapshot_observed_at":"2026-08-07T10:41:39.910543Z","title":"WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs","venue":"cs.CV","work_id":"e8d866fd-a1ad-47e7-8d99-f50655857830","year":2024},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.808081Z"},"links":{"cited_paper":"/paper/2403.07944","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:42fce938c249f91a47bc56596a5c444a3dbe60b988f1919f0d1cbcbf8c6291ac","observation_id":"71778dda-07f4-4aaa-a986-80a7c5997c52","resolution":{"observed_at":"2026-08-07T10:41:39.915452Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.00561","last_updated":"2022-08-01T01:27:02Z","snapshot_observed_at":"2026-07-06T13:37:14.607651Z","submitted_at":"2022-08-01T01:27:02Z","title":"AvatarGen: a 3D Generative Model for Animatable Human Avatars","version":1},"cited_work":{"arxiv_id":"2208.00561","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.00561","snapshot_observed_at":"2026-08-07T10:41:39.892415Z","title":"AvatarGen: a 3D Generative Model for Animatable Human Avatars","venue":"cs.CV","work_id":"3906a0d5-9d4d-42e7-b621-e987b80b59fb","year":2022},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.811748Z"},"links":{"cited_paper":"/paper/2208.00561","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:69eb7cfda7e5a349a2feead70e56c9dcbe5aa6fc8a7897ff82383ee5ed86a09c","observation_id":"46d7bc0c-c24a-429d-b1c0-e129e2f8af17","resolution":{"observed_at":"2026-08-07T10:41:39.897848Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-07T10:41:39.816391Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.816391Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:68ab9207a762269152e91423cacc51e2911a143047e2679767f8e4267a4f717e","observation_id":"4c3688f1-8754-4aa2-a93a-1081b07e0e2b","resolution":{"observed_at":"2026-08-07T10:41:39.816391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T10:41:39.824941Z","title":"Appendix 7 Implementation Details 7.1 Agent Coordination Pipeline Our system coordinates four modular agents (Descriptor, Generator, Evaluator, Refiner) in a verification loop","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.824941Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:a3d708aedf4afb4565c55571082d96979fed743fe9ad36182f398b62e74acea8","observation_id":"dfa004f7-bd2c-4913-a1c4-b38a39225106","resolution":{"observed_at":"2026-08-07T10:41:39.824941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:39.755671Z","title":"doi: 10.1145/2816795.2818013","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.755671Z"},"links":{"citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:9670e5a1c40a5a98f1d5b12a7539e6345e33058a4f727f5b179dcfb52297ff85","observation_id":"9d6d6703-8fe7-407a-9bd1-6bbbc0a90cac","resolution":{"observed_at":"2026-08-07T10:41:39.755671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05866","last_updated":"2019-04-11T17:47:37Z","snapshot_observed_at":"2026-07-06T07:45:33.928689Z","submitted_at":"2019-04-11T17:47:37Z","title":"Expressive Body Capture: 3D Hands, Face, and Body from a Single Image","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05866","snapshot_observed_at":"2026-08-07T10:41:39.766934Z","title":"Hao-Yang Peng, Jia-Peng Zhang, Meng-Hao Guo, Yan-Pei Cao, and Shi-Min Hu","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.766934Z"},"links":{"cited_paper":"/paper/1904.05866","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:4b82a396c6da18cc94baa444411247875e41c1472f48abae0b01c85035bc3592","observation_id":"3ed96b5b-db96-46d3-ae2e-966c36cebbd1","resolution":{"observed_at":"2026-08-07T10:41:39.766934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T10:41:39.779709Z","title":"José Ribeiro- Gomes, Tianhui Cai, Zoltán A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.779709Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:9c9b527013fc06934921fe9b26779cf5e4d9015a4fa2b96dc1207a333996c7a0","observation_id":"96cc0822-947f-497b-bf70-8c2d52e32e5b","resolution":{"observed_at":"2026-08-07T10:41:39.779709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04888","last_updated":"2022-10-10T17:59:31Z","snapshot_observed_at":"2026-07-31T08:36:15.719965Z","submitted_at":"2022-10-10T17:59:31Z","title":"EVA3D: Compositional 3D Human Generation from 2D Image Collections","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04888","snapshot_observed_at":"2026-08-07T10:41:39.727380Z","title":"Yicong Hong, Kai Zhang, Jiuxiang Gu, Sai Bi, Yang Zhou, Difan Liu, Feng Liu, Kalyan Sunkavalli, Trung Bui, and Hao Tan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.727380Z"},"links":{"cited_paper":"/paper/2210.04888","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:7a80f5224a1b514d7fa597a8d9d781baef8d4b5274e025327631e8a3d9e3c57d","observation_id":"ba95ddda-170e-419e-b4f0-e00ec34ef932","resolution":{"observed_at":"2026-08-07T10:41:39.727380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02312","last_updated":"2023-05-03T17:56:24Z","snapshot_observed_at":"2026-08-10T15:54:37.883851Z","submitted_at":"2023-05-03T17:56:24Z","title":"AG3D: Learning to Generate 3D Avatars from 2D Image Collections","version":1},"cited_work":{"arxiv_id":"2305.02312","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.02312","snapshot_observed_at":"2026-08-07T10:41:40.264354Z","title":"AG3D: Learning to Generate 3D Avatars from 2D Image Collections","venue":"cs.CV","work_id":"a8814b09-eb9a-4c97-889c-24abf8e43908","year":2023},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.723413Z"},"links":{"cited_paper":"/paper/2305.02312","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:7a2c6c81aab7affe97866785340dbd6b1ae0fefa877d86714b30334c42c2979b","observation_id":"5a9a7a47-5443-4d02-b457-2dcc451d77ac","resolution":{"observed_at":"2026-08-07T10:41:40.269231Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01241","last_updated":"2024-07-02T15:53:03Z","snapshot_observed_at":"2026-08-10T08:09:06.148423Z","submitted_at":"2024-04-01T17:00:18Z","title":"StructLDM: Structured Latent Diffusion for 3D Human Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01241","snapshot_observed_at":"2026-08-07T10:41:39.732131Z","title":"Structldm: Structured latent diffusion for 3d human generation, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.732131Z"},"links":{"cited_paper":"/paper/2404.01241","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:2712da4d377dd47fdc2f864d603eb48de662181e7028042f9152cfbf5848e189","observation_id":"0326ba3a-d26e-4e6e-90e5-1cc9b3fe4256","resolution":{"observed_at":"2026-08-07T10:41:39.732131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18096","snapshot_observed_at":"2026-08-07T10:41:39.719320Z","title":"Zijian Dong, Xu Chen, Jinlong Yang, Michael J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.719320Z"},"links":{"cited_paper":"/paper/2501.18096","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:421ff1c27aa57216dcf92f81b78713364972fb926d8551efb2b7d5355d99b819","observation_id":"07f8e3c3-0c4b-49da-9c4b-4fc59bc741a6","resolution":{"observed_at":"2026-08-07T10:41:39.719320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:57:33.725024Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2506.04606."}