{"as_of":"2026-08-12T10:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e17a007106ee3d5d0b8a97d2b2974e429449c7f6d6d019a76b2ad374062d012","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:40:23.917814Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20983/citation-record","integrity":"/paper/2506.20983/integrity","json":"/paper/2506.20983/citation-record.json","paper":"/paper/2506.20983"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:32.708065Z","title":"Spatext: Spatio-textual representation for con- trollable image generation","venue":null,"work_id":"3c7829fb-9578-479e-900c-0ba919b468be","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.387547Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:4ffbb354832d0b6c3026f5ea4f1c72ff7326dd3d9d1a0c9ca37630f0fd27b0c6","observation_id":"833bc21f-dc56-4240-95b8-ce59b7836de8","resolution":{"observed_at":"2026-08-06T22:40:32.798550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T22:40:18.447091Z","title":"Ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.447091Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:ab3bfad8df17c5fb9ba8e3e1b44b190189561433edcfe22bd99047d0c1a9b655","observation_id":"45547b5a-3975-438f-8a80-e554d2d9599b","resolution":{"observed_at":"2026-08-06T22:40:18.447091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-06T22:40:18.534281Z","title":"Zoedepth: Zero-shot trans- fer by combining relative and metric depth","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.534281Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:e1c31c68720cc6e52cd604b62a6af39c66c0b5304ddd5d2d85db426680c932d5","observation_id":"44218b58-17a2-47d5-b3f3-1ea80d3510a3","resolution":{"observed_at":"2026-08-06T22:40:18.534281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:32.521941Z","title":"Person image synthesis via de- noising diffusion model","venue":null,"work_id":"c2cbc880-6621-4c0a-966a-2966bf6722b2","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.624771Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:d2280bcf821f3ce15df32cc2f3a15f0536744ece3a90767a159e1a9de0d67e2b","observation_id":"5628c2ab-30af-4872-888c-e7383a3d72a1","resolution":{"observed_at":"2026-08-06T22:40:32.639476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:32.331049Z","title":"Openpose: Realtime multi-person 2d pose estimation using part affinity fields","venue":null,"work_id":"32fcc1b3-eea1-4e7c-9e5f-f7b4e2b3a28c","year":null},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.685457Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:3b2ac52e95dad6f52e158a9fc8edbd5bf787daf83c17d125660b9c624d0a99ad","observation_id":"5ab2491b-4378-4387-9606-075d955b3969","resolution":{"observed_at":"2026-08-06T22:40:32.444330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:32.150651Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffu- sion","venue":null,"work_id":"170b81c1-ce95-406f-b645-3a2efd148a0d","year":null},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.778458Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:47a1d545df617326a27a7c69b192c9f16929da10987c35408cb9846cdd688aa0","observation_id":"f0ee8c9b-2a7e-4cf6-9751-6724cb5b10a3","resolution":{"observed_at":"2026-08-06T22:40:32.248922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:31.965830Z","title":"Up- gpt: Universal diffusion model for person image generation, editing and pose transfer","venue":null,"work_id":"2c46939d-a2d0-400a-8696-bb69b30f920b","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.884292Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:4c450a8b1448d7790cfc5be754ffc9128c6aeae2c8d36ac254c25413db9665a0","observation_id":"607853e3-52f3-44ea-b3c7-8e5ac184cf04","resolution":{"observed_at":"2026-08-06T22:40:32.064430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:31.729952Z","title":"Openmmlab pose estimation tool- box and benchmark","venue":null,"work_id":"075c471f-4fd1-4829-afd8-5282ac05d0f5","year":2020},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.965482Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:e557b4b13ba09efa249e40a3e932817cc56d8d98e6322907c22ed3b5bcd8e913","observation_id":"fe2847af-3a21-4c59-a7b5-e3523d7f771d","resolution":{"observed_at":"2026-08-06T22:40:31.812432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:19.108485Z","title":"Make-a-scene: Scene- based text-to-image generation with human priors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.108485Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:a2224961abd8093211e8cea94601e3384c09774abd74b07d14d7b81baab55a8e","observation_id":"c22768ff-8cb5-466d-a26d-0bd141b8e2cd","resolution":{"observed_at":"2026-08-06T22:40:19.108485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-06T22:40:19.223666Z","title":"An image is worth one word: Personalizing text-to- image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.223666Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:9bb46f48bf7f5bc15551d0621c126452f07160090fcb0fe3d70154c1c3c997c4","observation_id":"2c05867f-a099-4f8a-9a47-ee4101208c0a","resolution":{"observed_at":"2026-08-06T22:40:19.223666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:31.494037Z","title":"Controllable person image synthesis with pose-constrained latent diffusion","venue":null,"work_id":"28c7cd4f-8bdb-4510-8583-9e1305976610","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.334652Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:a815ebb0106563e0ebf5f7ea290fdf48d212d79c1550627929e93ed10ee34770","observation_id":"acac9e1e-f3f4-4ff5-b258-00547f502898","resolution":{"observed_at":"2026-08-06T22:40:31.564562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:31.252100Z","title":"Prompt-to-prompt image editing with cross-attention control","venue":null,"work_id":"1224daf1-d0ab-447c-8200-a07c2899aac1","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.479717Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:dd8d1b3ca513ba1eafa34d1878f9fcb900a58622ea98ad1791097a19c2af6d3e","observation_id":"7d530aa7-e0e8-4bda-bc64-6701f675d284","resolution":{"observed_at":"2026-08-06T22:40:31.391334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:19.644611Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.644611Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:e9ec615e31353cc23ef60a03a2e366b03ca6619115fc6f37b5429279c92edc6c","observation_id":"e5d999f1-1c13-4f02-9527-39893fc807d6","resolution":{"observed_at":"2026-08-06T22:40:19.644611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:31.051301Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":"92ce6bcc-83d4-4724-b53d-57d9d400d061","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.795100Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:75201dced68ba1379eaa4a0ddc0d499f25a7e2233249cc871fdf248d2c31776a","observation_id":"a01b8f56-54a9-47fb-8b03-71f48e7721fc","resolution":{"observed_at":"2026-08-06T22:40:31.130883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:30.829500Z","title":"Composer: Creative and controllable im- age synthesis with composable conditions","venue":null,"work_id":"a4fc1e5a-e38b-42cf-a365-fd0599c316cb","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.888999Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:3200d8077059d662c55ebf9cc817e1badae9851fc707376162e1e2a33a91c361","observation_id":"6a1bccc9-3dc9-4d47-93f4-1a8cb391bf44","resolution":{"observed_at":"2026-08-06T22:40:30.925992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:30.579675Z","title":"Stable-pose: Leveraging transformers for pose-guided text-to-image generation","venue":null,"work_id":"485cba37-b9d6-43a5-af40-f20e27618fe9","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.965654Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:3879ccc11997d3714e8213b8251c48d8aee8e44da39d67aff1cf71b1510f1e55","observation_id":"f941104b-625f-4ac8-ac21-f92395e651d6","resolution":{"observed_at":"2026-08-06T22:40:30.703108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17845","last_updated":"2023-05-31T11:09:40Z","snapshot_observed_at":"2026-08-11T14:16:19.529514Z","submitted_at":"2023-05-29T01:56:42Z","title":"SPAC-Net: Synthetic Pose-aware Animal ControlNet for Enhanced Pose Estimation","version":2},"cited_work":{"arxiv_id":"2305.17845","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.17845","snapshot_observed_at":"2026-08-06T22:40:24.396720Z","title":"SPAC-Net: Synthetic Pose-aware Animal ControlNet for Enhanced Pose Estimation","venue":"cs.CV","work_id":"9b07574a-33dc-473f-b922-d9abb72e3771","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.049697Z"},"links":{"cited_paper":"/paper/2305.17845","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:e8b5ba21f8a5aadb3b008f2e6227731193ef0dd781cf6dc3fcf271933311b66c","observation_id":"3cf98ae1-f372-48e2-b8d6-6706dcd805a4","resolution":{"observed_at":"2026-08-06T22:40:24.462808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02653","last_updated":"2024-09-04T12:28:44Z","snapshot_observed_at":"2026-08-04T18:00:18.095442Z","submitted_at":"2024-09-04T12:28:44Z","title":"Skip-and-Play: Depth-Driven Pose-Preserved Image Generation for Any Objects","version":1},"cited_work":{"arxiv_id":"2409.02653","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02653","snapshot_observed_at":"2026-08-06T22:40:24.210757Z","title":"Skip-and-Play: Depth-Driven Pose-Preserved Image Generation for Any Objects","venue":"cs.CV","work_id":"d1deeff2-1fa8-46d1-905e-f6d2b701b5c1","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.131528Z"},"links":{"cited_paper":"/paper/2409.02653","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:a399ac542f43831fc39fdf797fe794edd44294c69fcbb736ef982382e0b8acc9","observation_id":"af2d24ef-0310-4618-a707-be84a04873cf","resolution":{"observed_at":"2026-08-06T22:40:24.274129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:30.361465Z","title":"Human-art: A versatile human-centric dataset bridg- ing natural and artificial scenes","venue":null,"work_id":"8021aa8e-89e9-4d45-a2ba-7b60950b665d","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.219216Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:6953afbde2711b1842e31639c7b62c646d97d492afbdf7c656545de6914bd11b","observation_id":"e090c3f2-84a6-4ede-b58e-7564d8eada9c","resolution":{"observed_at":"2026-08-06T22:40:30.449937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:30.175618Z","title":"Humansd: A native skeleton-guided diffusion model for human image generation","venue":null,"work_id":"13d0c888-9837-473f-8049-32551a6b02a8","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.293266Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:4c1e98d06e584a1edb990af4529eaa79269ba1384acf15f719aa20577c24b6ad","observation_id":"2d79e33b-121f-47f2-94b5-b25e00a34248","resolution":{"observed_at":"2026-08-06T22:40:30.256036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:30.051026Z","title":"Dreampose: Fashion image-to-video synthesis via stable diffusion","venue":null,"work_id":"29b817f6-db58-40c0-9d84-c6a883e9d1b5","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.396502Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:9cc335d0cf61b34bfd8813bde7ff30e2782f18c4c9ff7b775059007525ae7f0d","observation_id":"25cb4b2a-f888-4c65-8186-54b21222ff5c","resolution":{"observed_at":"2026-08-06T22:40:30.116455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.889682Z","title":"Segment anything in high quality","venue":null,"work_id":"eb5439c3-feef-4858-ba3a-ec915f98f6f4","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.512885Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:f1c574160eaece406672bf31b2439dad4249ed1a5bb68516e5cd1661300616de","observation_id":"7184493b-22ca-44a7-b19d-82dd367fcff4","resolution":{"observed_at":"2026-08-06T22:40:29.972257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.721828Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"2d4f23f3-e029-4b34-aebd-785df01b6692","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.595026Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:1eab62f62c6385f1b89c191ab99950b1e8d5480eb05af61c6f0937b4198d1a9c","observation_id":"1ec9def2-159a-4df0-891f-0413aa5e4cb8","resolution":{"observed_at":"2026-08-06T22:40:29.804186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09349","last_updated":"2025-02-25T02:55:40Z","snapshot_observed_at":"2026-08-11T17:03:13.221751Z","submitted_at":"2024-12-12T15:15:59Z","title":"DisPose: Disentangling Pose Guidance for Controllable Human Image Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09349","snapshot_observed_at":"2026-08-06T22:40:20.708669Z","title":"Dispose: Disen- tangling pose guidance for controllable human image anima- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.708669Z"},"links":{"cited_paper":"/paper/2412.09349","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:a8da02a160fc4dad2fe27b2e9e9724f82c05783e43d95709f6fab3aed01dd73f","observation_id":"607a66ca-c9bd-42e4-9e61-6732cd769cce","resolution":{"observed_at":"2026-08-06T22:40:20.708669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.596967Z","title":"Controlnet++: Improving conditional controls with efficient consistency feedback","venue":null,"work_id":"5435a215-1ccb-49bf-b2a7-a740d3c7479b","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.793234Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:37a5e639cc43eab905e41fe24c23a292ec0e2f69169434bda275f18777916fb7","observation_id":"783e2f72-2b44-4d2e-a2bd-49810a47c9c5","resolution":{"observed_at":"2026-08-06T22:40:29.666948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18417","last_updated":"2024-03-27T10:09:38Z","snapshot_observed_at":"2026-07-06T17:51:48.378864Z","submitted_at":"2024-03-27T10:09:38Z","title":"ECNet: Effective Controllable Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18417","snapshot_observed_at":"2026-08-06T22:40:20.850877Z","title":"Ecnet: Effective controllable text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.850877Z"},"links":{"cited_paper":"/paper/2403.18417","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:039419cd9ac662b8868dbecf2995f8565b1ccc2bdcd374b72f3de118f5b95552","observation_id":"f69f1314-6a64-4010-a217-9626108da35b","resolution":{"observed_at":"2026-08-06T22:40:20.850877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:20.931244Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.931244Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:0d27be09d1885eeaba863354e146bd3f93d31d6fd8308970383386eff5e3213f","observation_id":"52b2b2fb-567d-4835-a095-42c980c5b3f2","resolution":{"observed_at":"2026-08-06T22:40:20.931244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.441287Z","title":"Controllable text-to-3d generation via surface-aligned gaus- sian splatting","venue":null,"work_id":"d0a811d3-b097-4fb4-a3af-9b3f47b28d15","year":null},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.050057Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:8b79e759b1777407839aed11b8c3e27a7028730596608bf5ecd7f27014e66b3e","observation_id":"119d5b4a-1c81-4081-b23b-e238c38c97ce","resolution":{"observed_at":"2026-08-06T22:40:29.491203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.281185Z","title":"Ctrl-x: Controlling structure and appear- ance for text-to-image generation without guidance","venue":null,"work_id":"083b6b99-03bd-4832-b3ae-5e48d6d2193f","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.171516Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:df1e0fca2932e1e8a52b9fe96df7f89b279ce852736cb717257f868ef2c6f60e","observation_id":"d38beb51-20af-492f-8711-9b700076ecec","resolution":{"observed_at":"2026-08-06T22:40:29.354096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:21.255648Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.255648Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:f26e2e646f5ba4da3dc434d0ca73c2a690e7dbf71f946bd5334c73f7a46b3051","observation_id":"ee0095ed-0ed8-43f5-9242-aec745325c01","resolution":{"observed_at":"2026-08-06T22:40:21.255648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.093194Z","title":"Hyperhuman: Hyper-realistic human generation with latent structural diffusion","venue":null,"work_id":"1fbba74e-3e45-4445-a9e8-656200ae11ae","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.369782Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:874ddc954f8a4a5baf51393363cd56b05a0c2df75d84a4872cd34d4c02277e9f","observation_id":"13543dd2-06d3-4ca0-92a3-4747a533ad52","resolution":{"observed_at":"2026-08-06T22:40:29.191061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.930279Z","title":"Smartcontrol: Enhancing controlnet for handling rough visual conditions","venue":null,"work_id":"9e368cdf-aae0-4ded-bf5e-61fa42078abe","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.456151Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:e26ae5f67e6fd91908ee77724d07d75842f1755dd1c6cc15108f0ca13db52fdd","observation_id":"f1dd4690-39e6-4a9c-9caa-9cf447c62710","resolution":{"observed_at":"2026-08-06T22:40:29.015061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.767101Z","title":"Controllable person image synthesis with attribute-decomposed gan","venue":null,"work_id":"64a51959-354d-4b9a-9ca3-d025d8b3e9d5","year":null},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.568663Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:9fbbc41df2fa8f638fe95db677577619284719690acfff7db109adba648b2e52","observation_id":"993a21a4-7d32-43e1-a379-0d171d8b410b","resolution":{"observed_at":"2026-08-06T22:40:28.843139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.590970Z","title":"Freecontrol: Training-free spatial control of any text-to-image diffusion model with any condition","venue":null,"work_id":"904e2ae2-524a-4234-8baf-b185ff9b0931","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.644746Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:83cb180a7de309ca3a5a53f3ad0929285eea28ceafabbfb601773cdff169a782","observation_id":"91adaafd-c272-4938-8cf1-6dde34bff1de","resolution":{"observed_at":"2026-08-06T22:40:28.645243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.409378Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"efa8563e-6ca5-40cb-b818-6a7779e137cf","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.732972Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:34022eb453fa23329ce6f518d9494650c215a4fed2cfeeaffc212f83645b7496","observation_id":"808ad8c8-ba86-4a9d-a047-274bd831b626","resolution":{"observed_at":"2026-08-06T22:40:28.506372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.231149Z","title":"Consolidating attention features for multi-view image editing","venue":null,"work_id":"51602aa8-64b5-45d0-be20-ced1077b86fa","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.818579Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:45bf08c11272867c265f4e9f6c8a46b0cf21fe76a0a27cd0f8294134a0c9b1ce","observation_id":"1d451bb1-a1f3-4a38-bf7f-618b1ac63fa6","resolution":{"observed_at":"2026-08-06T22:40:28.334312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-07-06T18:59:34.520274Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-08-06T22:40:21.916192Z","title":"Controlnext: Powerful and effi- cient control for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.916192Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:b4af3319197e4ac08267ea2929363c14a16fbcfc889199f11467e332e36bfa3f","observation_id":"9c39c07c-2e35-41cf-86bd-dd14baf73fc2","resolution":{"observed_at":"2026-08-06T22:40:21.916192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.024215Z","title":"Learn, imagine and create: Text-to-image generation from prior knowledge","venue":null,"work_id":"12f467ce-6b5f-45c2-b0c0-0ad9f80d308c","year":2019},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.006626Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:49787a4c01f61c86029ea6df656b6b6035675092f29c8b4e4ee2a52827a6b1a8","observation_id":"0d88ba47-61e9-41bd-b7e9-1e56f189f0c0","resolution":{"observed_at":"2026-08-06T22:40:28.132901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:27.828546Z","title":"Mirrorgan: Learning text-to-image generation by re- description","venue":null,"work_id":"c8bfc38b-b729-4d85-9bab-8732c93c7875","year":null},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.076431Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:92c84aa2bad00424f3dc675113017a5a14e87be19666dceae8b0fb760f0b8efd","observation_id":"05a64b06-8e81-48fc-85a5-3ca9b9b271ad","resolution":{"observed_at":"2026-08-06T22:40:27.933999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:27.653882Z","title":"Unicontrol: A unified diffu- sion model for controllable visual generation in the wild","venue":null,"work_id":"fb4780ce-325d-42ea-ba0a-28d3168038b3","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.160510Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:3c5759f0b87548622b74bd4bbc309a23014e94be0db6693a8d2562613fad252b","observation_id":"72703871-4aa1-4f6a-8c2f-94d34b17d84a","resolution":{"observed_at":"2026-08-06T22:40:27.738273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:27.471462Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"2d5c6dea-3554-4649-9c90-e839d8125b20","year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.267932Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:5d0db1f64e3278fff9db085ea4923ea4a34b34f2b5ad863b35652c42b72a6c11","observation_id":"1a0eead5-185a-4469-b772-310b5493210b","resolution":{"observed_at":"2026-08-06T22:40:27.558803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:27.266200Z","title":"Benchmarking and error diagnosis in multi-instance pose estimation","venue":null,"work_id":"589a1a99-6009-4e68-aed4-cf6f20be4397","year":2017},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.354649Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:4aca0c17c5f351d6310983d4cd70dfb3592b5c321e29387749a669fe7e67a808","observation_id":"83d0645b-7bff-4c3e-9d2a-5eccb02dc216","resolution":{"observed_at":"2026-08-06T22:40:27.374856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:27.032396Z","title":"Stable Diffusion v1-5, 2022","venue":null,"work_id":"84b33077-970d-4ead-ab53-8cfb47763120","year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.437441Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:c7573e77d4a2a59a59382f6a99229b6d9d84743a809fcdecdfed223f0c33e125","observation_id":"c87315b9-434f-461f-8cff-34b5f42a6f15","resolution":{"observed_at":"2026-08-06T22:40:27.151560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:26.816558Z","title":"Advancing pose-guided image synthesis with pro- gressive conditional diffusion models","venue":null,"work_id":"2c37e3d5-3797-4031-86a6-b338ba77d935","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.559546Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:57d86cdcfe3be8e9844a6abe21cfaf8a0966e182ac3de9d10b34d8d6ebe21540","observation_id":"86d5a380-274a-47dd-9cef-f2acde020253","resolution":{"observed_at":"2026-08-06T22:40:26.932845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:26.594689Z","title":"Deep high-resolution representation learning for human pose es- timation","venue":null,"work_id":"0908ba38-e750-472b-bc08-67fc96b9918f","year":2019},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.670807Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:9b8707646fd4e8f10d43dd5f5dacad55f91ca763efb51fb8cee48d2b95163ebd","observation_id":"1445cae7-bdb8-4e1e-b56d-87fe324abe08","resolution":{"observed_at":"2026-08-06T22:40:26.729070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:26.368351Z","title":"What the DAAM: Interpreting stable diffu- sion using cross attention","venue":null,"work_id":"0d1baea1-23e4-4e05-8a46-ea7e9b2e4475","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.795614Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:c53b6163bcf05604a2af5be6bb115d45110433b6e0956803ce5948de821050fb","observation_id":"272e4a01-41a1-4d12-b231-ca0ffe1d8095","resolution":{"observed_at":"2026-08-06T22:40:26.481776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:26.205840Z","title":"Visualizing data using t-sne","venue":null,"work_id":"aed91197-a108-4dfb-a152-2d40186d50cc","year":2008},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.889767Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:86bf64d9c7c938a892c800a3ff477555593891fca7edbcf0ec58d0d06692213c","observation_id":"3af9e700-3e09-4412-bd5e-0140522cdec1","resolution":{"observed_at":"2026-08-06T22:40:26.260908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04946","last_updated":"2024-04-07T12:57:41Z","snapshot_observed_at":"2026-08-04T04:52:44.490954Z","submitted_at":"2024-04-07T12:57:41Z","title":"AnimateZoo: Zero-shot Video Generation of Cross-Species Animation via Subject Alignment","version":1},"cited_work":{"arxiv_id":"2404.04946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.04946","snapshot_observed_at":"2026-08-06T22:40:24.041723Z","title":"AnimateZoo: Zero-shot Video Generation of Cross-Species Animation via Subject Alignment","venue":"cs.CV","work_id":"cdc93e08-aed0-4e3f-a142-631b7716bcb8","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.979387Z"},"links":{"cited_paper":"/paper/2404.04946","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:067f26e2ebe0eacd915b3924e9b8a57136b58a21d62263ae836127869c4dc953","observation_id":"b36ee586-7416-44ad-a2bf-8227b61bd322","resolution":{"observed_at":"2026-08-06T22:40:24.089793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:26.073813Z","title":"Vit- pose++: Vision transformer for generic body pose estima- tion","venue":null,"work_id":"7af24e25-a9fd-4a50-9f02-adedbb39047d","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.064502Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:317ab4bbc37148ed8b913ae81e02afbac385e9b290aeadfeb951eb2569182ca1","observation_id":"8fcca519-5e3b-4860-9e55-37269ad6398a","resolution":{"observed_at":"2026-08-06T22:40:26.127713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:23.153655Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.153655Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:d1dc5fd9e8e4c48ea2fe8866fe9e17af3af052a1941a76b0611680f38c1e1253","observation_id":"34235a47-1d52-499f-9d9d-7f07ea86d56b","resolution":{"observed_at":"2026-08-06T22:40:23.153655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.877732Z","title":"When controlnet meets inexplicit masks: A case study of controlnet on its contour- following ability","venue":null,"work_id":"58f69531-3835-4fb6-9dcf-6e6bcf582672","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.205566Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:6edb8808193186169255574d7c83448036baa9b9fe37b3b4bf49fdbcefb289ff","observation_id":"6358fd66-da64-4fd1-876c-ee32e3ac8255","resolution":{"observed_at":"2026-08-06T22:40:25.958791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.713158Z","title":"Grpose: Learning graph relations for human image generation with pose priors","venue":null,"work_id":"4fa16416-b117-4b4c-a7f4-e6e091ba446c","year":2025},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.282647Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:9f4c8506c1b006044b594776065ab0bcda6b354197b86f96293b245af1fcd627","observation_id":"a06cd6da-07c0-4043-bfaf-f54265992b12","resolution":{"observed_at":"2026-08-06T22:40:25.776788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.549999Z","title":"Ap-10k: A benchmark for animal pose estima- tion in the wild","venue":null,"work_id":"19418237-2015-4a80-b9fe-2c3fa6ae9e14","year":2021},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.382631Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:52326b8657a6151d62e9cc4a126680909cdf7facabbce8af80b6b5fe48e24dd1","observation_id":"1ac9b915-db30-4958-8005-df02b151b425","resolution":{"observed_at":"2026-08-06T22:40:25.616665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.392497Z","title":"Pise: Person image synthesis and editing with decoupled gan","venue":null,"work_id":"49626c20-6f0b-4901-8179-d5405d5f96bb","year":2021},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.483847Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:3cdf7b643199b7906520a804f2dab334c430acaadc6bc3ed4a284daea7a2d647","observation_id":"9207dcfd-c897-4005-b695-294835838505","resolution":{"observed_at":"2026-08-06T22:40:25.458888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.183361Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"de4648cd-d903-4234-b914-f09e35d46e48","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.564585Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:3e066e91824f0f8cabde2a7435e6759fdec953565df1edc3475483c01155f2c8","observation_id":"1ccaa88c-f7b5-463c-9e73-d35c2edba244","resolution":{"observed_at":"2026-08-06T22:40:25.283427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.042043Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","venue":null,"work_id":"04e448dc-b318-4670-ab7a-0575fd9157f7","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.662160Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:c2eca9d539aa6234f90a6bc05f62623424461b4e83f35052b5f3804686d7e151","observation_id":"9d89d071-f55c-404f-828f-2ad97bd5aa08","resolution":{"observed_at":"2026-08-06T22:40:25.105082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:24.860454Z","title":"Unipc: A unified predictor-corrector framework for fast sampling of diffusion models","venue":null,"work_id":"096de093-a7f1-4363-89c9-a11c08cc0438","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.776671Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:aac6729b9389ddc2289c59131146d4b3b734314b85e6c13b8f094816cec11e16","observation_id":"5208c7f9-7def-4072-8b94-6218f2966c44","resolution":{"observed_at":"2026-08-06T22:40:24.924657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:24.712066Z","title":"Cross attention based style distribution for controllable person image synthesis","venue":null,"work_id":"c7a36685-6e70-43fa-bacc-0b32822b8f7d","year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.848578Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:6b44444f1071e1340ab07ea927988e1aaa7da4170932a328706b3a389f73945b","observation_id":"647fed9d-f1d4-4794-ab9e-ee636f9fe1ea","resolution":{"observed_at":"2026-08-06T22:40:24.769862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:24.566178Z","title":"Champ: Controllable and consistent human image an- imation with 3d parametric guidance","venue":null,"work_id":"de333a1f-c71f-44f7-a01d-8e8904f51197","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.917814Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:35fff51f473b4740a0f794548729a21fc8c63b0d896efaec8d5f360bc5f1a990","observation_id":"9475ba99-a852-441d-a906-d2c102ee2fdb","resolution":{"observed_at":"2026-08-06T22:40:24.624338Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":3,"verified_fuzzy":44},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2506.20983."}