{"as_of":"2026-08-09T09:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00ec76961ea0d6694fb2017c8712230d2f7b4e8bc24df0f13cdab528c2101334","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:50:24.501854Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:49:51.397457Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-07-31T21:11:02.534986Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T22:47:50.355642Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2302.08453"},"observation_digest":"sha256:886a9c9de464f051ebfee2ae7cd53d9a8a7a7d67ffc68078f86f92c78a5cdfca","observation_id":"12b77970-2e47-4e10-8810-1350c663fd79","resolution":{"observed_at":"2026-05-16T22:47:50.430263Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T20:39:15.388881Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2302.12192"},"observation_digest":"sha256:edfafed8617d6584051668b71596c8e415c980b21a69c8cee2d15f3caa8f0aeb","observation_id":"03d7455a-2e79-435a-a75f-e7352e86d6e4","resolution":{"observed_at":"2026-05-14T20:39:15.444332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:22:03.530707Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2307.01952"},"observation_digest":"sha256:f7db58442c7bf24ab60a46489e37cc0a549ef455c93733449fbc884a5a44e9b0","observation_id":"f64a06d5-6647-456a-8712-649871df1292","resolution":{"observed_at":"2026-05-10T15:22:03.643258Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T19:43:03.310237Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2403.05135"},"observation_digest":"sha256:bf87f6fc3d782648031f46aad8d6cc5d639a1db1da8fcdf893eb3ea9977eb1bc","observation_id":"08251f48-e2f4-4cd0-b116-da77f07a7353","resolution":{"observed_at":"2026-05-11T19:43:03.508187Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-08T21:50:24.501854Z","title":"E., and Wang, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04725","last_updated":"2025-02-07T07:49:37Z","snapshot_observed_at":"2026-08-08T21:40:08.779592Z","submitted_at":"2025-02-07T07:49:37Z","title":"Can Diffusion Models Learn Hidden Inter-Feature Rules Behind Images?","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T21:50:24.501854Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2502.04725"},"observation_digest":"sha256:dd5e275a3a20562ff2a21c713ce2c570ae5b34e7a47137bf389745d6d74ecce2","observation_id":"f8c9b250-409e-4f77-baa8-6591071904bf","resolution":{"observed_at":"2026-08-08T21:50:24.501854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-08T18:13:21.090251Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07814","last_updated":"2025-02-09T02:05:33Z","snapshot_observed_at":"2026-08-09T05:56:52.369509Z","submitted_at":"2025-02-09T02:05:33Z","title":"Satellite Observations Guided Diffusion Model for Accurate Meteorological States at Arbitrary Resolution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T18:13:21.090251Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2502.07814"},"observation_digest":"sha256:1cb3d9cae33433bbdce07c7da7a22ad60907e99bb0a96548abf74e30be4af1ac","observation_id":"2c3b8f5f-f591-4ed8-b67e-98338517af75","resolution":{"observed_at":"2026-08-08T18:13:21.090251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2505.19261","last_updated":"2026-04-14T06:42:51Z","snapshot_observed_at":"2026-08-03T06:08:58.835346Z","submitted_at":"2025-05-25T18:33:05Z","title":"Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T13:19:20.215467Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2505.19261"},"observation_digest":"sha256:0a8a4db480daaa7f420ffd22532cf13464a69030416e6e14b42ebbc3449ee5f2","observation_id":"4fcc6343-5cbe-4d4d-a45e-68ea7c3543f2","resolution":{"observed_at":"2026-05-19T13:22:19.224983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-07T13:31:05.077080Z","title":"E., and Wang, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.077080Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:2db4d4260514918a8d5e2a83bbd11d24c7a0564d43e8a2b9ab864f4b05d4c01c","observation_id":"79a09370-420d-4963-980c-b96913185d79","resolution":{"observed_at":"2026-08-07T13:31:05.077080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-07T05:30:26.985271Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07963","last_updated":"2025-09-08T14:31:08Z","snapshot_observed_at":"2026-08-07T20:38:55.415021Z","submitted_at":"2025-06-09T17:38:45Z","title":"SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:26.985271Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2506.07963"},"observation_digest":"sha256:8a5166315b348003deb3cc5c72e04dec543162367be6c91c20c5cc3731c5c350","observation_id":"c05877b1-550a-4e8b-b27c-de10ba4401f1","resolution":{"observed_at":"2026-08-07T05:30:26.985271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-07T05:25:44.086087Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07977","last_updated":"2025-06-26T15:47:09Z","snapshot_observed_at":"2026-08-08T13:17:27.662964Z","submitted_at":"2025-06-09T17:50:21Z","title":"OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:44.086087Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2506.07977"},"observation_digest":"sha256:78ee3e6dc8fa34272f5203d064dd49cba194408dca7006b7f9c329667e312500","observation_id":"ec9d9ce4-a2f7-453e-9788-e540916e9461","resolution":{"observed_at":"2026-08-07T05:25:44.086087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-06T21:13:22.102907Z","title":"E., Wang, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00789","last_updated":"2025-07-01T14:24:40Z","snapshot_observed_at":"2026-08-08T22:46:43.415537Z","submitted_at":"2025-07-01T14:24:40Z","title":"OptiPrune: Boosting Prompt-Image Consistency with Attention-Guided Noise and Dynamic Token Selection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:22.102907Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2507.00789"},"observation_digest":"sha256:beec966aa956c5ef3fb41e320314aa386b87770854a0cedec2d871804c92bd65","observation_id":"254b1dfa-35f1-42af-af37-2c3e8e2818c2","resolution":{"observed_at":"2026-08-06T21:13:22.102907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-06T18:55:23.823563Z","title":"arXiv preprint arXiv:2212.05032 (2022) 12 Ziyue Liu, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07079","last_updated":"2025-07-09T17:38:40Z","snapshot_observed_at":"2026-08-06T18:45:43.530530Z","submitted_at":"2025-07-09T17:38:40Z","title":"Evaluating Attribute Confusion in Fashion Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:23.823563Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2507.07079"},"observation_digest":"sha256:9e007d3f09f8890aa5b0c7c93cd9710fc6c1b083e0a3b255c2d9b1ca94744d78","observation_id":"910a207f-826a-4990-90d8-f8bffb49c91d","resolution":{"observed_at":"2026-08-06T18:55:23.823563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-06T14:45:53.226664Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis.arXiv preprint arXiv:2212.05032, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17853","last_updated":"2026-06-21T15:14:16Z","snapshot_observed_at":"2026-08-07T20:37:21.945333Z","submitted_at":"2025-07-23T18:20:46Z","title":"Detail++: Training-Free Detail Enhancer for T2I Diffusion Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:53.226664Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2507.17853"},"observation_digest":"sha256:a69343b2922d035fde7a0c3f1120f9da587c4c17158c517f94534ab3c3c83f4a","observation_id":"5bf26e0c-da6a-4b97-b6fc-59d294063c49","resolution":{"observed_at":"2026-08-06T14:45:53.226664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-05T18:37:18.483602Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.14441","last_updated":"2025-08-20T05:53:05Z","snapshot_observed_at":"2026-08-05T18:37:15.366913Z","submitted_at":"2025-08-20T05:53:05Z","title":"FBI: Learning Dexterous In-hand Manipulation with Dynamic Visuotactile Shortcut Policy","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T18:37:18.483602Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2508.14441"},"observation_digest":"sha256:35d5adf2b179b074c22cd75f419c3e35fc241aebb35220432565897dca1d3d5b","observation_id":"63e829e3-2992-4464-ab35-766b68529948","resolution":{"observed_at":"2026-08-05T18:37:18.483602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-04T18:48:03.650851Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis.arXiv preprint arXiv:2212.05032, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.650851Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:f814a166f9bb33b0a697e316298f8e3cee21e9affa45fac558d97927bc921443","observation_id":"0f6fadec-312e-44c2-b44d-623bec1bce2f","resolution":{"observed_at":"2026-08-04T18:48:03.650851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2509.17458","last_updated":"2026-04-11T12:35:18Z","snapshot_observed_at":"2026-07-06T22:30:26.679189Z","submitted_at":"2025-09-22T07:51:28Z","title":"CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T15:25:39.116881Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2509.17458"},"observation_digest":"sha256:d012b09610cfb642f24bb7c5c832f45db651b087b8c827e14a13bf9f888d5bea","observation_id":"65d00cb5-e0c5-48f8-8a42-d7790a24b1e8","resolution":{"observed_at":"2026-05-18T15:26:33.623984Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2510.20206","last_updated":"2026-05-14T08:53:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-23T04:45:09Z","title":"RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T05:13:42.934115Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2510.20206"},"observation_digest":"sha256:92f0051782c187b24e7bcb1f4f8d52aa855e3ccc669b59f9aaf4bf1bcc050496","observation_id":"fccdcaf9-d61a-4c48-9fdb-cd71446bcd66","resolution":{"observed_at":"2026-05-18T05:15:54.449073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2604.05906","last_updated":"2026-04-07T14:09:00Z","snapshot_observed_at":"2026-08-07T17:46:47.345301Z","submitted_at":"2026-04-07T14:09:00Z","title":"Selective Aggregation of Attention Maps Improves Diffusion-Based Visual Interpretation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:51.134397Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2604.05906"},"observation_digest":"sha256:c86988718a014ca0943fe774268b74f7a1609bfb6227d424f83f88f9a247b6cf","observation_id":"29bd5041-5fe9-428f-8ea7-eef7d831e913","resolution":{"observed_at":"2026-05-10T23:15:47.688792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.06512","last_updated":"2026-05-07T16:22:21Z","snapshot_observed_at":"2026-08-06T15:29:49.526058Z","submitted_at":"2026-05-07T16:22:21Z","title":"DCR: Counterfactual Attractor Guidance for Rare Compositional Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T13:06:56.964670Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.06512"},"observation_digest":"sha256:fa8262010f3fa66c118104ab3fe8d0ac16ff7d80deec50f97f1462bc24aedb1d","observation_id":"ee364f6f-b42c-4b45-a243-30a18657619f","resolution":{"observed_at":"2026-05-11T19:01:10.626417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.07253","last_updated":"2026-05-08T05:22:24Z","snapshot_observed_at":"2026-08-05T15:36:41.937660Z","submitted_at":"2026-05-08T05:22:24Z","title":"LENS: Low-Frequency Eigen Noise Shaping for Efficient Diffusion Sampling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T01:43:15.520788Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.07253"},"observation_digest":"sha256:bdf1f36ab708760884d4ebe879fa811fd81501083b96e8f24e65d16576928376","observation_id":"5bb50145-cb64-4d02-a65e-017ff25f18d9","resolution":{"observed_at":"2026-05-11T01:45:51.123178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.09313","last_updated":"2026-06-16T05:24:37Z","snapshot_observed_at":"2026-08-08T23:21:56.577406Z","submitted_at":"2026-05-10T04:14:07Z","title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:18:26.883899Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.09313"},"observation_digest":"sha256:618e92ada0d750ecff8242dd0d7e3e479d2fd4d3fc25c8bfbad1462ce6784e0d","observation_id":"8cc69159-6958-435c-8f6c-388ec1df9ca1","resolution":{"observed_at":"2026-05-12T06:26:24.090203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.09313","last_updated":"2026-06-16T05:24:37Z","snapshot_observed_at":"2026-08-08T23:21:56.577406Z","submitted_at":"2026-05-10T04:14:07Z","title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T05:59:16.233848Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.09313"},"observation_digest":"sha256:1b4f5e8f5f27dc0de1416f8c7ea39d8c3b4adad03137226b64f8427e167f7894","observation_id":"c3f8729d-82b8-4f29-a105-a87cb7167e34","resolution":{"observed_at":"2026-05-13T06:02:23.306839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.09313","last_updated":"2026-06-16T05:24:37Z","snapshot_observed_at":"2026-08-08T23:21:56.577406Z","submitted_at":"2026-05-10T04:14:07Z","title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T22:47:11.360530Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.09313"},"observation_digest":"sha256:020c93b46080f7b39436d32187e2ab77598f6a00a2d0116df62f5f3612976f3e","observation_id":"47b60213-96fa-4d80-ab69-5dfafd005419","resolution":{"observed_at":"2026-07-01T13:45:46.114494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.14988","last_updated":"2026-05-14T15:50:25Z","snapshot_observed_at":"2026-07-06T23:26:23.179482Z","submitted_at":"2026-05-14T15:50:25Z","title":"Compositional Video Generation via Inference-Time Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T21:33:27.227307Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.14988"},"observation_digest":"sha256:73bdb210a0ee9917d9fa6de2b2d4ba01e164c609923e4075184bd508335abd5a","observation_id":"d648d496-52c2-45c1-ab5a-33079e3428c2","resolution":{"observed_at":"2026-06-30T21:35:04.306183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.19750","last_updated":"2026-05-19T12:18:15Z","snapshot_observed_at":"2026-07-06T23:30:25.609722Z","submitted_at":"2026-05-19T12:18:15Z","title":"CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T07:01:01.427273Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.19750"},"observation_digest":"sha256:69836daae2b4baab6b7b4fb87c9b5b1f3ae9a1f94220f1ce891344f757b43a35","observation_id":"720ae636-c248-4476-93c7-f3337a2457d0","resolution":{"observed_at":"2026-05-20T07:03:06.228228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.21466","last_updated":"2026-06-30T17:59:52Z","snapshot_observed_at":"2026-08-02T01:16:29.352385Z","submitted_at":"2026-05-20T17:52:10Z","title":"StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T04:53:55.386923Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.21466"},"observation_digest":"sha256:61d5f11926b98e27d13a50635e6cebcc2202fd70834e33991300aaff8da51bac","observation_id":"782b6b6a-8fde-47f8-8e3b-18af6c844fca","resolution":{"observed_at":"2026-05-21T04:53:57.664463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.21466","last_updated":"2026-06-30T17:59:52Z","snapshot_observed_at":"2026-08-02T01:16:29.352385Z","submitted_at":"2026-05-20T17:52:10Z","title":"StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T07:49:06.391436Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.21466"},"observation_digest":"sha256:4a4a2df7908816bd26c33be362378de08fc4d9f170d3e0ae770700a6daa9070a","observation_id":"304ea553-bb51-4421-b1b6-5591912f833b","resolution":{"observed_at":"2026-07-01T07:55:30.883532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.23178","last_updated":"2026-05-22T02:56:34Z","snapshot_observed_at":"2026-08-01T22:25:10.209018Z","submitted_at":"2026-05-22T02:56:34Z","title":"Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-25T05:07:14.227821Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.23178"},"observation_digest":"sha256:301e4b6c8d63f816c5601931d7261aa83e957d1a588d40d70654fb0a052e594a","observation_id":"b2d2d9a4-d7f0-41bd-9b4d-34c4207bfcc6","resolution":{"observed_at":"2026-05-25T05:10:22.311115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2606.07568","last_updated":"2026-05-26T02:19:47Z","snapshot_observed_at":"2026-07-06T23:47:10.030985Z","submitted_at":"2026-05-26T02:19:47Z","title":"A Systematic Study of Behavioral Cloning for Scientific Data Annotation","version":1},"reference_index":248,"source":"arxiv_source","source_observed_at":"2026-06-29T16:23:08.402194Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2606.07568"},"observation_digest":"sha256:b028e5047f8136160b75cdcd8b3bb04ae892e943183350ad5127294756c94836","observation_id":"5760107d-dd91-4e26-b3ac-12b0b44a9b92","resolution":{"observed_at":"2026-06-29T16:23:39.138875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2606.10653","last_updated":"2026-06-09T09:59:09Z","snapshot_observed_at":"2026-08-06T15:56:56.098774Z","submitted_at":"2026-06-09T09:59:09Z","title":"STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T13:50:32.005383Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2606.10653"},"observation_digest":"sha256:2e2e5659d464008d1dc13746df5e3576371afa873b801715e9f542a3c0fd40ea","observation_id":"105303c1-30a3-4a3c-a992-5fe208e33fcb","resolution":{"observed_at":"2026-07-03T04:37:36.511852Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2606.27377","last_updated":"2026-07-07T04:28:57Z","snapshot_observed_at":"2026-08-04T22:03:39.582837Z","submitted_at":"2026-06-25T17:59:58Z","title":"DanceOPD: On-Policy Generative Field Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T04:55:42.018348Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2606.27377"},"observation_digest":"sha256:bb6e00ac36f8f5f5ea20362d9f437d2b7b5860b3ffb88c71eaa10ae625e21099","observation_id":"f69efa5a-cb66-4c16-b4a6-3b3890fddd85","resolution":{"observed_at":"2026-07-04T13:49:51.398979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-12T11:44:54.717393Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27377","last_updated":"2026-07-07T04:28:57Z","snapshot_observed_at":"2026-08-04T22:03:39.582837Z","submitted_at":"2026-06-25T17:59:58Z","title":"DanceOPD: On-Policy Generative Field Distillation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T11:44:54.717393Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2606.27377"},"observation_digest":"sha256:1a4d0b3e59e73440d13980ed2dc6fce6589d312cf33a0cc383cece95629cc495","observation_id":"d94b44ea-a8d8-4d31-b04b-70f4329ba23d","resolution":{"observed_at":"2026-07-12T11:44:54.717393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-11T19:17:19.634242Z","title":"arXiv preprint arXiv:2212.05032 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04423","last_updated":"2026-07-07T07:27:22Z","snapshot_observed_at":"2026-08-04T06:57:07.480777Z","submitted_at":"2026-07-05T17:33:59Z","title":"Transferability Between Understanding and Generation in Unified Multimodal Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:19.634242Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2607.04423"},"observation_digest":"sha256:924053a2d05ffd3ef10e0856b8c1cd3679e854a2b4c6bb555b90ae815aa12af9","observation_id":"afde7bb3-2214-4971-ae5b-b145f454a45c","resolution":{"observed_at":"2026-07-11T19:17:19.634242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-02T13:55:30.481624Z","title":"E., and Wang, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-09T05:48:09.715821Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.481624Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:e503254c6663ad53a21a7ef5af0f09ba192ebbf6eb2988d95e1d83d3b1da7052","observation_id":"339b0c4a-a215-44da-a5ab-bdcf8ee4323e","resolution":{"observed_at":"2026-08-02T13:55:30.481624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-30T23:29:03.384400Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26706","last_updated":"2026-07-29T09:52:20Z","snapshot_observed_at":"2026-08-06T05:32:25.395391Z","submitted_at":"2026-07-29T09:52:20Z","title":"TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-30T23:29:03.384400Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2607.26706"},"observation_digest":"sha256:19152b3ba5d4ce61123c2a00248d4e43e1887a04e103512db49f921d919ce394","observation_id":"addfe0cf-821c-4bd2-81bf-bb8f86ce90d6","resolution":{"observed_at":"2026-07-30T23:29:03.384400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.05032/citation-record","integrity":"/paper/2212.05032/integrity","json":"/paper/2212.05032/citation-record.json","paper":"/paper/2212.05032"},"outbound":[],"paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2212.05032."}