{"as_of":"2026-08-09T18:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a4f6ee57133fea8dad31e3ec7e21ee219842a3bcb64ea51b5c30a9f0b426f5f6","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:35:54.220222Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:47:22.111357Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:36:27.320514Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"cited_work":{"arxiv_id":"2507.02321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02321","snapshot_observed_at":"2026-07-02T02:36:27.320514Z","title":"Heeding the inner voice: Aligning controlnet training via intermediate features feedback.arXiv preprint arXiv:2507.02321, 2025","venue":null,"work_id":"1da80e8f-e359-46a5-a7a6-9a5762a088d5","year":2025},"citing_paper":{"arxiv_id":"2606.04107","last_updated":"2026-06-02T18:11:20Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-02T18:11:20Z","title":"Reflection Separation from a Single Image via Joint Latent Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T10:47:22.111357Z"},"links":{"cited_paper":"/paper/2507.02321","citing_paper":"/paper/2606.04107"},"observation_digest":"sha256:61d4f1302aafb68a50f66eba72d7f820781eb2633ff37fccd411536c0fe8d257","observation_id":"b68a331c-fa61-4122-9cf5-aa4253609438","resolution":{"observed_at":"2026-07-02T02:36:27.322218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02321/citation-record","integrity":"/paper/2507.02321/integrity","json":"/paper/2507.02321/citation-record.json","paper":"/paper/2507.02321"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:58.737199Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"adb7d0f9-3419-4ac9-bab6-b55e5c7eeba0","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.477443Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:b68395c66f00310f4a243724916a0e9d333004bd3847bb1eb7f77f871b5a8c65","observation_id":"36a3d54b-6f99-4e8c-b0f2-0c7b77895d91","resolution":{"observed_at":"2026-08-06T20:35:58.842070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:49.524548Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.524548Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:8f1b0b2344277556ad5f024446de48cf4061c76779dc2ddae9337cbe93b5622b","observation_id":"6b4632af-188b-4b6f-b8d6-efe4715ade8f","resolution":{"observed_at":"2026-08-06T20:35:49.524548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-06T20:35:49.586081Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.586081Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:a92cd476e85919096d4a1e5ecbe093497e5b2b78829f59df9a144d1bc7208f61","observation_id":"e0a103da-e02b-400c-ba1c-708af90c3546","resolution":{"observed_at":"2026-08-06T20:35:49.586081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:58.527443Z","title":"ControlNet++: Improving Conditional Controls with Efficient Consistency Feedback: Project Page: liming-ai","venue":null,"work_id":"cc6ac0b2-828d-496b-8c5a-298b2dcf35b9","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.652254Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:051ca1371374a79b2d32577a344e3ec4f9ed570e29e3bfba128571ed00cbc09a","observation_id":"4c81f357-ae0e-49e4-a19f-be14bea1fbeb","resolution":{"observed_at":"2026-08-06T20:35:58.619017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11236","last_updated":"2025-03-19T14:41:25Z","snapshot_observed_at":"2026-08-09T05:20:50.057654Z","submitted_at":"2024-10-15T03:43:51Z","title":"Ctrl-U: Robust Conditional Image Generation via Uncertainty-aware Reward Modeling","version":3},"cited_work":{"arxiv_id":"2410.11236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11236","snapshot_observed_at":"2026-08-06T20:35:54.839506Z","title":"Ctrl-U: Robust Conditional Image Generation via Uncertainty-aware Reward Modeling","venue":"cs.CV","work_id":"e8233f1f-2c33-4ae9-ab10-b372a9a252ad","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.706128Z"},"links":{"cited_paper":"/paper/2410.11236","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:50c204415b98d52fc91abbf370227e1bb125a796caee3f544be630311ef7a312","observation_id":"343056b2-3b41-451d-8cbe-ae0710410cc6","resolution":{"observed_at":"2026-08-06T20:35:54.913613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:49.790142Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.790142Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:c0825974ec354c70a40d2de56a4b9e382fd82abc84e14d1d6474e2130d4e6c53","observation_id":"af2b2fa6-d007-47b9-a69e-66ffdac07626","resolution":{"observed_at":"2026-08-06T20:35:49.790142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T20:35:49.863663Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.863663Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:343e69c50eac0c1ad443b4683d0a81666eb2a50b47624a97d8a2c077ffb5fa73","observation_id":"5971fe87-45e3-4af1-bc62-fa56c7f15b22","resolution":{"observed_at":"2026-08-06T20:35:49.863663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:49.935106Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.935106Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:5390568d0be2d6031d6ab6b467bb9ea07423a523a0f758d8ff2e1ab5b5bf2d24","observation_id":"7c13a7d1-7fab-4a90-9b76-7ca08dfe365e","resolution":{"observed_at":"2026-08-06T20:35:49.935106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:58.328486Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":"3a762d7d-e30a-4163-a825-f8a3d015b823","year":2015},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.076470Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:f70f2ca044d0644a068bf4ff2ffcc42620f9584323f5eb3f2528e9e42d5ea3c4","observation_id":"fa84931d-d19a-432b-990e-8b9f831d1107","resolution":{"observed_at":"2026-08-06T20:35:58.409609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-06T20:35:50.202595Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.202595Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:9b48678ab218f90f6f5f006158dc37916a61e037dffd46c0495e07276ff53871","observation_id":"5a81e00c-8471-42b8-b936-7ef4c26b2f01","resolution":{"observed_at":"2026-08-06T20:35:50.202595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:58.115790Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"d64b943e-8794-4eaf-873a-fc7b667588d6","year":2021},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.305528Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:1ebbd21c477692efa778ece8890f30efafae81937cdab98f07428b8df1de0a2d","observation_id":"b918a55e-1b70-4f23-acc5-b278d5d8856e","resolution":{"observed_at":"2026-08-06T20:35:58.207271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:50.417376Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.417376Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:efb0c39a962761fe4b85c53839ef72a0071ed6d8bfba7c17aa4710652605101d","observation_id":"6fa6221d-33d1-4be7-8655-ef56f987d737","resolution":{"observed_at":"2026-08-06T20:35:50.417376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.948175Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"ffbb122a-b3d8-44fe-b73d-6243b82f57cb","year":2022},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.552056Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:64d1b7f59788febe4d0f2a57a07b349468caac5cf8027f9c2294bbcf0d9cf966","observation_id":"54958643-4533-43aa-aa33-179d7f9fd828","resolution":{"observed_at":"2026-08-06T20:35:58.002866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T20:35:50.644902Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.644902Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:361190c97f2db803cbcf326e796abac8a8c323d3c8d46a08da5205b8f76ef6e0","observation_id":"b08804e5-8ff5-4084-b159-68d3b0b1c927","resolution":{"observed_at":"2026-08-06T20:35:50.644902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T20:35:50.758018Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.758018Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:a06116a9fc52ad82cdcbb653591deb1562428a540127c68f6f2fa2e89be0bcd7","observation_id":"18b9f45e-8175-4f4a-b3e3-4a13efa3c54d","resolution":{"observed_at":"2026-08-06T20:35:50.758018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.752714Z","title":"Cocktail: Mixing multi-modality control for text-conditional image generation","venue":null,"work_id":"7bd91d11-40bd-47f0-860c-f75a9c3a23e7","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.877805Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:70b00712a3081581957ea1aeb40c19538241096a115f7c2ccd57c2e014659de8","observation_id":"51876550-2700-4d03-8a44-ba567216a1d6","resolution":{"observed_at":"2026-08-06T20:35:57.831530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09778","last_updated":"2023-02-22T02:14:55Z","snapshot_observed_at":"2026-08-06T12:21:57.779550Z","submitted_at":"2023-02-20T05:48:41Z","title":"Composer: Creative and Controllable Image Synthesis with Composable Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09778","snapshot_observed_at":"2026-08-06T20:35:50.956752Z","title":"Com- poser: Creative and controllable image synthesis with composable conditions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.956752Z"},"links":{"cited_paper":"/paper/2302.09778","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:63fa5ea1c4c1b3f746e2b88c271d79735c7158fd02bfcb27d05711159df3a9e0","observation_id":"493b943d-5f7d-4e00-b84f-b779852fd43d","resolution":{"observed_at":"2026-08-06T20:35:50.956752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.571713Z","title":"ControlNet-XS: Rethinking the Control of Text-to-Image Diffusion Models as Feedback-Control Systems","venue":null,"work_id":"623040c8-8a66-4f44-8375-fd9f4aceb505","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.053687Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:c51de179a93e43c17c79a0649413dced86f83277fd754ec5e537a1357c42cf71","observation_id":"6817ac18-a19f-4c93-aef8-dabb0e74b87d","resolution":{"observed_at":"2026-08-06T20:35:57.663335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:51.164157Z","title":"Relactrl: Relevance-guided efficient control for diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.164157Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:21f04b85a6e231d67bbbc0c86217d85383d68307f44c3ee432649b44051ce86a","observation_id":"d29f8acf-1c65-4a8b-94c2-3eba77a736cc","resolution":{"observed_at":"2026-08-06T20:35:51.164157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.389659Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","venue":null,"work_id":"c56ad431-7e9f-43c0-a187-9499b02471f6","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.315400Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:762880794bd92edebde2e0b30c16a24681fc11ecac4e600e79767c519b058dd6","observation_id":"0254e3da-9d39-4408-876e-b64a853291e0","resolution":{"observed_at":"2026-08-06T20:35:57.496019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11147","last_updated":"2023-11-02T17:59:06Z","snapshot_observed_at":"2026-08-06T14:12:33.767391Z","submitted_at":"2023-05-18T17:41:34Z","title":"UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11147","snapshot_observed_at":"2026-08-06T20:35:51.439611Z","title":"Unicontrol: A unified diffusion model for controllable visual generation in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.439611Z"},"links":{"cited_paper":"/paper/2305.11147","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:40d773306c3f301eee96a65a89d1cce002ecddac302f57fbfe31bb32c3dfdec1","observation_id":"244f393a-58ff-4d2c-8f13-d54703c61389","resolution":{"observed_at":"2026-08-06T20:35:51.439611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05720","last_updated":"2023-11-04T19:22:35Z","snapshot_observed_at":"2026-08-02T13:34:52.246639Z","submitted_at":"2023-06-09T07:34:34Z","title":"Beyond Surface Statistics: Scene Representations in a Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05720","snapshot_observed_at":"2026-08-06T20:35:51.541078Z","title":"Beyond surface statistics: Scene repre- sentations in a latent diffusion model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.541078Z"},"links":{"cited_paper":"/paper/2306.05720","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:60a7f160e29338ba1d4bf214dccef3b006cd287cdbeaad19b524ecba97ed3e98","observation_id":"00051692-5970-4a13-aaa0-090f4d048241","resolution":{"observed_at":"2026-08-06T20:35:51.541078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03126","last_updated":"2022-03-16T01:35:49Z","snapshot_observed_at":"2026-08-09T05:18:58.602600Z","submitted_at":"2021-12-06T15:55:30Z","title":"Label-Efficient Semantic Segmentation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03126","snapshot_observed_at":"2026-08-06T20:35:51.657841Z","title":"Label-efficient semantic segmentation with diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.657841Z"},"links":{"cited_paper":"/paper/2112.03126","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:2deadbeeffdd205f410e7c6f5e4aeb9695a9fa3d4b466661805c761e5adb2219","observation_id":"1a33835f-19c3-4a6d-b1dc-6dfd2f29a28e","resolution":{"observed_at":"2026-08-06T20:35:51.657841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.194503Z","title":"Unsupervised semantic correspondence using stable diffusion.Advances in Neural Information Processing Systems, 36:8266–8279, 2023","venue":null,"work_id":"cd1faaf2-3b80-42f1-8545-29f98df38952","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.784491Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:6d8349fa29ef2038a50729f6056ccb73487cc9a72feedf2afb5b218ca32dfe2e","observation_id":"36b10831-eb2b-4b82-b2b1-97acb59f3dcb","resolution":{"observed_at":"2026-08-06T20:35:57.299473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.021286Z","title":"Text-to-image diffusion models are zero shot classifiers","venue":null,"work_id":"1c1d4218-9a62-42a3-be22-641b952913a2","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.910081Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:e969564d39e238713cbf4ebd4dc0d40be349303fb43cd22b1ef9ec4a9ec63682","observation_id":"89e1f53c-5f7d-4ac5-8f55-92c05ff80f58","resolution":{"observed_at":"2026-08-06T20:35:57.108219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:52.029528Z","title":"Diffusion model as representation learner","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.029528Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:d0c2c0d42b3cd5227a6de3cf2702c3acc5183dd838fbe004cf357fdbc5a3c09c","observation_id":"9c4e2dac-5861-42d8-997c-587a4266f995","resolution":{"observed_at":"2026-08-06T20:35:52.029528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:56.846525Z","title":"Denoising diffusion autoencoders are unified self-supervised learners","venue":null,"work_id":"9a4d8d34-ead5-4de9-b161-9dcedb64b7f8","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.125636Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:3fa416b957dec8c91c5f72d07b9a3263254c31a5d56c3a1cd8a796e1cf605b0d","observation_id":"a90af4f5-6b70-4224-99f0-e9025975a2df","resolution":{"observed_at":"2026-08-06T20:35:56.914753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:56.646629Z","title":"Emer- gent correspondence from image diffusion","venue":null,"work_id":"ab51ca20-4445-4b68-b1eb-8ce35c66807e","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.237269Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:b66f2fced5f5256121aed53cb336c8eeec0dd02c9ea15f0ad29a124a7c7dcaf8","observation_id":"ef68fce8-dcc5-4be5-ba3c-c8e514ffd416","resolution":{"observed_at":"2026-08-06T20:35:56.716377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.03439","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:54.497285Z","title":"Clean- DIFT: Diffusion Features without Noise","venue":null,"work_id":"6bbe334d-94ca-44f1-8ade-26ea9f0ec892","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.371377Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:27c813e508e7e58b1b2cf58d2502a29b525006e201af270af9aa8d82a801e99c","observation_id":"d0699aa1-f24e-4543-b26f-b4d04a6e09c3","resolution":{"observed_at":"2026-08-06T20:35:54.529052Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11739","last_updated":"2024-01-22T07:34:06Z","snapshot_observed_at":"2026-08-05T19:36:32.752147Z","submitted_at":"2024-01-22T07:34:06Z","title":"EmerDiff: Emerging Pixel-level Semantic Knowledge in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11739","snapshot_observed_at":"2026-08-06T20:35:52.518144Z","title":"Emerdiff: Emerg- ing pixel-level semantic knowledge in diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.518144Z"},"links":{"cited_paper":"/paper/2401.11739","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:da341aac9ecdc978896a89e983a5b707faabf31332a21423109060f262afe711","observation_id":"ef7cd397-221e-46ab-bc58-3da91cf42e11","resolution":{"observed_at":"2026-08-06T20:35:52.518144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04885","last_updated":"2022-12-08T18:38:46Z","snapshot_observed_at":"2026-08-03T15:47:47.841099Z","submitted_at":"2022-10-10T17:55:41Z","title":"What the DAAM: Interpreting Stable Diffusion Using Cross Attention","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04885","snapshot_observed_at":"2026-08-06T20:35:52.667595Z","title":"What the daam: Interpreting stable diffusion using cross attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.667595Z"},"links":{"cited_paper":"/paper/2210.04885","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:9ac7d2c7ec966270ae91bc4c1db657a5b4e3e45cb13bc0805aa401a43c771cfe","observation_id":"8f161918-5091-4ebb-b847-f32c59fa174c","resolution":{"observed_at":"2026-08-06T20:35:52.667595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:52.769170Z","title":"Your diffusion model is secretly a zero-shot classifier","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.769170Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:da881d341f3bcac7b702beeae0c25ce0660434e9e14596594c588a738b2531d0","observation_id":"470a2e14-431c-45b1-91fa-66608f9ded23","resolution":{"observed_at":"2026-08-06T20:35:52.769170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:56.395363Z","title":"Diffusiondet: Diffusion model for object detection","venue":null,"work_id":"e6e6e36b-f6c2-4af2-9ebe-be0dcad59f60","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.872598Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:a550bf2e7b71e6cbf55999aa4086ffed498dc4ee8df4b1d9417d34fdf4320d58","observation_id":"8d1b51de-11a9-42b1-afbd-6b8f53c9c2bb","resolution":{"observed_at":"2026-08-06T20:35:56.522188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:56.236238Z","title":"Readout guidance: Learning control from diffusion features","venue":null,"work_id":"37a418db-0cd4-402e-95e7-d65e280f18d7","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.975086Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:fc4a3b59765d384b8be12f9a550ce001691d1bcb2a51361b5808bd736862067a","observation_id":"660801c3-b60b-4d54-871a-aeed6e9857b7","resolution":{"observed_at":"2026-08-06T20:35:56.319310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:56.062481Z","title":"Diffusion hyperfeatures: Searching through time and space for semantic correspondence","venue":null,"work_id":"e0b21647-5740-4e4e-8e73-0e128c34fa2c","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.098606Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:5ec17e5b232387276f07627526ed3ebd881bceb31bf01e28f42eb7965abbaa03","observation_id":"bb614008-3af6-426d-87ec-9152aa2875e9","resolution":{"observed_at":"2026-08-06T20:35:56.135626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.891639Z","title":"Distillation of diffusion features for semantic correspondence","venue":null,"work_id":"d0c3002a-9eef-4718-986f-94b004452875","year":2025},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.228751Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:f402c529872585b19f59c380268218899cb2dfb73a7645d204c0608854ef8bfe","observation_id":"c2240105-1dcb-4fbb-be11-0800b15491af","resolution":{"observed_at":"2026-08-06T20:35:55.952768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09400","last_updated":"2025-03-03T12:33:49Z","snapshot_observed_at":"2026-07-06T19:32:15.226489Z","submitted_at":"2024-10-12T07:04:32Z","title":"CtrLoRA: An Extensible and Efficient Framework for Controllable Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09400","snapshot_observed_at":"2026-08-06T20:35:53.348887Z","title":"CtrLoRA: An Extensible and Efficient Framework for Controllable Image Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.348887Z"},"links":{"cited_paper":"/paper/2410.09400","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:4e031b9ff3fbc8e83832069fbf696c96e38268689970d91a84d22eaa3aed38a2","observation_id":"ab039658-8d40-4ea9-be9b-00236b98d801","resolution":{"observed_at":"2026-08-06T20:35:53.348887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.736362Z","title":"X-adapter: Adding universal compatibility of plugins for upgraded diffusion model","venue":null,"work_id":"368ef165-f2b9-41fc-8550-7e30b4ce5523","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.442872Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:c7074800709088204de85bd62418c7f8eea9717ee434e1b169450918b1a2ede0","observation_id":"b4bb6863-4f77-4ba0-aa00-7063037e838a","resolution":{"observed_at":"2026-08-06T20:35:55.803955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09967","last_updated":"2024-05-24T16:29:38Z","snapshot_observed_at":"2026-08-03T19:03:47.269374Z","submitted_at":"2024-04-15T17:45:36Z","title":"Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09967","snapshot_observed_at":"2026-08-06T20:35:53.542608Z","title":"Ctrl-adapter: An efficient and versatile framework for adapting diverse controls to any diffusion model.arXiv preprint arXiv:2404.09967, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.542608Z"},"links":{"cited_paper":"/paper/2404.09967","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:07cb713f2afbf43fb4c135861a628752ad290e8f28014a1bbc4b3594f4f79904","observation_id":"22be1095-d574-4829-91ac-756597ef4fbe","resolution":{"observed_at":"2026-08-06T20:35:53.542608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.573700Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"5628ba98-5bf2-48a7-9314-3f1f02a6d3e6","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.639869Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:794172735db46a655b6626128d5fe6a23442469ddc89de357ffd33c15a3a770d","observation_id":"7fec33fc-7041-455c-8ef4-505b94ee08a0","resolution":{"observed_at":"2026-08-06T20:35:55.660542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T20:35:53.779487Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.779487Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:90dba856163b98e429e60e75c1d1b54d13865ff4fbdec63cc7a0d7bdb8be06bc","observation_id":"e7a4a8f5-3196-4144-a030-2a1b9c8f69b7","resolution":{"observed_at":"2026-08-06T20:35:53.779487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.404438Z","title":"Vision transformers for dense prediction","venue":null,"work_id":"1580d7a5-daad-4b38-8e01-1c240c63bc37","year":2021},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.872465Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:8c2712d23b0a270a2a97af2cb1cc9ae8ce68b230f067923ba023b31aa25242ca","observation_id":"e5abe342-03dc-469b-93c5-04ee955b03dd","resolution":{"observed_at":"2026-08-06T20:35:55.467397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:54.012648Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:54.012648Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:b708955047fb01f7b841ecaba195872130617fcdc5670191d9167d9b6f346cb2","observation_id":"7634f2c2-fc5c-46a9-bbd7-2e61477a013f","resolution":{"observed_at":"2026-08-06T20:35:54.012648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.172226Z","title":"Diffusers: State-of-the-art diffusion models","venue":null,"work_id":"89173363-0db5-443a-b370-ce2e1081bdf8","year":2022},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:54.092802Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:bedadf29d59cd5ee8806eaad75fd78476f1382f960497e9f6dee443ecebbfbf0","observation_id":"0b0ae502-40eb-4ee8-8cc0-368f9b7345b0","resolution":{"observed_at":"2026-08-06T20:35:55.293274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.002746Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"bd7711fc-3e66-4330-a876-2412601bb8e7","year":2016},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:54.220222Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:c86264836ca5649a5715ae0de4428397a690fd0814f14c943da80341a7807ee3","observation_id":"38e96513-a6ba-4463-b95f-78eaba3dd035","resolution":{"observed_at":"2026-08-06T20:35:55.060581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2507.02321."}