{"as_of":"2026-08-10T09:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:755e64dfcc3a1afd1722416bbbbbdf6c1e9c3a5ec46bcb27323b9e55eeb69895","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:19:24.257877Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16240/citation-record","integrity":"/paper/2507.16240/integrity","json":"/paper/2507.16240/citation-record.json","paper":"/paper/2507.16240"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T15:19:23.901137Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.901137Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:f78d21f7ead048d10fb1186b22418d794e802083d6414fae3d23d977bb96d7a7","observation_id":"82e22da6-7af7-4216-b8cb-68f35c4886d9","resolution":{"observed_at":"2026-08-06T15:19:23.901137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.732181Z","title":null,"venue":null,"work_id":"55af5d48-bfe6-4c3d-8102-6b58e853664d","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.907126Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:9f9876cb0e9bc6bf75f536e504d3cf7c9b2574ac1179e13e2f89a74e0e285de6","observation_id":"7d1a0870-e191-4c3b-8b64-e96107903fa2","resolution":{"observed_at":"2026-08-06T15:19:25.741836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:23.913095Z","title":"Masactrl: Tuning-free mu- tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.913095Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:61e85ce53808b1c452afac5741571492a1753ed9b1191e93800be30a692cac7f","observation_id":"fe6fee38-1fc1-4cc1-b5e5-f64c74966f7d","resolution":{"observed_at":"2026-08-06T15:19:23.913095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.684331Z","title":null,"venue":null,"work_id":"e4734335-2c6a-4f0b-85e0-75d4a5357d0d","year":2022},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.921432Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:824c8ca5311ccd1bd53a0cd4a86df9ed1ea7173e02b8aa2cb5d7ef5237fe841f","observation_id":"3b863ed6-9f6e-4267-9dee-a1bea7b3ac69","resolution":{"observed_at":"2026-08-06T15:19:25.697120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.652644Z","title":"Attend-and-excite: Attention-based se- mantic guidance for text-to-image diffusion models","venue":null,"work_id":"26815e5e-e029-4d89-ba73-6d1e62916c7e","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.927577Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:9c8021411651d6eec9aa0592336afeb65c9f18df40ca95348b8599853efcd426","observation_id":"97b3ee4c-60db-4403-850d-3c4d59aa7f3b","resolution":{"observed_at":"2026-08-06T15:19:25.659950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:23.936196Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.936196Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:be857c67cd9fba47580b2730c44ab4d113fc9e48b0e29cda45a463a9d13dfe7f","observation_id":"58746ee0-3aa5-44d6-aba6-22f43eac1092","resolution":{"observed_at":"2026-08-06T15:19:23.936196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.610178Z","title":"Intern vl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"4dad56a3-625e-489a-9377-46f1536608a9","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.942285Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:aa31df728d6eda6880b250a1372eb8a87f1a73b30bdba606c855622706f0f827","observation_id":"96a8ed07-f74d-44b4-b552-fc49584b0716","resolution":{"observed_at":"2026-08-06T15:19:25.618397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.585581Z","title":"Tam- ing Transformers for High-Resolution Image Synthesis","venue":null,"work_id":"593dbc6d-b52f-4ebf-a8f8-d28e9cb27ca7","year":2021},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.948584Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:d3220e8047f5e81304d2de76ee210cd229119c1b6c884e71876be78828696307","observation_id":"bd4a5c15-87db-4a8c-aef9-6860fbff8ea5","resolution":{"observed_at":"2026-08-06T15:19:25.592095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.555856Z","title":"Scaling rec- tified flow transformers for high-resolution image synthesis","venue":null,"work_id":"a02900cb-6acd-4064-ab3f-66f4a39ab9db","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.955342Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:320e97826216281128680ef66f612dcb66871958b90b0d93b36f90b60bd217de","observation_id":"f16ef858-c072-4bf0-a1f3-15e9f967ddb5","resolution":{"observed_at":"2026-08-06T15:19:25.562607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.531847Z","title":"Focus on your instruction: Fine-grained and multi-instruction image editing by atten- tion modulation","venue":null,"work_id":"b134d11f-d541-4529-b373-b1f3cbd3ec89","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.962728Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:8514b3c70e43f2f0365dfc21b5d3c8c25cb8b9fc9a75eb3598fce424cf7bde80","observation_id":"d79e8615-81de-4136-a2e1-453e8157184d","resolution":{"observed_at":"2026-08-06T15:19:25.537902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.498050Z","title":"Prompt-to-prompt image editing with cross-attention control","venue":null,"work_id":"6074fdbd-d739-4e95-9692-7248b032c5a4","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.967636Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:0a198f6186fa144efe320a03aa212e0e6ac2575d7a66f45821e91c02c16b9e08","observation_id":"5f1fdf2c-5dc9-49a2-81ea-6a41ba5f6d95","resolution":{"observed_at":"2026-08-06T15:19:25.505743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T15:19:23.975314Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.975314Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:f15eb34faabefff75f9c7b3513e9689ffe0630cbf8f50fb1141ba573710562bc","observation_id":"4066999a-c684-4a0f-b306-d7449d211313","resolution":{"observed_at":"2026-08-06T15:19:23.975314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.468894Z","title":"An edit friendly ddpm noise space: Inversion and manipulations","venue":null,"work_id":"ca81229a-1cee-4e9d-bb03-2c0d7adaa597","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.981305Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:e5cac680e8fe82b355e2c89f6e9fb62b184437a7448a4a8de407bf1826e977a7","observation_id":"ada86dd1-736d-4b06-95f1-1fcb31f4c771","resolution":{"observed_at":"2026-08-06T15:19:25.477070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.441228Z","title":"Pnp inversion: Boosting diffusion-based editing with 3 lines of code","venue":null,"work_id":"d3680318-f2bf-41c7-85d0-10d007718723","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.987784Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:770201191b7e83803b901b173374bb9c8c9b7ee51bc72aa405a5d2895827c737","observation_id":"d86c799f-3a2d-49f0-ad32-2eae8ef5e2d4","resolution":{"observed_at":"2026-08-06T15:19:25.449443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-08-06T15:19:23.993702Z","title":"What’s in the im- age? a deep-dive into the vision of vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.993702Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:9ca61dd5edcfe6f268ff228e8f802aba9103795ef98171eaf827fa310ae8e7b4","observation_id":"42272f09-424f-4567-976e-8fde399d364d","resolution":{"observed_at":"2026-08-06T15:19:23.993702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.410870Z","title":"Diffusion models for open-vocabulary segmenta- tion","venue":null,"work_id":"4d2b7b98-a164-47a9-82f9-db279861d315","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.999720Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:941e7483d1eced7cd31206a6536e74260fa9986ffb3dd45c213e5ff8e180e1c0","observation_id":"097f2fe7-c164-4d62-83b6-09d13aae35f2","resolution":{"observed_at":"2026-08-06T15:19:25.419848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.385975Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":"4e38d26f-c917-4731-8715-c880416213ca","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.006128Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:2e8d52905570aef5c51d66505c2afe14cd1cfdf4c847e760b73b42278aad12e1","observation_id":"f6d84c08-5432-4388-b903-c5698cb01ac4","resolution":{"observed_at":"2026-08-06T15:19:25.392231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.361167Z","title":"Open-vocabulary object segmenta- tion with diffusion models","venue":null,"work_id":"75971891-d328-4b8d-a46a-56a850a04816","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.012496Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:4738760a5b4f6675db7d5170210c33590e2cc06b4668c9d92b6e0db81ff82f89","observation_id":"a5524cf3-931c-4922-804a-d7a65949e9e3","resolution":{"observed_at":"2026-08-06T15:19:25.370876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.329260Z","title":null,"venue":null,"work_id":"16c69bf6-c5ec-4fb7-853e-45ea0eb04643","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.017126Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:ed4276f69f9986378fbbf959bec6c6016847af8959cc294d0f46a3de8c4c0b97","observation_id":"1d1f865b-3ce7-4e67-b5b3-9c9fa565ce0e","resolution":{"observed_at":"2026-08-06T15:19:25.341640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02487","last_updated":"2025-01-15T13:07:56Z","snapshot_observed_at":"2026-08-09T19:19:42.836141Z","submitted_at":"2025-01-05T09:40:58Z","title":"ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02487","snapshot_observed_at":"2026-08-06T15:19:24.022111Z","title":"Ace++: Instruction- based image creation and editing via context-aware content filling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.022111Z"},"links":{"cited_paper":"/paper/2501.02487","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:a920b80a2a3a205d1ca4228840c61e322b5514bedfcdb6420a96b48953adc6f2","observation_id":"3701e39a-af9f-43a6-9586-38f2c5d8f78c","resolution":{"observed_at":"2026-08-06T15:19:24.022111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.029689Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.029689Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:eb758f6129ec2e481897811b8c54f3ee2b4db2a09bfb674d2ba738f52a3a9e76","observation_id":"cd0aa095-1217-4e07-8acc-546c199af7f4","resolution":{"observed_at":"2026-08-06T15:19:24.029689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.289681Z","title":"T2i-adapter: learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"f3cff517-8969-4a19-9072-4f44ef9bd433","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.035152Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:a04d0dfc986cc4ddd9bf413038c27dc2eb112dd38bd94514180e45e8b4fd90e5","observation_id":"f040496e-dbc1-4d1a-a091-e996500aee35","resolution":{"observed_at":"2026-08-06T15:19:25.297465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.266772Z","title":null,"venue":null,"work_id":"bd110ec3-03d1-40f7-8250-bd9ec72668a3","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.043386Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:e5816a2d40aaa74bfe1b874dc2ed67ebdd2c2ef07d6b56a7dbf50f5c346081b0","observation_id":"8500d275-4dda-4a51-a83b-76ac18f3892f","resolution":{"observed_at":"2026-08-06T15:19:25.273496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.241317Z","title":"DiffuseV AE: Efficient, controllable and high- fidelity generation from low-dimensional latents","venue":null,"work_id":"c7657b76-7d6c-4e42-89c0-c68ed3712dc7","year":2022},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.050306Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:7b78874089047e7480054827b401b929c63ae5b67484eb9cf3331055c22437af","observation_id":"0970514e-b682-4cfc-b6dc-5f74142b3d3f","resolution":{"observed_at":"2026-08-06T15:19:25.249347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.212052Z","title":"Peebles and Saining Xie","venue":null,"work_id":"ac93e881-c682-4dad-b5f1-b9ce546d8b9e","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.058975Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:931f8e1c3425d1da39f4351bf1349af41de915df16a317ba7488df9fcc8b1f5a","observation_id":"21907f3e-f9aa-4ba9-a4bc-8be1e5df7a37","resolution":{"observed_at":"2026-08-06T15:19:25.219844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.167787Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"ae4017a1-2efc-49e8-94d7-52c6436f3cda","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.067815Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:be699d9791f2a0764273928c22d72d88c29b75b52a7d39de192bd95cec2d6712","observation_id":"b1bfc2cc-a40a-4866-bd03-75deb27861a3","resolution":{"observed_at":"2026-08-06T15:19:25.186321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.129387Z","title":"Unicontrol: A unified diffusion model for controllable visual generation in the wild","venue":null,"work_id":"a103e862-36d7-4e29-b13b-086a2cc98366","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.073913Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:82b39e7a20e85447151cbf7c6bb9eaf1226f9c6a39ac67a1082bbb2f3e1410e7","observation_id":"27ae3419-6c5a-42ff-b383-2305643ffa07","resolution":{"observed_at":"2026-08-06T15:19:25.137318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.090873Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"349b124b-f44b-4ff7-a7e7-ced34de5a6e8","year":2021},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.079415Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:e7984a06eecf73fd2c3be3aec42c7d51845ca88ac7865bb47cc014d918ae22f5","observation_id":"469fd176-17d5-4835-9962-6f84226b7639","resolution":{"observed_at":"2026-08-06T15:19:25.098284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:25.035734Z","title":null,"venue":null,"work_id":"5e0dffae-a639-462b-a65d-92629cbb1d31","year":2020},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.084085Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:0395d1f658e43a71e2dc6854864c406a20d0e74e590eb5aebf216b1481969a76","observation_id":"6886e00c-110a-4705-b517-6afb3e335e1c","resolution":{"observed_at":"2026-08-06T15:19:25.042318Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.090828Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.090828Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:0f074761746d63fbcd7784041de3575aa631ff1c35612a8d76a8bd973983a371","observation_id":"421ebc2c-84f8-4970-9ca1-4e4c396c1f21","resolution":{"observed_at":"2026-08-06T15:19:24.090828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10792","last_updated":"2024-10-14T17:56:24Z","snapshot_observed_at":"2026-08-02T16:03:59.021980Z","submitted_at":"2024-10-14T17:56:24Z","title":"Semantic Image Inversion and Editing using Rectified Stochastic Differential Equations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10792","snapshot_observed_at":"2026-08-06T15:19:24.106867Z","title":"Semantic image inversion and editing using rec- tified stochastic differential equations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.106867Z"},"links":{"cited_paper":"/paper/2410.10792","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:6d67dd8ab2dc29941fc97d90c4e706f9964e9c3052db8f2a6a3a037930321f27","observation_id":"73eb8019-e0dc-4a69-a8c6-898afb802334","resolution":{"observed_at":"2026-08-06T15:19:24.106867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.961497Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"d15637a1-9ec3-46bc-8cf4-750d2aa5c066","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.114803Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:b1a78d28e87bd67d2fbc337176faddecde61635ce54cc540bbaa189095d7ecd0","observation_id":"f8f50047-6e17-4832-97e4-c01b7d63384b","resolution":{"observed_at":"2026-08-06T15:19:24.973539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.932260Z","title":"Emu edit: Precise image editing via recognition and gener- ation tasks","venue":null,"work_id":"29571617-3b72-49b7-aa82-5d75f842abac","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.122529Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:b4775b1658297b87f3fec0f2b4d7b7fa91b5a7afd56f6585842a0428417eb16b","observation_id":"63c812f5-c7a9-4169-ad91-63d03f382504","resolution":{"observed_at":"2026-08-06T15:19:24.943142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.911669Z","title":"Generative Multimodal Mod- els are In-Context Learners","venue":null,"work_id":"33e4e93c-8c70-4671-afe2-7b6f2644a4a1","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.127028Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:f5c3d692cd00ba9b8de8f22a196f4b36e17e61ceeaae9cb8b5fdf12ed7a9bc89","observation_id":"0dc44844-861b-479d-9e21-61efb79c9bb3","resolution":{"observed_at":"2026-08-06T15:19:24.916902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T15:19:24.133948Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.133948Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:4dd47985b1124996a9655439162f835d06dda83e9654b6650d42910ca2b9ae6f","observation_id":"7830b0de-7e90-4287-a571-4de59968d0a3","resolution":{"observed_at":"2026-08-06T15:19:24.133948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.881917Z","title":"Qwen2.5-vl, 2025","venue":null,"work_id":"e071430c-d564-4101-aa28-d40279d9e506","year":2025},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.141983Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:ff4e4e98f701240c61f4f71c5468c06806dc1f5954cb96572a612de166b914ad","observation_id":"defb99e8-7f5c-4709-9320-4922ace41136","resolution":{"observed_at":"2026-08-06T15:19:24.889930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21291","last_updated":"2025-07-27T05:54:21Z","snapshot_observed_at":"2026-08-09T08:06:22.574714Z","submitted_at":"2025-02-28T18:21:08Z","title":"MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21291","snapshot_observed_at":"2026-08-06T15:19:24.148030Z","title":"Mige: A unified framework for multimodal instruction-based image generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.148030Z"},"links":{"cited_paper":"/paper/2502.21291","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:69f3613a007531890c4ce094e7981fbfa8c15f75f18314fcebd5eb4f2c409c89","observation_id":"66d5f01d-cf16-449a-84dc-015b32c9b60c","resolution":{"observed_at":"2026-08-06T15:19:24.148030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.855970Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"1ae8d7c7-be94-40da-89ea-1bd1707d5c09","year":1921},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.154545Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:afd22683ec13782ad515f66bf4c9f2982f6a3942494404d6a2b685750bfecca6","observation_id":"7effc298-eb7c-4254-9f1e-e2bfdf993674","resolution":{"observed_at":"2026-08-06T15:19:24.862758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.834589Z","title":"Neural discrete representation learning","venue":null,"work_id":"5d3a30e8-39e5-4d72-8d51-e50891ef96de","year":2017},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.160838Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:18579c3073592f120bd5ae5230537d82e73b3bbaa773a4ea866e68920b507ecc","observation_id":"0b2db0eb-c4f8-4d16-9084-39298d544190","resolution":{"observed_at":"2026-08-06T15:19:24.840158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T15:19:24.166327Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.166327Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:bf0de29d8afd595802b9d6a496afb38c937c770fb1cc736f57546c028f6d73d9","observation_id":"78592b5c-cc42-430e-b650-b8b4c82c822f","resolution":{"observed_at":"2026-08-06T15:19:24.166327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T15:19:24.172573Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.172573Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:2e757cd77f4efc3735363eec7d4725455378c8699673f3a8bffc725e989be756","observation_id":"af51db51-5bb3-4eaa-9322-4323b5386b56","resolution":{"observed_at":"2026-08-06T15:19:24.172573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.806558Z","title":"Hairclipv2: Unifying hair editing via proxy feature blending","venue":null,"work_id":"436224db-a844-4b37-aa38-d114a265f894","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.177280Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:306ab10c2591c0e1a13e04d89a130efb5d129aed4398fa0b88c1f1122690a690","observation_id":"db83409d-11ae-4438-ad2f-ce4e2896f416","resolution":{"observed_at":"2026-08-06T15:19:24.814086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18301","last_updated":"2024-11-27T12:47:06Z","snapshot_observed_at":"2026-08-10T05:49:45.931325Z","submitted_at":"2024-11-27T12:47:06Z","title":"Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18301","snapshot_observed_at":"2026-08-06T15:19:24.182520Z","title":"Enhancing mmdit-based text-to-image models for similar subject generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.182520Z"},"links":{"cited_paper":"/paper/2411.18301","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:b7aedea066407210b7ec0524f9abee37183a0c5203d5b58beeba7f2a7820ed1f","observation_id":"4de35d14-f731-4746-ba70-481e00658dbf","resolution":{"observed_at":"2026-08-06T15:19:24.182520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16153","last_updated":"2025-03-20T13:55:12Z","snapshot_observed_at":"2026-08-08T15:17:51.812014Z","submitted_at":"2025-03-20T13:55:12Z","title":"FreeFlux: Understanding and Exploiting Layer-Specific Roles in RoPE-Based MMDiT for Versatile Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16153","snapshot_observed_at":"2026-08-06T15:19:24.190577Z","title":"Freeflux: Understanding and exploiting layer-specific roles in rope-based mmdit for versatile image editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.190577Z"},"links":{"cited_paper":"/paper/2503.16153","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:923110018ef40c3b206899acbbb432d0e61b76c8ed7ae326fc2d72310a04c4b6","observation_id":"a6d14d49-943c-4a8f-9043-a4b9bb487e02","resolution":{"observed_at":"2026-08-06T15:19:24.190577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.784295Z","title":"Diffumask: Synthesizing images with pixel-level annotations for semantic segmentation using dif- fusion models","venue":null,"work_id":"1a3cb9d0-5716-4406-aa29-26593d27edc6","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.196217Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:aea17a38c3bf1b8072b39161aa03c21ee57daf0b8c15609630c0b4923f118683","observation_id":"57d084f3-01eb-4f6e-acee-5fd3e93b8c5f","resolution":{"observed_at":"2026-08-06T15:19:24.790384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-06T15:19:24.201599Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.201599Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:7ebef36d4bb7775b5a5b49a4a63c93e4ef720aec75e959941ce7cd60911606dc","observation_id":"6ea76899-4891-4a1f-b045-4b18f4c644e7","resolution":{"observed_at":"2026-08-06T15:19:24.201599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.765705Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":"4288e398-2f51-4199-ae9f-3a10ad0c2630","year":2025},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.208916Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:ba597d754d7c7a3081c55e083fed1ada00a3ba15653eb8ecbff03fb43a13b59d","observation_id":"06795431-7097-48ee-9292-6642fcfa5a40","resolution":{"observed_at":"2026-08-06T15:19:24.772357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.747783Z","title":"Characteristic analysis of otsu threshold and its ap- plications","venue":null,"work_id":"6cda7014-fc61-446e-b450-ed4c19002700","year":2011},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.215130Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:6141dc590734bef538b6d4e83d0a9ef72b8a3058abc7661eac5b1bdbf335cb4f","observation_id":"41f2d3de-e58c-4b5b-93c1-a8b8110a45f7","resolution":{"observed_at":"2026-08-06T15:19:24.753503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-07-06T19:55:51.415524Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15453","snapshot_observed_at":"2026-08-06T15:19:24.219539Z","title":"Enhancing instruction-following capability of visual-language models by reducing image redundancy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.219539Z"},"links":{"cited_paper":"/paper/2411.15453","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:5acf0d0589d7df5d0dd3cce3f0810ab35dbe91c7c42d3706eec37604331c82dd","observation_id":"ba3da3bd-99a7-4c67-87fa-f21e8ebb26f3","resolution":{"observed_at":"2026-08-06T15:19:24.219539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.722182Z","title":"RoCC: Robust Covert Communication Based on Cross-Modal Information Retrieval.Journal of Im- age and Graphics, 29(2):369–381, 2024","venue":null,"work_id":"fdfadb6a-5936-42d8-8212-7f221376705a","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.225189Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:fa5707d97dfcfa2439b2425f17f9cb00dd8db5551839842a17e2ebcc248aaf87","observation_id":"bdf60ab8-15ef-4015-98c2-5c0f297e0f2b","resolution":{"observed_at":"2026-08-06T15:19:24.727379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.697080Z","title":"Peeling back the layers: Interpreting the story- telling of vit","venue":null,"work_id":"6b3f3f08-25bb-4a22-9cf7-5268a9298265","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.230896Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:1debb0306bee35a5944f928df4c07dab83ea17c1846a0195aaefe3d604bedcf6","observation_id":"3a5bce58-4e60-4502-9821-184934fb97cc","resolution":{"observed_at":"2026-08-06T15:19:24.703322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.675341Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"43f7b183-ca6f-4ca3-996f-7e2ed279975b","year":2023},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.236139Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:a94660b5f048e0f85d838418087bd3bd648a91d813be53308c5a98a82fbaf839","observation_id":"10092bef-6215-4931-971b-fe381d049155","resolution":{"observed_at":"2026-08-06T15:19:24.682925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.241243Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.241243Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:d788aa2e68268e1a3bc86f730101aaed2d0a211cfcf75249ce43d0c532ba2363","observation_id":"59d5aea2-faed-47da-b4b3-0cef14a2af6a","resolution":{"observed_at":"2026-08-06T15:19:24.241243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.636871Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":"fd4ea954-a6ea-425e-b489-a6b1bcc70d68","year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.246620Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:49ff0b5b9897e556349679e4481a847021ae9aa535651f6790c3201390ffeb85","observation_id":"849468f0-4926-4eb2-868a-6bee860082a8","resolution":{"observed_at":"2026-08-06T15:19:24.641989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.619047Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"c05cb195-3996-47a7-814f-4480daca2778","year":2019},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.251392Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:67428da9ce4b99bc1c2a13320d95064c279e7690db1c48a09a46838d7c1a1e8a","observation_id":"1a218d12-f8db-4506-8b20-9a1ce3bc723f","resolution":{"observed_at":"2026-08-06T15:19:24.624514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.600840Z","title":"graffiti","venue":null,"work_id":"9209a003-d1fc-4d7a-8148-b4590c774a3f","year":2025},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.257877Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:ba065568b14cec9ba828ae414a22dc46b19893f30336b45ea6b4c8ae58b371cf","observation_id":"c0c91d74-648f-497e-9ead-10c5fe6c2257","resolution":{"observed_at":"2026-08-06T15:19:24.607230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:24.990990Z","title":null,"venue":null,"work_id":"574ebbfd-d304-4c94-9af0-97d1862ae90b","year":null},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:24.100705Z"},"links":{"citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:0e9a7dafc95abe5194b047d69f806a822ec98e4fdc5b7dbfc32db28a8781e4c1","observation_id":"828e88a1-7c49-43a7-a490-377b6eabdc43","resolution":{"observed_at":"2026-08-06T15:19:24.997503Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T12:59:09.037479Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":23,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2507.16240."}