{"as_of":"2026-08-14T18:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:65e46172a4ac87268f7a4b0ca159e7aad0ff756f377237888e4d3403912408a1","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:23:11.635467Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T01:56:46.514177Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:36:57.287687Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"cited_work":{"arxiv_id":"2505.19149","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19149","snapshot_observed_at":"2026-07-02T12:36:57.287687Z","title":"arXiv preprint arXiv:2505.19149 (2025)","venue":null,"work_id":"423d581e-c553-4e33-9c1e-7327ca970ea9","year":2025},"citing_paper":{"arxiv_id":"2606.05730","last_updated":"2026-06-04T05:43:24Z","snapshot_observed_at":"2026-08-12T01:13:11.149613Z","submitted_at":"2026-06-04T05:43:24Z","title":"TextWand: A Unified Framework for Scene Text Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T01:56:46.514177Z"},"links":{"cited_paper":"/paper/2505.19149","citing_paper":"/paper/2606.05730"},"observation_digest":"sha256:d860c41a95c6e49af7829b9fc240c9bb6f8b015334e9c00f0b11fde90c7328eb","observation_id":"0025a0dc-b722-4309-ab78-5eb73859901f","resolution":{"observed_at":"2026-07-02T12:36:57.289066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19149/citation-record","integrity":"/paper/2505.19149/integrity","json":"/paper/2505.19149/citation-record.json","paper":"/paper/2505.19149"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:05.290015Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.290015Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:61b7943263ae0d3042361c55a1274b34a67457581ed46d4cc347014a750254a7","observation_id":"2e6166ce-f527-4459-b734-4e4f87ae8b6e","resolution":{"observed_at":"2026-08-07T14:23:05.290015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04280","last_updated":"2025-05-06T09:56:18Z","snapshot_observed_at":"2026-08-13T15:27:11.948100Z","submitted_at":"2024-12-05T16:00:59Z","title":"HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04280","snapshot_observed_at":"2026-08-07T14:23:05.407350Z","title":"Humanedit: A high-quality human-rewarded dataset for instruction-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.407350Z"},"links":{"cited_paper":"/paper/2412.04280","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:6fd829719279cf7403c5d3a051f138f73c030627ff5ef917cd698d47b1c082d4","observation_id":"f7b4572f-e89d-450a-bb12-a64c87fed13e","resolution":{"observed_at":"2026-08-07T14:23:05.407350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:05.484280Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.484280Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:d3cc4536a86b2ca8a8413494d6e191e853c0fc8cd4e6fd4998e2273750f508fa","observation_id":"b6e93817-f659-499d-9034-4f6d70423030","resolution":{"observed_at":"2026-08-07T14:23:05.484280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:05.552410Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.552410Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:f780c6bb6a50b082d58f93b39df120e6041450a4304d68646f7eeedaf7df17d7","observation_id":"d1b14510-6aab-402a-ac90-5245746e5a62","resolution":{"observed_at":"2026-08-07T14:23:05.552410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07547","last_updated":"2024-06-11T17:59:51Z","snapshot_observed_at":"2026-08-12T23:45:15.560756Z","submitted_at":"2024-06-11T17:59:51Z","title":"Zero-shot Image Editing with Reference Imitation","version":1},"cited_work":{"arxiv_id":"2406.07547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07547","snapshot_observed_at":"2026-08-07T14:23:12.185984Z","title":"Zero-shot Image Editing with Reference Imitation","venue":"cs.CV","work_id":"46a3e6a9-bb90-4dbd-8791-49b178c68c36","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.622338Z"},"links":{"cited_paper":"/paper/2406.07547","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:45631e65d1ab0272bf90bdf61e1e04bf3f78ebf3291451b03421653d2a3c167f","observation_id":"52d020b0-924a-4840-82e2-70cde09142ac","resolution":{"observed_at":"2026-08-07T14:23:12.316270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:05.729789Z","title":"Anydoor: Zero-shot object-level image customization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.729789Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:0ac95b47df2aaf5d334e77a6d952849e8c78f11f58c98430370a27b23de5205a","observation_id":"ad20f985-a1de-444b-8ac2-69340bf30b0c","resolution":{"observed_at":"2026-08-07T14:23:05.729789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-13T23:14:46.544802Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-07T14:23:05.812424Z","title":"Region-aware text-to-image generation via hard binding and soft refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.812424Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:07f105f9cbabf2996ca4e074f89e08e357602b54f61ba67305c1b0aa26a6d5c0","observation_id":"d692a309-d3a0-4e9a-873e-1454d442229b","resolution":{"observed_at":"2026-08-07T14:23:05.812424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.371996Z","title":"Swiftbrush v2: Make your one-step diffusion model better than its teacher","venue":null,"work_id":"ec6a37ab-74c3-431f-84bf-2b867b7e3007","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.893851Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:2bb4618572b220eac62463375046e5b1c867ae9c9911bcea399897e1d4aae88f","observation_id":"bb31ca85-84df-4703-b8fa-12cece736a53","resolution":{"observed_at":"2026-08-07T14:23:13.375314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.360303Z","title":"Turboedit: Text- based image editing using few-step diffusion models","venue":null,"work_id":"ecec9054-3ece-47fa-8a2c-275abea599ca","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:05.995294Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:6cffdc4ec80b0a4033f073f09986d6cb93f852d9634d12a262224c6ee38e3eee","observation_id":"beb1240c-aab3-4b4b-9585-24117ff3a691","resolution":{"observed_at":"2026-08-07T14:23:13.364833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:06.129326Z","title":"Textcrafter: Accurately rendering multiple texts in complex visual scenes.arXiv preprint arXiv:2503.23461, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.129326Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:33ee546fb9a8b2c1b75d5a4a1b65330658e4ae0acbb1f5a56e5d0adb8479e120","observation_id":"cc29225c-ccd1-442b-a46c-3a0f1384b12e","resolution":{"observed_at":"2026-08-07T14:23:06.129326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.349570Z","title":"Complex multistep image-editing dataset, 2025","venue":null,"work_id":"49a99ae4-bc1a-44ed-b255-6172c7efb820","year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.203916Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:42a315f69f1b21d06b4c6fea5b16c8f29c7390cebc193694c3e04a309043ae4a","observation_id":"3be98bb8-76f9-43c3-ac61-cbe3ad2df277","resolution":{"observed_at":"2026-08-07T14:23:13.353470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17102","last_updated":"2024-02-05T05:04:53Z","snapshot_observed_at":"2026-08-14T09:55:58.225636Z","submitted_at":"2023-09-29T10:01:50Z","title":"Guiding Instruction-based Image Editing via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17102","snapshot_observed_at":"2026-08-07T14:23:06.307126Z","title":"Guid- ing instruction-based image editing via multimodal large language models.arXiv preprint arXiv:2309.17102, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.307126Z"},"links":{"cited_paper":"/paper/2309.17102","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:21c4b5c1288849667a35cf0edbfc382c1aeeac6b280ffdf1ffcff7d08ace3f39","observation_id":"bc80ed0c-6205-467f-a165-7c0712f4bede","resolution":{"observed_at":"2026-08-07T14:23:06.307126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:06.408275Z","title":"Renoise: Real image inversion through iterative noising","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.408275Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:d036036a7daa5ebd2d2d66f470acaa484035ce9fe2b34d289d06b531d31cfb11","observation_id":"6179cd9c-4a9f-4af8-9af2-4803e939fce2","resolution":{"observed_at":"2026-08-07T14:23:06.408275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:06.481834Z","title":"Generative adversarial nets.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.481834Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:dc43ef9fee23bdc3020b3d39cbba169ab7fdc1059ae6ff5dc87cf6b122ac9a7b","observation_id":"4fb036e1-7338-4489-b762-6b96481cbebf","resolution":{"observed_at":"2026-08-07T14:23:06.481834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04713","last_updated":"2025-03-20T00:04:47Z","snapshot_observed_at":"2026-08-12T22:06:46.476459Z","submitted_at":"2024-11-06T05:02:29Z","title":"Multi-Reward as Condition for Instruction-based Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04713","snapshot_observed_at":"2026-08-07T14:23:06.580357Z","title":"Multi- reward as condition for instruction-based image editing.arXiv preprint arXiv:2411.04713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.580357Z"},"links":{"cited_paper":"/paper/2411.04713","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:6385d4c68451bfa9fbe650181cfd8e24c2b4bd7379535c622da7d0e307ea5d1d","observation_id":"18a4508d-02b4-4113-8c94-b06b31da0179","resolution":{"observed_at":"2026-08-07T14:23:06.580357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18071","last_updated":"2024-09-26T17:18:39Z","snapshot_observed_at":"2026-08-12T22:36:42.986736Z","submitted_at":"2024-09-26T17:18:39Z","title":"FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18071","snapshot_observed_at":"2026-08-07T14:23:06.656115Z","title":"Freeedit: Mask-free reference-based image editing with multi-modal instruction.arXiv preprint arXiv:2409.18071, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.656115Z"},"links":{"cited_paper":"/paper/2409.18071","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:647c5e412099f1b3d282c441277db481f203af9ce52ca9e35bc0b1423748ae56","observation_id":"e89e5aa7-2461-4333-884d-72f237573a52","resolution":{"observed_at":"2026-08-07T14:23:06.656115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-07T14:23:06.733485Z","title":"Prompt-to-prompt image editing with cross attention control.arXiv preprint arXiv:2208.01626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.733485Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ad85023dff3a3671ee8c01e8150ab818dde3b1ff71553bd2335d5fdc583881b7","observation_id":"e34b6a98-679d-4106-b753-83c1d60c63ed","resolution":{"observed_at":"2026-08-07T14:23:06.733485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:06.825599Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.825599Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:46977945c86fce1083fe0e2d7584eebbb32271cf07c43ca451bf65cf945105e8","observation_id":"bd5d451a-9dc0-4e6b-894f-3e0d9697428b","resolution":{"observed_at":"2026-08-07T14:23:06.825599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:06.886247Z","title":"Smartedit: Exploring complex instruction- based image editing with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.886247Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:e450aaae54f84d045f06b1fcf54210593d93d2ab6adf36a5ca39622ab7ed49be","observation_id":"0b967774-43c1-4d18-b6c2-5b40dc7ce02b","resolution":{"observed_at":"2026-08-07T14:23:06.886247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.320304Z","title":"Brushnet: A plug-and-play image inpainting model with decomposed dual-branch diffusion","venue":null,"work_id":"04c384f5-0b8d-4c3e-a285-9b369f286649","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:06.997606Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:6481e49394446b6a64c7339e0557a103076a75abda2f2dc447096980898f3cef","observation_id":"fc4172b0-2a0d-4d7a-9a6a-f7500c1b3deb","resolution":{"observed_at":"2026-08-07T14:23:13.323963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13139","last_updated":"2024-07-18T03:55:33Z","snapshot_observed_at":"2026-08-12T23:19:52.504251Z","submitted_at":"2024-07-18T03:55:33Z","title":"Image Inpainting Models are Effective Tools for Instruction-guided Image Editing","version":1},"cited_work":{"arxiv_id":"2407.13139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.13139","snapshot_observed_at":"2026-08-07T14:23:11.906602Z","title":"Image Inpainting Models are Effective Tools for Instruction-guided Image Editing","venue":"cs.CV","work_id":"557ff165-151e-4ea7-83c0-cfb2d9aa2ec8","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.084405Z"},"links":{"cited_paper":"/paper/2407.13139","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:8eb67bdd3a7dbfb8da9393a61a934515266411c5bb804078f71bca6cc6780fc4","observation_id":"35adf55b-9118-4577-a2c7-70df5da76cb4","resolution":{"observed_at":"2026-08-07T14:23:11.973222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:07.148075Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.148075Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:fc4db30e25f9ae0b4408eff01d8ae8c038e7859e04811b05e43ff5bd3095f5ba","observation_id":"42379728-bd94-4049-a1bd-ee305d5d2994","resolution":{"observed_at":"2026-08-07T14:23:07.148075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:07.213831Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.213831Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:c9d89cc209e93be8918e1d68739d6777e5d3764f2d065233c21f2fab1215cfb8","observation_id":"b5cfbf33-76e4-4636-8adc-368730060563","resolution":{"observed_at":"2026-08-07T14:23:07.213831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:07.318655Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.318655Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:7ac6e74f5a7c39c3307b1614829a8d7e5714897612267cebfa10da9c0a6633ec","observation_id":"1bff09a2-e945-41c2-b4f7-5b5baacb48fd","resolution":{"observed_at":"2026-08-07T14:23:07.318655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:07.418627Z","title":"Generating images with multimodal language models.Advances in Neural Information Processing Systems, 36:21487–21506, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.418627Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:02bbe564b030cee1662f0fe5f32b3ec1d15fe4727d75dc4a0bfc3c9a514c47f6","observation_id":"7cbfeb69-1b04-4dba-b626-80087ca8934b","resolution":{"observed_at":"2026-08-07T14:23:07.418627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:23:07.470068Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.470068Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:f9aa4f8de49281bb4a78c06b1b2f4cc77c26f68882534487b65d69506e2b9dce","observation_id":"d5ff60fe-417b-4454-8ebd-7287f5e77646","resolution":{"observed_at":"2026-08-07T14:23:07.470068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22679","last_updated":"2025-05-23T08:41:50Z","snapshot_observed_at":"2026-08-07T16:29:27.502751Z","submitted_at":"2025-03-28T17:59:54Z","title":"Q-Insight: Understanding Image Quality via Visual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22679","snapshot_observed_at":"2026-08-07T14:23:07.552002Z","title":"Q-insight: Understanding image quality via visual reinforcement learning.arXiv preprint arXiv:2503.22679, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.552002Z"},"links":{"cited_paper":"/paper/2503.22679","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:658b1ac8f2d84a84890fea923e8642a234e5b312903ab3066fbc87dcd06517ed","observation_id":"6c8b85b2-4ba2-4ead-9039-fa2ec3d732cb","resolution":{"observed_at":"2026-08-07T14:23:07.552002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.288784Z","title":"Resvr: Joint rescaling and viewport rendering of omnidirectional images","venue":null,"work_id":"7e865756-320e-4501-854c-6fdd582cd17b","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.636743Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ece83b3ad1b74ea2b6f371b4b29b2f46525565a5fa5341805f7d3009299c7243","observation_id":"4eb9912e-f721-4025-97c0-40031ef509ed","resolution":{"observed_at":"2026-08-07T14:23:13.292457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09623","last_updated":"2024-12-12T18:59:56Z","snapshot_observed_at":"2026-08-11T20:08:53.557947Z","submitted_at":"2024-12-12T18:59:56Z","title":"OmniDrag: Enabling Motion Control for Omnidirectional Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09623","snapshot_observed_at":"2026-08-07T14:23:07.710615Z","title":"Omnidrag: Enabling motion control for omnidirectional image-to- video generation.arXiv preprint arXiv:2412.09623, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.710615Z"},"links":{"cited_paper":"/paper/2412.09623","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:bcbb1164a1631e30105df59cf987568a9daf37d53256f22535043e43aa5ddb2a","observation_id":"a4e84820-72e2-4453-b3ea-d26e37bf8cac","resolution":{"observed_at":"2026-08-07T14:23:07.710615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10316","last_updated":"2025-05-05T16:31:12Z","snapshot_observed_at":"2026-08-11T22:13:16.894073Z","submitted_at":"2024-12-13T17:58:06Z","title":"BrushEdit: All-In-One Image Inpainting and Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10316","snapshot_observed_at":"2026-08-07T14:23:07.789904Z","title":"Brushedit: All-in-one image inpainting and editing.arXiv preprint arXiv:2412.10316, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.789904Z"},"links":{"cited_paper":"/paper/2412.10316","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:733fde98399ff300c3cb090b419f7a60bd3b0580cfd98a21ead3ccd5dbef6b41","observation_id":"1604f9f3-00db-4a10-b30c-a40fd6fab71e","resolution":{"observed_at":"2026-08-07T14:23:07.789904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.277014Z","title":"Adversarial supervision makes layout-to-image diffusion models thrive","venue":null,"work_id":"eab63ef0-c3d1-4559-81f2-ce26a738234a","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.849807Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:126dae886c4eeab272dff825bca13649ff3514042b5f3b487eb702ecf7c3d677","observation_id":"aff9180f-e37b-4128-92cc-dfa09b296a79","resolution":{"observed_at":"2026-08-07T14:23:13.281552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.265967Z","title":"Drag your noise: Interactive point-based editing via diffusion semantic propagation","venue":null,"work_id":"03d6bb54-70e6-495d-a73c-f4487ee024c5","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.911521Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:e5273248f72bdaf39111ded04dd87ccfc3b564ae7d137c0d023e586a99e963b5","observation_id":"918830ec-ccf9-4edd-aa77-01b5b8bc6c3d","resolution":{"observed_at":"2026-08-07T14:23:13.269834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:07.989663Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:07.989663Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:71a782088324064c0ad05b28be07c21dc57233b0143fcfdd2fb617ea6321fd56","observation_id":"0216285b-ef45-4c89-9d0a-cc1b30b8f39b","resolution":{"observed_at":"2026-08-07T14:23:07.989663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-07T14:23:08.052387Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.052387Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:603bb69c08c185e953a1b8a1df1129162bc2be4c1e974744c334daea8170b258","observation_id":"f93afe6a-2e55-44bd-b5be-7f4a4feb3d03","resolution":{"observed_at":"2026-08-07T14:23:08.052387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.249329Z","title":"Magicquill: An intelligent interactive image editing system","venue":null,"work_id":"296887d6-040c-4141-bb85-319ce40c9da6","year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.111111Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ddda10c0b4ceff023aca128c40b16d6407c19ca62905a3694b2746b938fabaf7","observation_id":"b4db43ad-cf9d-489f-b737-f0535a7cf1c4","resolution":{"observed_at":"2026-08-07T14:23:13.252940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.156958Z","title":"Diffeditor: Boosting accuracy and flexibility on diffusion-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.156958Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:f45b0c6d88fc5b60bc09d71df5de6f955ded0ab57051edb5c6d493895b33ed4b","observation_id":"26de2773-2e35-41dc-80b3-1fe414a377ba","resolution":{"observed_at":"2026-08-07T14:23:08.156958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.234173Z","title":"Dragondiffusion: Enabling drag-style manipulation on diffusion models","venue":null,"work_id":"854edd22-3fa9-4859-af7a-3bc65300867b","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.216468Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ddeca40763de97e85d97706bed5590e07066a8419c8495f666c376cdbe977726","observation_id":"a1e50af1-e713-44a2-90d2-cf6413222ae1","resolution":{"observed_at":"2026-08-07T14:23:13.237351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.307630Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.307630Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:2bf4e1edbdef9fa44de0b6682a26e0abf380743e483baf1e958287d357f6079b","observation_id":"bc87defe-6221-4c52-85a4-5b9f57067a60","resolution":{"observed_at":"2026-08-07T14:23:08.307630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.218532Z","title":"Handiffuser: Text-to-image generation with realistic hand appearances","venue":null,"work_id":"dce53eb8-4c51-4508-b459-f64cc64f05c4","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.367757Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:efab0f697404dbbef64ac4a1bf029a97bba4969649e9eb040bc8ffc6ecb57271","observation_id":"709b76fe-869d-46c9-ad80-238c731b80df","resolution":{"observed_at":"2026-08-07T14:23:13.221725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-14T06:07:59.988146Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-07T14:23:08.422122Z","title":"Transfer between modalities with metaqueries.arXiv preprint arXiv:2504.06256, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.422122Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:7a661d9ca3999d1ff3ab66fad943cce5c7d11a7f98748bffe2bd171e21b10670","observation_id":"8935cc25-1e62-46ae-8909-beac8916a29e","resolution":{"observed_at":"2026-08-07T14:23:08.422122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.494940Z","title":"Drag your gan: Interactive point-based manipulation on the generative image manifold","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.494940Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:dfcc85cf8d17da6976c976d300c644a9b3fb9d69cebaab9c7cbaa767bbbb2a68","observation_id":"261e470d-a3b1-47ce-b1f6-9b32998d414a","resolution":{"observed_at":"2026-08-07T14:23:08.494940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:23:08.555573Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.555573Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:168c5969ba75de6157fa013a3ecc8354f72f6cf2b1d15d7abe63c863a2ea0d45","observation_id":"248cb43e-66ce-4cf6-8f70-34f87b5d6722","resolution":{"observed_at":"2026-08-07T14:23:08.555573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.617044Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.617044Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:53d2591b19bde9d83eccd00cbe1b09ddc9488856bd4131aee60b54be60278a14","observation_id":"1fe2ce5e-4ff4-40db-bbb9-4a029952f774","resolution":{"observed_at":"2026-08-07T14:23:08.617044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.712174Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.712174Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ab5c4b052055548b62ac7b7603ff709294cbb139ec1cecd0a82c6ba7eebf3a57","observation_id":"1266e1bc-ecbe-42e0-a468-dc2f0145448f","resolution":{"observed_at":"2026-08-07T14:23:08.712174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:08.840800Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in neural information processing systems, 35:36479–36494, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.840800Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:667b7a4e699c698e2fdb00b9f5ea6e1ec5085e357f2b3dd92a3c402a272b0b88","observation_id":"c1320835-73ca-48a9-a69c-5a5bfcbcd9c2","resolution":{"observed_at":"2026-08-07T14:23:08.840800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.176799Z","title":"Emu edit: Precise image editing via recognition and generation tasks","venue":null,"work_id":"c776b16f-2e0b-4453-ad04-84ca93075895","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:08.922371Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:75a6e7d9bede04af4ab30bced47fda7b3ec8f9c9e89157616c347c1854665385","observation_id":"9e154348-4e85-4f2d-ae28-df9b0607a3ce","resolution":{"observed_at":"2026-08-07T14:23:13.180735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:09.001818Z","title":"Dragdiffusion: Harnessing diffusion models for interactive point-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.001818Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:59c5eb93ce64f248d207cc7ebed406e243455a2919fe7c8569fe6767e43ce5e2","observation_id":"3dbd24ee-55f1-4e00-b648-d9568b50ec81","resolution":{"observed_at":"2026-08-07T14:23:09.001818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15009","last_updated":"2025-04-21T10:19:12Z","snapshot_observed_at":"2026-08-14T11:36:10.533887Z","submitted_at":"2025-04-21T10:19:12Z","title":"Insert Anything: Image Insertion via In-Context Editing in DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15009","snapshot_observed_at":"2026-08-07T14:23:09.117476Z","title":"Insert anything: Image insertion via in-context editing in dit.arXiv preprint arXiv:2504.15009, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.117476Z"},"links":{"cited_paper":"/paper/2504.15009","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:2f684d16167f340b13b352ccbff3dd5abbae6938ba2b3787da6af3c6a49c48a4","observation_id":"74a839d2-7d8f-40ea-b90e-8fc5727eed50","resolution":{"observed_at":"2026-08-07T14:23:09.117476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14539","last_updated":"2024-12-02T16:26:57Z","snapshot_observed_at":"2026-08-12T23:38:08.503435Z","submitted_at":"2024-06-20T17:49:11Z","title":"Invertible Consistency Distillation for Text-Guided Image Editing in Around 7 Steps","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14539","snapshot_observed_at":"2026-08-07T14:23:09.205192Z","title":"Invert- ible consistency distillation for text-guided image editing in around 7 steps.arXiv preprint arXiv:2406.14539, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.205192Z"},"links":{"cited_paper":"/paper/2406.14539","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:4b8ca52df8b5a74594a5fd4525805b920473966a710f6bcddbb3c89643e47822","observation_id":"38c37376-6b06-426a-9519-dd98316ca5ec","resolution":{"observed_at":"2026-08-07T14:23:09.205192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T14:23:09.297602Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.297602Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:901ec75f253b9bc91f73dc773bca66fcd47138fb222f3cbf19c00f94a5f64d96","observation_id":"1a6114cb-3d3d-428e-8ad6-c3e28434033a","resolution":{"observed_at":"2026-08-07T14:23:09.297602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:09.385434Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.385434Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:1d5b0f5fce8960080733efc21b58f0218e9210b9ffae16855f75de16b65c6afa","observation_id":"e986d506-1f5c-4c35-b9c7-24a90e475e81","resolution":{"observed_at":"2026-08-07T14:23:09.385434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T14:23:09.580072Z","title":"Metamorph: Multimodal under- standing and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.580072Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:b8aa39b9ce0a32beded8927db49b6f2a4923ed380c94a3228fb00b563cf519e7","observation_id":"f90c1bc6-8a38-4195-af3e-38350038b4a6","resolution":{"observed_at":"2026-08-07T14:23:09.580072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:09.686407Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":1921},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.686407Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:95fd9e3c1c9736a98f6b1538e74c30b00d111d3eab868a46d1e011c427e5b730","observation_id":"40030a32-4388-47ac-be64-d4212c2b8a14","resolution":{"observed_at":"2026-08-07T14:23:09.686407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12429","last_updated":"2025-07-12T14:38:31Z","snapshot_observed_at":"2026-08-12T22:59:15.347062Z","submitted_at":"2024-08-22T14:22:07Z","title":"FlexEdit: Marrying Free-Shape Masks to VLLM for Flexible Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12429","snapshot_observed_at":"2026-08-07T14:23:09.768033Z","title":"Flexedit: Marrying free-shape masks to vllm for flexible image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.768033Z"},"links":{"cited_paper":"/paper/2408.12429","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:6cfa3e74fddae29f77343d9e7df376d688f4dde37d0174b9509962489ca1509f","observation_id":"94e5fa03-dff7-4e81-bb65-58b861e3ee4b","resolution":{"observed_at":"2026-08-07T14:23:09.768033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:09.890616Z","title":"360dvd: Controllable panorama video generation with 360-degree video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:09.890616Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:1c16cafc81acfefb3e2fcce1c366cb419c31a7768df40eecc0fc7b828c020b30","observation_id":"850fd77c-bdfc-4d80-bbda-a51ff526850d","resolution":{"observed_at":"2026-08-07T14:23:09.890616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T14:23:10.024028Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.024028Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:41471b058087e82545b5bfb39b03612a662881601f95385c7105dfc3cf2b40db","observation_id":"3206f2f9-55c5-4c1a-ba13-1b381ed42fe6","resolution":{"observed_at":"2026-08-07T14:23:10.024028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:13.140840Z","title":"In- stancediffusion: Instance-level control for image generation","venue":null,"work_id":"5bfa2145-d46e-42ba-9978-1dac60823ab9","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.133279Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:dcc21e2720a2dc8ccb28b084bc0fc4be33ffc884e073371cbeb60e50802658cb","observation_id":"d922f159-7107-48d9-afba-24819e1eeba1","resolution":{"observed_at":"2026-08-07T14:23:13.144422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:12.909521Z","title":"Genartist: Multimodal llm as an agent for unified image generation and editing.Advances in Neural Information Processing Systems, 37:128374–128395, 2024","venue":null,"work_id":"3eca1a1f-7372-433c-ab64-1d6ac213725a","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.221516Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:04a525dfbeb428ba4faba209d7ff224de9f39d448c3b0b53347c006fb5bd8d96","observation_id":"6e286aec-fcff-49d6-9e79-82842c48ebc6","resolution":{"observed_at":"2026-08-07T14:23:13.051692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:10.370380Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE transactions on image processing, 13(4):600– 612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.370380Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:c2dbbd605abd4dc65eaa730e00efc3c64120c5237ff29e8bdb141a5aecb622c0","observation_id":"1516427e-e951-4437-bea2-2cad37912ca3","resolution":{"observed_at":"2026-08-07T14:23:10.370380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:10.504956Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks.Advances in Neural Information Processing Systems, 37:69925–69975, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.504956Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:c15a81901e54b9cee008694376d73d22ab8bd91da090917985ff1e7e82b9fff2","observation_id":"57fa69e6-d237-49bf-b1a2-53afc3db4e95","resolution":{"observed_at":"2026-08-07T14:23:10.504956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T14:23:10.608892Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.608892Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:ec674c20fda266f1bbb3e89fd7eb44f8d4596210569a986529f2287a74d69e7c","observation_id":"9a5c87af-ddff-4ea1-9bcd-82103e720673","resolution":{"observed_at":"2026-08-07T14:23:10.608892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-07T14:23:10.781055Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models.arXiv preprint arXiv:2308.06721, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.781055Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:0b83c9686d16a43c73e132896922c43d860fc73dc108adf58179bf763356912b","observation_id":"d328811f-6996-4525-912b-34f4991f13f7","resolution":{"observed_at":"2026-08-07T14:23:10.781055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15738","last_updated":"2025-03-29T04:08:47Z","snapshot_observed_at":"2026-08-12T13:55:13.088452Z","submitted_at":"2024-11-24T07:02:56Z","title":"AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15738","snapshot_observed_at":"2026-08-07T14:23:10.975139Z","title":"Anyedit: Mastering unified high-quality image editing for any idea.arXiv preprint arXiv:2411.15738, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:10.975139Z"},"links":{"cited_paper":"/paper/2411.15738","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:33ca86913b12fda82909f8009d4ca577110194a3311b49459701da9342712242","observation_id":"07d7c50d-9c33-495c-96bb-081da015947a","resolution":{"observed_at":"2026-08-07T14:23:10.975139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:11.145234Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing.Advances in Neural Information Processing Systems, 36:31428–31449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:11.145234Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:f230d05ccea7e3d5c298bdeeb20711777f372ab2054bb1af2d361d999f2da59d","observation_id":"d1a5f95d-8415-4ef0-9669-7b883dcc3d10","resolution":{"observed_at":"2026-08-07T14:23:11.145234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:12.730978Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"b4b18eb5-51ff-44d5-9e1b-2d09745c7e67","year":2023},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:11.296196Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:2f8920e490f2cf10ae376b0c4fbbc02dce115dce7bdf2a0c45ad74c56addb351","observation_id":"3abffb1d-1c68-472d-97e3-a1aa62985ec2","resolution":{"observed_at":"2026-08-07T14:23:12.809196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:11.402858Z","title":"The unrea- sonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:11.402858Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:b6aa909722741dd31491a32b0ea0839a339063dc939c8719ae9831aafa150be8","observation_id":"f58d4b08-9b8a-4631-973f-5bfe97a10850","resolution":{"observed_at":"2026-08-07T14:23:11.402858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07206","last_updated":"2024-04-10T17:59:59Z","snapshot_observed_at":"2026-08-13T00:33:11.789785Z","submitted_at":"2024-04-10T17:59:59Z","title":"GoodDrag: Towards Good Practices for Drag Editing with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07206","snapshot_observed_at":"2026-08-07T14:23:11.514069Z","title":"Gooddrag: Towards good practices for drag editing with diffusion models.arXiv preprint arXiv:2404.07206, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:11.514069Z"},"links":{"cited_paper":"/paper/2404.07206","citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:b22917ce9ec212d3364f5beddbee41648e13c9fc18120191037781b35fb8a4a9","observation_id":"c353a799-e1be-4c50-8eb6-d00667549de2","resolution":{"observed_at":"2026-08-07T14:23:11.514069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:12.487590Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale.Advances in Neural Information Processing Systems, 37:3058–3093, 2024","venue":null,"work_id":"aabc020c-ed05-4ac9-b449-7c0887d4a0d4","year":2024},"citing_paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:11.635467Z"},"links":{"citing_paper":"/paper/2505.19149"},"observation_digest":"sha256:6f5de1e01376797d855c48711fc835971b4b222ff4c905a2e138b2b96b0750e8","observation_id":"c66d4d9f-6be9-41e9-8238-2925bfbf133b","resolution":{"observed_at":"2026-08-07T14:23:12.600148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19149","last_updated":"2025-05-25T13:54:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T04:06:21.441586Z","submitted_at":"2025-05-25T13:54:31Z","title":"MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2505.19149."}