{"as_of":"2026-08-11T04:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:39e519d9fac4abf30a166da320038d12fbbaa34e7afc449c1c22fc1d0417dbe5","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:32:45.728129Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T21:23:41.271521Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.202513Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"cited_work":{"arxiv_id":"2507.05259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05259","snapshot_observed_at":"2026-07-03T21:28:58.202513Z","title":"arXiv preprint arXiv:2507.05259 (2025)","venue":null,"work_id":"6f512ebc-9b35-4ded-b55d-616d2c920ca6","year":2025},"citing_paper":{"arxiv_id":"2605.14842","last_updated":"2026-05-14T13:46:24Z","snapshot_observed_at":"2026-08-06T21:38:07.402815Z","submitted_at":"2026-05-14T13:46:24Z","title":"Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-30T21:41:10.852265Z"},"links":{"cited_paper":"/paper/2507.05259","citing_paper":"/paper/2605.14842"},"observation_digest":"sha256:c7e07e4f4f30f54b836978fa42b26f3a2fe5db5bdbab6e4f1fcd56469c1e7b03","observation_id":"08e9a597-8247-4eed-a14c-ebfd2a55ebd3","resolution":{"observed_at":"2026-07-01T14:25:46.032527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"cited_work":{"arxiv_id":"2507.05259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05259","snapshot_observed_at":"2026-07-03T21:28:58.202513Z","title":"arXiv preprint arXiv:2507.05259 (2025)","venue":null,"work_id":"6f512ebc-9b35-4ded-b55d-616d2c920ca6","year":2025},"citing_paper":{"arxiv_id":"2605.15181","last_updated":"2026-05-14T17:58:19Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-14T17:58:19Z","title":"From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T03:20:26.350336Z"},"links":{"cited_paper":"/paper/2507.05259","citing_paper":"/paper/2605.15181"},"observation_digest":"sha256:2673fc819a9edbc65af82c4eba55651c6a66a5df641957a8182de34cc70a9ac3","observation_id":"44bcc06e-8e42-4468-9c79-91a6a43b307e","resolution":{"observed_at":"2026-05-15T03:24:55.960331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"cited_work":{"arxiv_id":"2507.05259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05259","snapshot_observed_at":"2026-07-03T21:28:58.202513Z","title":"arXiv preprint arXiv:2507.05259 (2025)","venue":null,"work_id":"6f512ebc-9b35-4ded-b55d-616d2c920ca6","year":2025},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-03T22:17:48.449247Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-02T13:56:43.671622Z"},"links":{"cited_paper":"/paper/2507.05259","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:141d82ac33dde0c762c8ed426fb28d7c36dc65313eb5ac1fff098c959305124b","observation_id":"0d9305b3-36b3-4996-afb1-4033a09e72b7","resolution":{"observed_at":"2026-07-02T13:56:58.999655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"cited_work":{"arxiv_id":"2507.05259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05259","snapshot_observed_at":"2026-07-03T21:28:58.202513Z","title":"arXiv preprint arXiv:2507.05259 (2025)","venue":null,"work_id":"6f512ebc-9b35-4ded-b55d-616d2c920ca6","year":2025},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-03T22:17:48.449247Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-03T21:23:41.271521Z"},"links":{"cited_paper":"/paper/2507.05259","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:741a57e7951ccfe0ce5213e11f2e4d91412e91d6c2b52e515982c83fe70a632e","observation_id":"2f251400-72a3-478f-8759-2d40a7e256ca","resolution":{"observed_at":"2026-07-03T21:28:58.204585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05259/citation-record","integrity":"/paper/2507.05259/integrity","json":"/paper/2507.05259/citation-record.json","paper":"/paper/2507.05259"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:32:41.504499Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:41.504499Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:0e3f1dab2c9210b31cada599663ea2fa064c8f8bac078619847e909bafa83897","observation_id":"62264a14-dd45-428c-a896-89b51a4fa27d","resolution":{"observed_at":"2026-08-06T19:32:41.504499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-06T19:32:41.581935Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:41.581935Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:513cddeb769fe4e14b4c617c317ad46f890d966adb8ff9be29a28579d55682d5","observation_id":"97d8914f-1fc9-4174-be9a-e6bf0b986d19","resolution":{"observed_at":"2026-08-06T19:32:41.581935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.630109Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":"db014eac-1555-4a89-8d43-7149e27810d1","year":2022},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:41.654283Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:58311a59eb10eedea2aa94541e3aee0cbde8bc8ce211893e6d1ade00be7e26a1","observation_id":"557c5913-a0a4-4ad1-97ae-d7b10a672802","resolution":{"observed_at":"2026-08-06T19:32:52.634215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.618026Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"35a1d7f4-d5df-49fc-be3e-7ca85b94ab06","year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:41.724455Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:9aa4481af333a532d24a87fb1e474300aa6812ae2d0a670a7674180e53e0ee82","observation_id":"728e415b-9943-4f5d-bc5a-8e4d492585ce","resolution":{"observed_at":"2026-08-06T19:32:52.621734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.606070Z","title":"Masactrl: Tuning-free mu- tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":"808fe6ec-fb27-4be9-b725-112b2ac51467","year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:41.799394Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:5b387b4d8396c1953296b90f2a33c49408c87c3651732523f2c56ca3bcd09eac","observation_id":"0c08b3fd-12c6-4c45-b51e-ef50f0ef94e0","resolution":{"observed_at":"2026-08-06T19:32:52.609992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.593557Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":"2367c3df-54cb-4496-9d98-50dc127150be","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:41.867777Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:8e2354d20f3776b67a6516e5e24acc3e3cfdb4f12b1459995304c2d0c5553743","observation_id":"7d3d9227-5a5c-4b36-a7e7-7482dff29988","resolution":{"observed_at":"2026-08-06T19:32:52.597533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.582199Z","title":"Anydoor: Zero-shot object-level image customization","venue":null,"work_id":"28c96549-b325-4281-b64e-902b425b3dc8","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:41.960333Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:abbc1a1e17afd9090d1d4847b8e4dc19e3d4c88e82a954e7e04919b1d4aaee29","observation_id":"68654cad-5d06-4969-bf1a-6e8b09c2d2ca","resolution":{"observed_at":"2026-08-06T19:32:52.585984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.570650Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024","venue":null,"work_id":"50b782ad-e6e4-4aea-8dfd-329128ac3e6c","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.034090Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:ed14a637223dc16635daf2284e38412be86c164d8305b33d05e500530feff0c2","observation_id":"4739ab60-efb5-4809-8fbd-5a677a31261a","resolution":{"observed_at":"2026-08-06T19:32:52.574598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.559701Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"bdf131d1-da52-4221-920f-a1cf33de4c03","year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.175431Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:fd39c5e6477757d08bd5bb8121362b9d918194e1c3d2f7d78d46b5108f4a30f9","observation_id":"c40e1247-60f9-458a-af97-07ba9ed7cd95","resolution":{"observed_at":"2026-08-06T19:32:52.563014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:32:42.263803Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.263803Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:d6d9b2ec68a101e5c8d001018e2673929f655f0950168e80702229187b463399","observation_id":"e6965ab5-6ae9-4758-bcde-0a869d9fc329","resolution":{"observed_at":"2026-08-06T19:32:42.263803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17102","last_updated":"2024-02-05T05:04:53Z","snapshot_observed_at":"2026-08-10T17:08:35.592622Z","submitted_at":"2023-09-29T10:01:50Z","title":"Guiding Instruction-based Image Editing via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17102","snapshot_observed_at":"2026-08-06T19:32:42.333317Z","title":"Guiding instruction-based image editing via multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.333317Z"},"links":{"cited_paper":"/paper/2309.17102","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:eb4965baf0621e2271496323fff522ab53c6826b126a0bb9ad4520e3f7902c20","observation_id":"f36aeafc-e210-41f4-bcc3-848112e5c848","resolution":{"observed_at":"2026-08-06T19:32:42.333317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-06T19:32:42.403461Z","title":"Seed-x: Multi- modal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.403461Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:fed2f3b392d6a31052d80069ceaf1d9780b6d5078c8a7191a608570de63669e7","observation_id":"c313c0ba-7a4c-4cee-9574-23e847077de7","resolution":{"observed_at":"2026-08-06T19:32:42.403461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.548472Z","title":"Instructdiffusion: A generalist modeling in- terface for vision tasks","venue":null,"work_id":"5c3e68dc-cd6d-475e-91af-b0f03007648a","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.488032Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:2de63d152d99f9014c9806153777425e97932658d08f15779631c2b2f22b61ae","observation_id":"4fd1cad2-7a1f-443b-9afb-6a6b08c36d8f","resolution":{"observed_at":"2026-08-06T19:32:52.552034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T19:32:42.560210Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.560210Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:c4f28a75300660c4a27228d4935bf4a747cdd92f5d3a5d787ea0817f183ea3b6","observation_id":"9998cef6-2569-44a6-a791-3eed2bf3561d","resolution":{"observed_at":"2026-08-06T19:32:42.560210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.504974Z","title":"Style aligned image generation via shared at- tention","venue":null,"work_id":"7037fc7b-fc61-4214-95d2-56944f93e65f","year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.643751Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:689dc1246ea0bc25f5e883f33f6ce824e017eb583a83f6d07f0f5e23775b4c50","observation_id":"1de48d7c-4515-4862-8826-3ee2167a3db3","resolution":{"observed_at":"2026-08-06T19:32:52.539324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.456788Z","title":"Smartedit: Exploring complex instruction-based image editing with multimodal large lan- guage models","venue":null,"work_id":"1ca5637e-6f2a-48a4-a2e7-9712a9f27f26","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.733628Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:2e77e8f703fdd376ba0adec32936213d4dfc4a9459bb68796521b85e33070c90","observation_id":"ab05c0ca-e2eb-4a41-8e17-eea520fa0a83","resolution":{"observed_at":"2026-08-06T19:32:52.463945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.387790Z","title":"Pnp inversion: Boosting diffusion-based editing with 3 lines of code","venue":null,"work_id":"7c1fbd3a-ce96-4a14-a6e5-dcda42cd47f7","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.806489Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:cfd635b18ce5f862f82e7a669f9d6a3ba0c034c1c051a0aac5aec4cb2015db3d","observation_id":"1dc294f0-6dd8-4fbb-a2aa-c525f81a5961","resolution":{"observed_at":"2026-08-06T19:32:52.420779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.325792Z","title":"Noise conditional flow model for learning the super-resolution","venue":null,"work_id":"52b6c254-f547-435e-938e-02c73adbd2ca","year":2021},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.871608Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:d0c6bf732cdc78a2702d865f7ba272170e60211952664429b05555faf20ba453","observation_id":"bd2b23d6-f543-4e95-8a79-aee667858ea0","resolution":{"observed_at":"2026-08-06T19:32:52.348765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:42.963491Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:42.963491Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:0d0f7139b5a4120bdb46c8a2bd0f725a91a3402117793983039e293d2d5c3bae","observation_id":"b4867903-7034-412f-a0ae-9e36801a670d","resolution":{"observed_at":"2026-08-06T19:32:42.963491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.220848Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"0bdd2699-5ff9-4da7-946f-32677ba18ca2","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.007497Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:1e4eb1a4279458f3410c511eb5bbf540909f895d199e909e78731c341f7fedbc","observation_id":"e2ce7c9f-3096-4e2f-9f54-879be52b4233","resolution":{"observed_at":"2026-08-06T19:32:52.272762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:52.134607Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"c53ef6ec-a8ca-4b3f-99c5-4ea9409443f5","year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.100967Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:861505c93c575b52495d74f36b500d3794c6b00cbceb5f531eb653634c028a3a","observation_id":"68792403-392f-4e8d-8993-2e436b2c56be","resolution":{"observed_at":"2026-08-06T19:32:52.169380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:51.909652Z","title":"Visual instruction tuning","venue":null,"work_id":"7ee5f86f-22b6-409b-94ec-b908f1dc4a48","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.153656Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:f75fd6ce97786ef8f72453d997989baf38914c845a11a02b394e973131535801","observation_id":"21dffc6e-e9a0-49c7-93ac-ec2f8af2df35","resolution":{"observed_at":"2026-08-06T19:32:52.068895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:51.574238Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"afc325de-678f-4ecb-be33-ee5f621bf05c","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.236323Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:c78276b7906b284ad6a65cb3cace7d665bbf21194dff968ecacf707377cdea2f","observation_id":"a16ef5aa-00a3-4bff-bcca-3c31ac7cc9b7","resolution":{"observed_at":"2026-08-06T19:32:51.735645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:51.321213Z","title":"Repaint: Inpainting us- ing denoising diffusion probabilistic models","venue":null,"work_id":"f7693dda-8a07-45a9-884b-e9ab7a3ef56d","year":2022},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.318977Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:a86f34c9b1dd1cd4c3a575cf49e04de03ccc106bf6031eddd0698d8e97a6ca03","observation_id":"3a041cb7-e4cc-4e00-85d6-3ff1d59b366b","resolution":{"observed_at":"2026-08-06T19:32:51.443761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-08T06:35:17.078531Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-06T19:32:43.372032Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.372032Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:178d89eaeba7aaefa7424f4e3338e1de20dc8a254f526a3bcef1ed48cd00f97f","observation_id":"7d632eaa-fc7c-406a-a01c-1685080a3894","resolution":{"observed_at":"2026-08-06T19:32:43.372032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02421","last_updated":"2023-11-20T09:08:42Z","snapshot_observed_at":"2026-08-10T17:43:26.407184Z","submitted_at":"2023-07-05T16:43:56Z","title":"DragonDiffusion: Enabling Drag-style Manipulation on Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02421","snapshot_observed_at":"2026-08-06T19:32:43.471973Z","title":"Dragondiffusion: Enabling drag-style manipula- tion on diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.471973Z"},"links":{"cited_paper":"/paper/2307.02421","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:d41d03d3893409d95010831fa8640735e886dd39bc4b80dba323bbd4e88d030f","observation_id":"3888885d-34eb-499f-aaca-80d041c41a91","resolution":{"observed_at":"2026-08-06T19:32:43.471973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-06T19:32:43.512734Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.512734Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:d4df5c901bf55e9edfed078f1d0d85cb7ce9b00ab6766681ed832fa1bd17d6a0","observation_id":"703304f1-392c-417f-b5b6-f63faec85851","resolution":{"observed_at":"2026-08-06T19:32:43.512734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08246","last_updated":"2024-05-14T00:22:06Z","snapshot_observed_at":"2026-08-10T13:24:27.367688Z","submitted_at":"2024-05-14T00:22:06Z","title":"Compositional Text-to-Image Generation with Dense Blob Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08246","snapshot_observed_at":"2026-08-06T19:32:43.604776Z","title":"Compositional text-to-image generation with dense blob representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.604776Z"},"links":{"cited_paper":"/paper/2405.08246","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:ced2aa64dec5cc97457aee59ae10b8e448668e7a29131062b805abe31a8746ba","observation_id":"cfe16a15-78d0-45ac-ac80-c2025c25e2ed","resolution":{"observed_at":"2026-08-06T19:32:43.604776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:50.976799Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":"2af66fae-bc44-42a9-bb95-3b2867b379c6","year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.663407Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:7cae976f2f050377faaa2cd18671d052395c60659a78faf651ffa16caeac04fa","observation_id":"6a96982a-e168-4c13-bf54-664115a9ad96","resolution":{"observed_at":"2026-08-06T19:32:51.133102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16855","last_updated":"2025-03-09T02:57:28Z","snapshot_observed_at":"2026-08-07T22:08:49.929764Z","submitted_at":"2024-06-24T17:58:47Z","title":"DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16855","snapshot_observed_at":"2026-08-06T19:32:43.710244Z","title":"Dreambench++: A human-aligned bench- mark for personalized image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.710244Z"},"links":{"cited_paper":"/paper/2406.16855","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:9fc548440ed85b59b97d71bc24d1f0eed8429675261db0d2891da201edd70d67","observation_id":"0d8a6db9-f5d0-4832-a43f-7c75154afa47","resolution":{"observed_at":"2026-08-06T19:32:43.710244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T19:32:43.800318Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.800318Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:bce49ee35ec036bb5e91df2629a5d2c8131fbb798cbd0478bf27211219f70965","observation_id":"03cf15ca-79ba-4b95-8f5a-c9cc6d132e4a","resolution":{"observed_at":"2026-08-06T19:32:43.800318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:50.623954Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"6d3a795c-a961-4d70-a83f-896a01ceef87","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.870295Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:e8ea5cd2c3caf7a7d1a336cd0c35c08ba540fa7a4cbf8641a7c29dffdf22962c","observation_id":"02b4a0a6-cd21-4657-a825-68130c2a4637","resolution":{"observed_at":"2026-08-06T19:32:50.751818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-06T19:32:43.945524Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:43.945524Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:79070474c27fb9c62a0888e6c8e0287d0b9a6ea64ad550c9dc0fe54e81ae2030","observation_id":"95d3c306-0c93-4215-8336-89c210ae41e3","resolution":{"observed_at":"2026-08-06T19:32:43.945524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:44.014907Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.014907Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:5d3b94f1d3fe99a3830aa9a407be06103bd95ffc075bca8c04252ebc95cb85b2","observation_id":"bb9e2040-d8b1-4911-afb8-c362241c31da","resolution":{"observed_at":"2026-08-06T19:32:44.014907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:50.346151Z","title":"Laion-5b: An open large-scale dataset for training next gen- eration image-text models","venue":null,"work_id":"d13d73ab-b017-4ce6-b3bb-ceeddd2ac863","year":2022},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.080780Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:895f05b2af195fdcee56bc7a334be7865fb764175ca26fe2010b54bd5c8de774","observation_id":"ef2bddaf-4d20-4d0b-8650-a35dc71bc7d1","resolution":{"observed_at":"2026-08-06T19:32:50.482594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00121","last_updated":"2024-05-31T18:22:29Z","snapshot_observed_at":"2026-08-06T12:48:32.046771Z","submitted_at":"2024-05-31T18:22:29Z","title":"Empowering Visual Creativity: A Vision-Language Assistant to Image Editing Recommendations","version":1},"cited_work":{"arxiv_id":"2406.00121","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.00121","snapshot_observed_at":"2026-08-06T19:32:46.142025Z","title":"Empowering Visual Creativity: A Vision-Language Assistant to Image Editing Recommendations","venue":"cs.CV","work_id":"f199e54b-e3d8-42dd-911b-6ba372aa870e","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.173412Z"},"links":{"cited_paper":"/paper/2406.00121","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:166cce35c30c8ad6623f1fa38ecd5466703d83296abed57a996321b49f64beb8","observation_id":"e41862ce-136d-408a-90f1-a1f2cc7404bd","resolution":{"observed_at":"2026-08-06T19:32:46.215858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:44.237153Z","title":"Emu edit: Precise image editing via recognition and genera- tion tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.237153Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:3e9c1bdb36226c4951243579b410809ac90b208f95f39f45afeb6fe4f31153d1","observation_id":"f0573a96-8a20-46d7-a9e2-7d3f1886828b","resolution":{"observed_at":"2026-08-06T19:32:44.237153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:49.982603Z","title":"Dragdiffusion: Harnessing diffusion models for interactive point-based image editing","venue":null,"work_id":"4e2a6b67-cbed-49b4-bd70-2e5ab87188be","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.308234Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:912bf730366ebfb5339b7b4221a55034a3639baaf0d1674d281f3318b596005b","observation_id":"832b3744-2a16-4764-acad-7288d129328e","resolution":{"observed_at":"2026-08-06T19:32:50.141545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T19:32:44.366278Z","title":"Gemini 1.5: Unlocking mul- timodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.366278Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:b5aadcca630350b97ab6f8eec5ce4c30702d1af86320f2c2039b5fa7689b7a8a","observation_id":"3f78ea67-50d3-462b-9cbe-7d368799f5ca","resolution":{"observed_at":"2026-08-06T19:32:44.366278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T19:32:44.440726Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.440726Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:d3bdd215ea4de6566f193ac1043dfa903fb267cd5ace5c3b1d49b249753569ed","observation_id":"3e2a25c2-a351-4fcf-8607-66ab9a10eb54","resolution":{"observed_at":"2026-08-06T19:32:44.440726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:49.642871Z","title":"Mulan: A multi layer annotated dataset for controllable text-to-image generation","venue":null,"work_id":"20dcedd7-b76d-4d54-b793-24ecaf1d75f9","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.517314Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:aa466d820018bcbbc7dd135b9f2597a22abe91cd542b72f9b49c0830c7508335","observation_id":"9610d24a-9036-40ab-9133-bcca4c067b50","resolution":{"observed_at":"2026-08-06T19:32:49.833442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:49.317000Z","title":"Instancediffusion: Instance- level control for image generation","venue":null,"work_id":"cd7f2edd-50b3-497d-a526-10dac5f82cbe","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.589336Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:e8926e2dbf3cc0a4e1bb7fde0275db5166df23fa5ce15e587fb8afd2598ed2f9","observation_id":"bfe216b7-83f1-4589-857d-02ae94dae6be","resolution":{"observed_at":"2026-08-06T19:32:49.484380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05600","last_updated":"2024-10-28T14:08:13Z","snapshot_observed_at":"2026-08-09T20:22:09.850211Z","submitted_at":"2024-07-08T04:30:53Z","title":"GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05600","snapshot_observed_at":"2026-08-06T19:32:44.673388Z","title":"Genartist: Multimodal llm as an agent for unified image gen- eration and editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.673388Z"},"links":{"cited_paper":"/paper/2407.05600","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:3ac37863ef57b16e994fc89ebe0d9b7fbc8fdddcff96a8dc5f454152f618190f","observation_id":"e0ba71da-5963-43a4-9bb8-a194b214a125","resolution":{"observed_at":"2026-08-06T19:32:44.673388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:49.007255Z","title":"Turboedit: Instant text-based image editing","venue":null,"work_id":"d885b84e-89fa-47e7-9993-8c2041b1a50a","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.750233Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:19dd96934bdd17399b546e9a34ad6d75b1470e17db808101d824c9c2b675d22f","observation_id":"fb21f4b3-4718-4a4e-86f2-b16d97a62a81","resolution":{"observed_at":"2026-08-06T19:32:49.186137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-10T11:21:08.205918Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-06T19:32:44.828420Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.828420Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:9a55519d4919b65c6393d72597a4772e70b201cc1c42fbbb477c3b3cdc3a513a","observation_id":"f4e9f5eb-1df1-43b0-b36b-54afe08a9fdf","resolution":{"observed_at":"2026-08-06T19:32:44.828420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-06T19:32:44.894528Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.894528Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:007210756fee705328418799b70ee3fe1c01137a682635c81ebfdff2d25197ab","observation_id":"1fa43bd6-d577-4ab3-823e-46335f495e6e","resolution":{"observed_at":"2026-08-06T19:32:44.894528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:48.744891Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"33ad7c8e-f473-4d94-80d8-416e705871a2","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:44.959557Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:b01bb5da9e32261fd74db37dae8054464a414c0c76b6926815f587a50d54107a","observation_id":"fd8f5a0d-211f-4ebc-a163-aa47c871787a","resolution":{"observed_at":"2026-08-06T19:32:48.890155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:48.491694Z","title":"Hive: Harnessing human feedback for instructional visual editing","venue":null,"work_id":"b62244b3-9968-43b2-b2fb-120dc72c8eae","year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.032282Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:41a2a652e7d1e77fc16f1ab40da34b7790617d33d17aaa2203e3cfeecfeccc47","observation_id":"a208d788-1032-413f-be9c-d49c3a3a8a82","resolution":{"observed_at":"2026-08-06T19:32:48.614594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-05T06:11:45.068217Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-06T19:32:45.106357Z","title":"In-context edit: Enabling instructional image editing with in- context generation in large scale diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.106357Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:0dd0fdf5bc72e4a84da2631a16121b62f980f62eb7671f3e454f93e2da027f01","observation_id":"16e1d124-d5d1-42fa-83bf-afffed9d0d21","resolution":{"observed_at":"2026-08-06T19:32:45.106357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05282","last_updated":"2024-12-19T04:42:41Z","snapshot_observed_at":"2026-08-10T11:20:42.191956Z","submitted_at":"2024-07-07T06:50:22Z","title":"UltraEdit: Instruction-based Fine-Grained Image Editing at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05282","snapshot_observed_at":"2026-08-06T19:32:45.146541Z","title":"Ultraedit: Instruction-based fine-grained image edit- ing at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.146541Z"},"links":{"cited_paper":"/paper/2407.05282","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:340f37bd2b57d0bde33cc8ffdd2655421c157e05701346f9203da5bd54ab3354","observation_id":"bd5934f5-23d3-428b-b432-ddf5a0879a11","resolution":{"observed_at":"2026-08-06T19:32:45.146541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:48.169247Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"e1cd8b8f-fdba-4543-bbd1-50a298088b6b","year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.173084Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:826ca759a9a281e754c477f415dac46c900a85cf548c1942b102c348d8de5fea","observation_id":"f08a4b94-527e-404d-b7dc-a9c12a47c3d5","resolution":{"observed_at":"2026-08-06T19:32:48.315709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T19:32:45.233934Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.233934Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:c765a76a673ab254455d4584671198b1cd178d2dae5ae1204f83fc7d40112079","observation_id":"1075aa66-f2bc-4d64-b2ca-5d6d613deb8c","resolution":{"observed_at":"2026-08-06T19:32:45.233934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03594","last_updated":"2024-07-23T11:48:57Z","snapshot_observed_at":"2026-07-06T16:57:46.724781Z","submitted_at":"2023-12-06T16:34:46Z","title":"A Task is Worth One Word: Learning with Task Prompts for High-Quality Versatile Image Inpainting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03594","snapshot_observed_at":"2026-08-06T19:32:45.293019Z","title":"A task is worth one word: Learning with task prompts for high-quality versatile image inpainting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.293019Z"},"links":{"cited_paper":"/paper/2312.03594","citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:417d1d6aa7e296ae88e6a4ab074cb33d91a2c468bced6cebf7d39a0346905c58","observation_id":"6ae70785-b36c-47d1-9fd0-8a3bcf5ac773","resolution":{"observed_at":"2026-08-06T19:32:45.293019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:47.810250Z","title":null,"venue":null,"work_id":"2c937b55-43a0-4b54-8b52-8d855f838d5d","year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.335182Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:f6067adb8f47fa455196ae353a39940f0012b10536e43e3cf417a228514ac4e5","observation_id":"37cb25af-62b5-4ac5-9c5d-de89e802d44d","resolution":{"observed_at":"2026-08-06T19:32:47.996038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:47.515644Z","title":"Our X-Planner leverages GLaMM [32] as the base model, built on Vicuna-7B [51]","venue":null,"work_id":"1a9405e1-5ef3-4f0a-9d49-83f19479fc32","year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.360583Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:de30cce9af8809005536e1ef7d5b23ed0165b30b20df4e2620daf1fbbfffa2ac","observation_id":"f2ea9dfa-9f7c-48d2-a6c1-4a8ff7dbd509","resolution":{"observed_at":"2026-08-06T19:32:47.637717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:47.203761Z","title":null,"venue":null,"work_id":"7c4796de-40f1-4b9f-a887-1be974da6ef7","year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.401967Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:f204d12ca16dd8e4c08db797e6b6ae21367dd0076ef0d608fbde4b9352b13b4b","observation_id":"11349976-dea2-4333-87f5-78492c88c9d6","resolution":{"observed_at":"2026-08-06T19:32:47.312759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:46.987865Z","title":null,"venue":null,"work_id":"4b9ed0f4-860d-476a-9b5f-840fafe96cb2","year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.444737Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:1e2c88bff42066417237b1f092f1f6f78bf8753f88f5bb5028110b95a5cdc671","observation_id":"139951ff-ff3e-4817-a375-b547efc40d41","resolution":{"observed_at":"2026-08-06T19:32:47.087834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:46.921058Z","title":null,"venue":null,"work_id":"856a4a75-232f-4910-b581-b120b8be560f","year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.502460Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:7380e39ba29e099c49ab5ab4bee091d818ab8f5cce57aacafe54512dd802b18c","observation_id":"bc9f969c-84d7-4eaf-867f-47b321f50f59","resolution":{"observed_at":"2026-08-06T19:32:46.945727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:46.734034Z","title":null,"venue":null,"work_id":"476f3c5b-d38e-4391-8bc0-6638903f67f6","year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.566988Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:672d903467a70f5e503a5cdba9abb6b6cb64f2e1e6f865abcf37ddf78faddff6","observation_id":"d9c00314-9a8b-41f1-8b71-b70383d6a4f3","resolution":{"observed_at":"2026-08-06T19:32:46.797556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:46.593608Z","title":"This allows us to isolate the effect of training signal quality from the underlying data generator","venue":null,"work_id":"264a6654-04c8-43e4-80c8-c2cf6370e840","year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.611634Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:3838f068afe5b3a9c9426fc5d2cdf7de51df908fed4199e1def1c53d308e93fd","observation_id":"6300a305-c7e6-4d50-b7fe-cd4c4adc6092","resolution":{"observed_at":"2026-08-06T19:32:46.642929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:46.437056Z","title":"Each ex- ample demonstrates how X-Planner tailors its outputs to 3 Figure 11","venue":null,"work_id":"8239bcc2-c130-4d47-a4de-5e52451f51f0","year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.672620Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:4ff70ad279e268cbe320cd5a6e23c1d57c4006992f90288f79f1fa42325fe79d","observation_id":"7d23411e-e19f-45a6-a314-5d3db4d3e29b","resolution":{"observed_at":"2026-08-06T19:32:46.490501Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6140.01810","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:45.896965Z","title":null,"venue":null,"work_id":"a03b930d-7b99-4e58-94ff-5b1c251af88c","year":null},"citing_paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:45.728129Z"},"links":{"citing_paper":"/paper/2507.05259"},"observation_digest":"sha256:b38a65a48bfc17b50048a7d31573594c3e8830ce968c43521d9a21e968884b0e","observation_id":"f00e59bf-f8ee-487a-93aa-b546c21a71a7","resolution":{"observed_at":"2026-08-06T19:32:45.958253Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.05259","last_updated":"2025-07-07T17:59:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T20:21:05.381810Z","submitted_at":"2025-07-07T17:59:56Z","title":"Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 4 inbound Pith citation observations for arXiv:2507.05259."}