{"as_of":"2026-08-15T16:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dff0e5433aca94f2ef28296c0207faf4322b720cbc3c51b71afe3ca38b7e1905","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:19:22.592578Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T16:07:53.054355Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T16:07:53.165809Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"cited_work":{"arxiv_id":"2411.17323","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17323","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Insightedit: Towards better instruction following for image editing","venue":null,"work_id":"70e94418-30e7-48cb-8c20-8f01278ca1db","year":2024},"citing_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-13T04:37:50.242337Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T16:07:53.054355Z"},"links":{"cited_paper":"/paper/2411.17323","citing_paper":"/paper/2504.20690"},"observation_digest":"sha256:bbb2f0752e1281d47947d2cdc1a5f5118716836218be3061883aa72de5a7a233","observation_id":"17882952-f7a9-410d-b29f-8dd72fff0933","resolution":{"observed_at":"2026-05-16T16:07:53.167573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17323/citation-record","integrity":"/paper/2411.17323/integrity","json":"/paper/2411.17323/citation-record.json","paper":"/paper/2411.17323"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.331750Z","title":"Blended latent diffusion","venue":null,"work_id":"35252250-eac3-48a3-bdff-5241dd5d1594","year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.358642Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:a17fc1a572bfe1f2f80741e2a08ab208316a5be1ffafe8746ca6bb0c03e07b9f","observation_id":"760af4c4-abb5-40fd-949b-68587d0a0794","resolution":{"observed_at":"2026-08-12T12:19:23.336623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.311956Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"c9454524-c6f7-4db2-a558-27f1a096888b","year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.364636Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:3a0d729daaa8022bef1bcc79a97779fcff2ebf4178556771d3e4fb26a9c7470d","observation_id":"5667b81a-71fb-4832-9207-d985f4552312","resolution":{"observed_at":"2026-08-12T12:19:23.317771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.370164Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.370164Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:b247e725107469ed19d95c23718e5478bd7ac81471db62ee503ca68ca1ad3e96","observation_id":"1200f067-85c1-4936-b5c0-b6728a3f9478","resolution":{"observed_at":"2026-08-12T12:19:22.370164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.376187Z","title":"Masactrl: Tuning-free mu- tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.376187Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:3e12789aea2450ed278cfeb4fb32f46be2e8bf3b352059040c2b0bb945b54e24","observation_id":"03de9598-47b0-4693-b29c-66309b4f3ff9","resolution":{"observed_at":"2026-08-12T12:19:22.376187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.383137Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.383137Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:b239cbc2dda673d5b7dca7ca89a80c1838d9b67d351b91cf44af4469d7b86833","observation_id":"2c38f988-f88e-420d-910a-9b79d30b4127","resolution":{"observed_at":"2026-08-12T12:19:22.383137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19145","last_updated":"2023-10-29T20:39:11Z","snapshot_observed_at":"2026-08-15T16:10:02.440584Z","submitted_at":"2023-10-29T20:39:11Z","title":"Learning to Follow Object-Centric Image Editing Instructions Faithfully","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19145","snapshot_observed_at":"2026-08-12T12:19:22.391172Z","title":"Learning to follow object-centric image editing instructions faithfully","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.391172Z"},"links":{"cited_paper":"/paper/2310.19145","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:a98a860b1b2350ab2394e8746b3282296a24d5904666e7d26a215c6a9b2a5c2e","observation_id":"19b28b7c-5657-45e1-a1cd-e182da48246c","resolution":{"observed_at":"2026-08-12T12:19:22.391172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.397476Z","title":"Conceptual 12m: Pushing web-scale image-text pre- training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.397476Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:d0fa9b9dc2b13e59808b758c8e4d7373a7214245ae4677ff2bf0bc61f4e304f4","observation_id":"882868f8-e7e3-4a11-9b74-55ee7ab7ecd5","resolution":{"observed_at":"2026-08-12T12:19:22.397476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17102","last_updated":"2024-02-05T05:04:53Z","snapshot_observed_at":"2026-08-14T09:55:58.225636Z","submitted_at":"2023-09-29T10:01:50Z","title":"Guiding Instruction-based Image Editing via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17102","snapshot_observed_at":"2026-08-12T12:19:22.402699Z","title":"Guiding instruction-based im- age editing via multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.402699Z"},"links":{"cited_paper":"/paper/2309.17102","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:9799138aef69fda9d46dc4d72777f09b7f0ad5f05d48d4dc574584ae0a8478a3","observation_id":"b6fd0b5c-dc44-48d3-9e4e-2c0151863f78","resolution":{"observed_at":"2026-08-12T12:19:22.402699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.247819Z","title":"Instructdiffusion: A generalist modeling inter- face for vision tasks","venue":null,"work_id":"c16ee28a-68cd-40a7-be6d-28b7047677a4","year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.411977Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:4b216b3fa1e147f82a060b2e48d1469174e0d6812d8d8e7929d6f9e048ba006c","observation_id":"bb97db91-9e4c-4659-a3ff-27323f5ddce0","resolution":{"observed_at":"2026-08-12T12:19:23.253477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-12T12:19:22.417571Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.417571Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:2b71720919be293aa73f1e6c100f19fa92e89865f2f10c9a6cf7fccdd575d1b8","observation_id":"d7007744-1940-4c6d-ace5-9b3b6649b8a3","resolution":{"observed_at":"2026-08-12T12:19:22.417571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.422518Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.422518Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:335e7e0e8f6dfb7612ca38272859225d481b6565d7f5a4a340fbe449e8329162","observation_id":"a66cee22-bf40-44ed-b424-ba9352f5317f","resolution":{"observed_at":"2026-08-12T12:19:22.422518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T12:19:22.427569Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.427569Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:757d32220f8cdf94a2abd9edc38ccd111a169dab8a22efcbe5f17653bf2c189b","observation_id":"de62810b-1005-42e4-a081-900ba0658e5e","resolution":{"observed_at":"2026-08-12T12:19:22.427569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17525","last_updated":"2025-03-11T02:16:29Z","snapshot_observed_at":"2026-08-13T20:44:03.495389Z","submitted_at":"2024-02-27T14:07:09Z","title":"Diffusion Model-Based Image Editing: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17525","snapshot_observed_at":"2026-08-12T12:19:22.433319Z","title":"Diffusion model-based image editing: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.433319Z"},"links":{"cited_paper":"/paper/2402.17525","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:461402b01046824918bbda6b0e66d5b64934d03f65fa1cc76e6dfb647af32133","observation_id":"6f051b66-ec4c-4448-bd43-30e5e500137a","resolution":{"observed_at":"2026-08-12T12:19:22.433319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.214664Z","title":"Smartedit: Exploring complex instruction-based image editing with multimodal large lan- guage models","venue":null,"work_id":"9c3bb4ed-3e51-44cd-add2-ceaad0ab2998","year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.438521Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:9d53b53cae9227c7534e660300e381f3f8167b3bc4356477cb08e64508af4923","observation_id":"de0a4650-16b1-486c-a064-2d003056840a","resolution":{"observed_at":"2026-08-12T12:19:23.219965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-08-15T12:43:45.689817Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-08-12T12:19:22.444615Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.444615Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:e233346224f7d705ec984311c0dc0b6c9ed9c229455edd46a7d2334660e1b07c","observation_id":"fe37e4f9-7969-402c-b9a2-e67348baf9a0","resolution":{"observed_at":"2026-08-12T12:19:22.444615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06976","last_updated":"2024-03-11T17:59:31Z","snapshot_observed_at":"2026-08-13T00:57:21.525577Z","submitted_at":"2024-03-11T17:59:31Z","title":"BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06976","snapshot_observed_at":"2026-08-12T12:19:22.448901Z","title":"Brushnet: A plug-and-play image inpaint- ing model with decomposed dual-branch diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.448901Z"},"links":{"cited_paper":"/paper/2403.06976","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:3e417551a52bdefe522beaba169404bcea3f62471878b5fa0844f4fdd65e2f86","observation_id":"61fb3233-c4ad-4751-9c00-c3c0b97c250d","resolution":{"observed_at":"2026-08-12T12:19:22.448901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.453180Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.453180Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:c66c3942f6bd69a931f54c1f90aa46b72dd60241bfe570486f2de1e72b337087","observation_id":"ca56dd4b-0d50-43bd-945d-05172560eff7","resolution":{"observed_at":"2026-08-12T12:19:22.453180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T12:19:22.457748Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.457748Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:abd81d27fb446cc523ee6d833b3a6a4401fc934a5fe1c76917793e1415994f45","observation_id":"1f1a3217-d4b8-461e-8caa-767ac1591bf3","resolution":{"observed_at":"2026-08-12T12:19:22.457748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.187357Z","title":"Gen- erating images with multimodal language models","venue":null,"work_id":"5b152589-c73c-4c19-a6ad-1fa7ef7d91c2","year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.462634Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:0f1c5a8ca1026f1b4a9acb565cf09a6fb034cb7a151ea14827228008c7c712a9","observation_id":"cb616302-0503-4f2d-86d8-46387ef6a077","resolution":{"observed_at":"2026-08-12T12:19:23.193354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14867","last_updated":"2024-06-03T16:59:20Z","snapshot_observed_at":"2026-08-13T04:55:05.773072Z","submitted_at":"2023-12-22T17:45:19Z","title":"VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14867","snapshot_observed_at":"2026-08-12T12:19:22.467898Z","title":"Viescore: Towards explainable metrics for conditional image synthesis evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.467898Z"},"links":{"cited_paper":"/paper/2312.14867","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:8125cf1da2b3f3fcb361f0129f863173bb7b3c02baf275f93afbe1f7ed44236e","observation_id":"8da70949-c9f3-4256-9c3e-a6a79f2ac986","resolution":{"observed_at":"2026-08-12T12:19:22.467898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-12T12:19:22.472727Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.472727Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:4339bb243b99d473d336fb52e37eb14dd549f54024d911a20fb37c932454175c","observation_id":"2f37db29-59a6-42d9-bc99-caed9a1506e3","resolution":{"observed_at":"2026-08-12T12:19:22.472727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.478124Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.478124Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:be184ccdfa8e6646d49c08bac15cdd79c2fd1decdea5ada69a34c8d0b73efe87","observation_id":"0f4ef9b0-c56e-4ca3-80ab-7b70d7955d68","resolution":{"observed_at":"2026-08-12T12:19:22.478124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.482309Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.482309Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:0f840087617d607aa91510ceb33cf98889391b34f5f0a8e1b2537e81b49cc070","observation_id":"c1e1e345-5fde-4f4a-8013-4cd084f15ac4","resolution":{"observed_at":"2026-08-12T12:19:22.482309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.487643Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.487643Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:a9b0f449af2d65d0c2f9ea4d0d6163a010e4ce165f42366895dc882eb79b241c","observation_id":"7733db1f-c23f-44dc-97a9-151a93ffcf1c","resolution":{"observed_at":"2026-08-12T12:19:22.487643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T12:19:22.492943Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.492943Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:7482d99bb2fc69e9f6b3cb1661ac72c1f9e029a9dbbadfd2f47279b226fd63ee","observation_id":"cfcc8c28-9204-46af-a22e-70b99b42fe9d","resolution":{"observed_at":"2026-08-12T12:19:22.492943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.497473Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.497473Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:370f6672f147a91e233cdfb91d4adf1c431b0ec8e70399475f2e0a67081f7210","observation_id":"fdf02c19-15fd-49ec-acfe-6e52678a7234","resolution":{"observed_at":"2026-08-12T12:19:22.497473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.501781Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.501781Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:2e29629a7b13ce444e66f21b675b9f99230d11c40e48886610df2727184fc8b5","observation_id":"d6c01bc4-8e7d-469c-ae3a-cfdc09c86c80","resolution":{"observed_at":"2026-08-12T12:19:22.501781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.512037Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.512037Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:8427fa6dd1ba2793b69e054689ea28d10b5755c3b881bc82bd0b3e6d2ad9d371","observation_id":"d628a74b-b5be-4599-840f-ade024b74f16","resolution":{"observed_at":"2026-08-12T12:19:22.512037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.516863Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.516863Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:3abcc8ae3d0977e6eee448ee6454acc7eef172f55e8e291043643dd88c408ae6","observation_id":"5a35c3bd-5b08-45d0-ab1c-4a4b750fa8ea","resolution":{"observed_at":"2026-08-12T12:19:22.516863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T12:19:22.521176Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.521176Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:b71c1e5d09257b03e58e51582597738605cfc432954f86a605ea30e45a7c3c28","observation_id":"cf115904-528c-4411-8cb5-77acd804dc56","resolution":{"observed_at":"2026-08-12T12:19:22.521176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.087704Z","title":"Imagen editor and editbench: Advancing and evaluating text-guided im- age inpainting","venue":null,"work_id":"7bce4dbf-84a5-4713-b3bf-ee81298b15ee","year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.525213Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:8851f9472043d8c1750700e08f7f1e399f88a73adea1fa711c8b47a7739acf46","observation_id":"32efd130-9350-476c-a03e-facd9d1d5c7a","resolution":{"observed_at":"2026-08-12T12:19:23.097887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.064181Z","title":"Smartbrush: Text and shape guided object inpainting with diffusion model","venue":null,"work_id":"7cf58d74-7bba-4895-a1a8-d95941a3e0d8","year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.529202Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:5399af241fd523469d3d873450594dadd9f119b30f2fbccfdb75af1875760258","observation_id":"3d182635-52bc-4e1e-9513-7d3cad92a339","resolution":{"observed_at":"2026-08-12T12:19:23.069036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03771","last_updated":"2023-12-05T22:23:19Z","snapshot_observed_at":"2026-08-13T05:09:09.098874Z","submitted_at":"2023-12-05T22:23:19Z","title":"DreamInpainter: Text-Guided Subject-Driven Image Inpainting with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03771","snapshot_observed_at":"2026-08-12T12:19:22.533203Z","title":"Dreaminpainter: Text-guided subject-driven image inpaint- ing with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.533203Z"},"links":{"cited_paper":"/paper/2312.03771","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:362275213f047c33f9e27d84fe83aa78bc6e07e748e4b39d15f6b810ad29c1f0","observation_id":"f447d16f-197e-454e-8e7a-a1533ad4324d","resolution":{"observed_at":"2026-08-12T12:19:22.533203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-12T12:19:22.538501Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.538501Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:44683b6713da3a29b1b20cbd761cd98a44f9589364c67ccdcd9bb976db221991","observation_id":"86b2cd0f-58d6-44a1-8edb-27a4cda6c50f","resolution":{"observed_at":"2026-08-12T12:19:22.538501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14785","last_updated":"2024-05-23T16:54:17Z","snapshot_observed_at":"2026-08-15T00:40:06.643874Z","submitted_at":"2024-05-23T16:54:17Z","title":"EditWorld: Simulating World Dynamics for Instruction-Following Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14785","snapshot_observed_at":"2026-08-12T12:19:22.543846Z","title":"Editworld: Simulat- ing world dynamics for instruction-following image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.543846Z"},"links":{"cited_paper":"/paper/2405.14785","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:5f1bd20d1cd362f76e117282062d815ab8651999d7356c6847b5fac3991ded8c","observation_id":"34aaf49b-0adb-4be0-87b3-f493d10e4670","resolution":{"observed_at":"2026-08-12T12:19:22.543846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-13T04:52:37.935795Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-12T12:19:22.549062Z","title":"An improved baseline for reasoning segmentation with large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.549062Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:2502d0c3b5b9fba9b1f57791ba0661f6bfe5674a7722f1820f41fb82242e5664","observation_id":"d00bebc9-12d3-4492-97cd-ffaa4de39556","resolution":{"observed_at":"2026-08-12T12:19:22.549062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-12T12:19:22.555889Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.555889Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:0b07ea96815ef4a734335293e24060673697b59217efae2d9005fdb16bc02fd6","observation_id":"3ccb8b6a-4558-49b4-9845-1b0de044f3f3","resolution":{"observed_at":"2026-08-12T12:19:22.555889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.560892Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.560892Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:7cecbe42dc3ca4ca1dfb9ace6851c90634c5099e1723f32baa02fa9ffc80057d","observation_id":"224856ad-fe9b-461a-a225-04d0c5c05e68","resolution":{"observed_at":"2026-08-12T12:19:22.560892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.039953Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"8a493031-f177-4c27-908b-bffddd0cdf5d","year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.565590Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:cb7dcfc1285286037e74306285963ecb1e83867c7d11aebe958a5007972cf64c","observation_id":"1c677321-181c-41d1-9f1e-0cfacc1aa4e2","resolution":{"observed_at":"2026-08-12T12:19:23.044724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.570581Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.570581Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:5ed18fc8be16fa0f6367cdb116b945177bcf1a9d05bbeee85dff02887d48d067","observation_id":"a4dde6b5-45de-46ff-98b7-1eea7f7d18fc","resolution":{"observed_at":"2026-08-12T12:19:22.570581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.574739Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.574739Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:c69dc19912e580bae46ba5677c32aa3d8f4c63e9b103865b2ce81abd5805a945","observation_id":"da9bea9e-ba98-4c84-87c3-b640a70532c4","resolution":{"observed_at":"2026-08-12T12:19:22.574739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.998768Z","title":"Hive: Harnessing human feedback for instructional visual editing","venue":null,"work_id":"6a971f99-8282-4354-8ae2-a86ee1352cb0","year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.580148Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:86e22aa7dc48d762161db1d1fcf5393988cfea410ff125066487f2b135e0be88","observation_id":"a95793dc-a990-4046-84a9-7c30c9ca6501","resolution":{"observed_at":"2026-08-12T12:19:23.006566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05282","last_updated":"2024-12-19T04:42:41Z","snapshot_observed_at":"2026-08-13T22:56:43.546810Z","submitted_at":"2024-07-07T06:50:22Z","title":"UltraEdit: Instruction-based Fine-Grained Image Editing at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05282","snapshot_observed_at":"2026-08-12T12:19:22.587711Z","title":"Ultraedit: Instruction-based fine-grained im- age editing at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.587711Z"},"links":{"cited_paper":"/paper/2407.05282","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:d1aa3397d93c771550a82810dfee4208163d687a3598cc658fd33f5757e5cbd5","observation_id":"4ed2c6d5-5dfa-4d7e-865f-9236dc97d98c","resolution":{"observed_at":"2026-08-12T12:19:22.587711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03594","last_updated":"2024-07-23T11:48:57Z","snapshot_observed_at":"2026-08-15T07:13:30.066531Z","submitted_at":"2023-12-06T16:34:46Z","title":"A Task is Worth One Word: Learning with Task Prompts for High-Quality Versatile Image Inpainting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03594","snapshot_observed_at":"2026-08-12T12:19:22.592578Z","title":"A task is worth one word: Learning with task prompts for high-quality versatile image inpainting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.592578Z"},"links":{"cited_paper":"/paper/2312.03594","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:de79e1d82f5df69e4b853eaf6a1edfd9dd126edae518046c4bc9eb9987deddc1","observation_id":"c5f2084e-7948-4f04-a07f-57d1120e7dcc","resolution":{"observed_at":"2026-08-12T12:19:22.592578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T16:10:48.855185Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2411.17323."}