{"as_of":"2026-08-13T23:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41de593136d48b0e1aa1a1fc92b52572d9688069c26b14753b44ebdb7c8dae02","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:48:46.673046Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07317/citation-record","integrity":"/paper/2507.07317/integrity","json":"/paper/2507.07317/citation-record.json","paper":"/paper/2507.07317"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:48:36.859682Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:36.859682Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:97fcd78fbf100b12674071683e01c3b47c02e1ef0d75e5559efdc77315826fef","observation_id":"73803670-10a8-400a-90f2-086b1f14f79f","resolution":{"observed_at":"2026-08-06T18:48:36.859682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:36.939717Z","title":"Cos stable diffusion xl 1.0 and cos stable dif- fusion xl 1.0 edit, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:36.939717Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:15e05a92aad860df65051249963197e4a3618af29b743412f241db3c44a2ba31","observation_id":"b3b8855b-32cd-4c55-9187-c9a8286ff7c7","resolution":{"observed_at":"2026-08-06T18:48:36.939717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.088224Z","title":"Claude 3.5 sonnet model card addendum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.088224Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:32a80f9b63d09056229d8fe37b2ea9e742fbea1b2892cbe7956eba4af2873a8c","observation_id":"0443baac-97af-4ca7-b4a8-32a38837091b","resolution":{"observed_at":"2026-08-06T18:48:37.088224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-06T18:48:37.185937Z","title":"Openflamingo: An open-source frame- work for training large autoregressive vision-language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.185937Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:774f6a2dfdbd6a4d1ec89847df1658e3b8182f8dd1f0048f6c877582177ea114","observation_id":"7760d3d8-8267-4825-8be7-572708b72096","resolution":{"observed_at":"2026-08-06T18:48:37.185937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T18:48:37.334872Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.334872Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:5a921db6dfc19605c5e14a8807f3504e1d7c0a71046ef850deec8802dad5a564","observation_id":"1fd3bd14-795b-438d-9757-48d709760987","resolution":{"observed_at":"2026-08-06T18:48:37.334872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.444474Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.444474Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:5f3cf1015aa56de1cf20716e825795da444a2cd2defa1fdaa223d86c4a41587b","observation_id":"1a00ba9d-c536-4cc8-8ecc-4ce29ebee588","resolution":{"observed_at":"2026-08-06T18:48:37.444474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.535105Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.535105Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:4e186140be1a041ed475fca35ba04646ff17f0279d1165001a6bab192717759d","observation_id":"c1d90854-d996-4922-ac60-437f3c9f41bb","resolution":{"observed_at":"2026-08-06T18:48:37.535105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.672421Z","title":"Is clip the main roadblock for fine-grained open-world perception? In 2024 International Conference on Content-Based Multimedia Indexing (CBMI), pages 1–8","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.672421Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:a7981db18b40f1e4d2738c2bc6feb68c158815f213530b33fce090422ec75ce3","observation_id":"6062fa7b-067f-4ecf-a83c-1ba8d949ddd2","resolution":{"observed_at":"2026-08-06T18:48:37.672421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.770834Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.770834Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:f09cd86f65d41e0e36eb7e4630bf915e1be8ff772af0333b9c81fdfc4ab2c21c","observation_id":"55afb521-809f-451e-8042-e60ee9701ddc","resolution":{"observed_at":"2026-08-06T18:48:37.770834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.883358Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.883358Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:e6db512213159359a460084694e120b7eefa84d0e983c6cf1410a7409debee31","observation_id":"030b1cbf-c569-4ae2-b528-c72b49bda671","resolution":{"observed_at":"2026-08-06T18:48:37.883358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:37.978585Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:37.978585Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:8126569e13bcb170a408ffba08f67af1a783ef2ff5f1b0882871fe3340ed4058","observation_id":"31cdb809-1e0f-4bba-8d2f-ac017d213150","resolution":{"observed_at":"2026-08-06T18:48:37.978585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10563","last_updated":"2025-07-13T23:07:08Z","snapshot_observed_at":"2026-08-12T22:23:42.310864Z","submitted_at":"2024-10-14T14:42:12Z","title":"MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10563","snapshot_observed_at":"2026-08-06T18:48:38.097897Z","title":"Mega-bench: Scaling multimodal evaluation to over 500 real-world tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.097897Z"},"links":{"cited_paper":"/paper/2410.10563","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:f1a96756a62a5051d5c74846d3500f76c07b2c338a0f3717126ec05b263874a5","observation_id":"1c8db78e-3087-448a-b247-82dc018016e8","resolution":{"observed_at":"2026-08-06T18:48:38.097897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T18:48:38.227993Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.227993Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:441d525e2512d6f70177ed5b33b620c48f6a6183ac5ba390ceda3698bb18b32f","observation_id":"318e331a-086b-45b9-a626-cd80b3d6c8e9","resolution":{"observed_at":"2026-08-06T18:48:38.227993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:38.322722Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.322722Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:598579d523b007f970089ea519118aec68a8cf6ded6aa74b6d7e0b93ae4dd5e8","observation_id":"841ff0b5-0a4b-4a14-81b7-9e66f2ce5a7b","resolution":{"observed_at":"2026-08-06T18:48:38.322722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-13T22:13:36.544823Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-06T18:48:38.482789Z","title":"Diffedit: Diffusion-based seman- tic image editing with mask guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.482789Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:7c7900a80456e1f74eeced2cb118b88defb4561ea8d7d000d258f1fd893844a5","observation_id":"00cdd155-fda2-4c85-922b-7ba276b3128e","resolution":{"observed_at":"2026-08-06T18:48:38.482789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T18:48:38.623306Z","title":"Instructblip: To- wards general-purpose vision-language models with instruc- tion tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.623306Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:e4d2653172c884e720b39cf53591992b28afa57a44edde91b5a717d3d28e638c","observation_id":"5e89a477-5d13-41d2-a3c4-40be01ee4a4d","resolution":{"observed_at":"2026-08-06T18:48:38.623306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:57.230576Z","title":"The epic-kitchens dataset: Collection, chal- lenges and baselines","venue":null,"work_id":"330e6021-8d4c-483d-ba2e-0360b37815c9","year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.694374Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:1d107854c9ade7c9e32534356914ea6c49e1575794dff5459f564f29532ddc20","observation_id":"fcd48602-d109-4347-a20c-69e931a1a218","resolution":{"observed_at":"2026-08-06T18:48:57.287543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:56.979504Z","title":"Diffusion models beat GANs on image synthesis","venue":null,"work_id":"667513de-fc99-46a7-bb7f-5d850c1f49a5","year":2021},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.805037Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:2a48d61d1179dd61afc2c2185a429e8a5fdc44f524fd7b60ae6a4a1c61d6b425","observation_id":"3df92554-ed0c-47eb-9ff2-99fdf29e2844","resolution":{"observed_at":"2026-08-06T18:48:57.107238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:56.802436Z","title":"Dreamlike photoreal 2.5, 2023","venue":null,"work_id":"53575588-5907-4b93-8478-4e67bec0b189","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.903563Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:754f5014ea4efbe113ae4973456fbbcbf48b33e3f24ccbe18a2e9008bca56e96","observation_id":"aa04f5c5-a8c4-414d-b9ae-cc4f7c45248b","resolution":{"observed_at":"2026-08-06T18:48:56.865429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-06T18:48:38.987435Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis, march 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:38.987435Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:eded7702ca8688131b4f23fc93091c1c3acb6bd01bce09773cad0a0d2abf85eb","observation_id":"315354ec-94f7-4a86-b2a4-6c612b76d4d3","resolution":{"observed_at":"2026-08-06T18:48:38.987435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-08-13T11:15:48.595279Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-06T18:48:39.067547Z","title":"Dream- sim: Learning new dimensions of human visual similar- ity using synthetic data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.067547Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:0f44f7bf30b0edea79602f9b0647740e5117f33676122e1d1ae03396e47b676f","observation_id":"bf0f9e38-56d8-4007-b7e4-53875d7f8dfd","resolution":{"observed_at":"2026-08-06T18:48:39.067547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04007","last_updated":"2024-05-07T04:55:47Z","snapshot_observed_at":"2026-08-13T00:13:26.846718Z","submitted_at":"2024-05-07T04:55:47Z","title":"SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04007","snapshot_observed_at":"2026-08-06T18:48:39.186905Z","title":"Seed-data-edit technical report: A hybrid dataset for in- structional image editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.186905Z"},"links":{"cited_paper":"/paper/2405.04007","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:210797ef0a4b4353228cf1b6b5a228d47d51b931b5e50790aee966c746a1b752","observation_id":"44dd0e9c-a8d4-494b-8314-94d6cda05bdd","resolution":{"observed_at":"2026-08-06T18:48:39.186905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-06T18:48:39.256568Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.256568Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:149db7404ac40150045134c4ff903a33ad1f23250370c5fc4ee8a11a90b380d3","observation_id":"812faeec-4c2f-4a18-a3a6-57115f07b1ec","resolution":{"observed_at":"2026-08-06T18:48:39.256568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:56.637035Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"3574f821-0032-4c5a-be59-3ebbb658f40f","year":2017},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.416699Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:4b9c9a338904718679da6a7ae078f6e0fc2baae0a0d645efadf40b67cb7c6417","observation_id":"939bf505-b7a9-4d98-b509-d71f4ba618f1","resolution":{"observed_at":"2026-08-06T18:48:56.712513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:56.382090Z","title":null,"venue":null,"work_id":"5363665e-fee8-43ad-9a71-72cb06c45678","year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.526651Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:b4b76ab4467b432f2e6eb3ad01a592ffbd3727521f3971d5476b1ac01a457db4","observation_id":"7e212353-a222-4a26-a374-efc1aa6b8390","resolution":{"observed_at":"2026-08-06T18:48:56.489778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04713","last_updated":"2025-03-20T00:04:47Z","snapshot_observed_at":"2026-08-12T22:06:46.476459Z","submitted_at":"2024-11-06T05:02:29Z","title":"Multi-Reward as Condition for Instruction-based Image Editing","version":2},"cited_work":{"arxiv_id":"2411.04713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04713","snapshot_observed_at":"2026-08-06T18:48:47.862524Z","title":"Multi-Reward as Condition for Instruction-based Image Editing","venue":"cs.CV","work_id":"869aca88-bca0-4b1a-bf91-100cb1ef24f4","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.649531Z"},"links":{"cited_paper":"/paper/2411.04713","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:9889326c33b0f38d5d286c94955589eb83d699a628dbadf50bca6f4e20a0d53a","observation_id":"45219a64-2c0e-4161-becb-94c209e23cef","resolution":{"observed_at":"2026-08-06T18:48:47.999415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15252","last_updated":"2024-10-14T04:08:53Z","snapshot_observed_at":"2026-08-12T23:37:24.872455Z","submitted_at":"2024-06-21T15:43:46Z","title":"VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15252","snapshot_observed_at":"2026-08-06T18:48:39.761303Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.761303Z"},"links":{"cited_paper":"/paper/2406.15252","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:1c25fde677c261f5b722d4c0d5d6c33241831f8d5589c0193d9aad81986a2d68","observation_id":"2c2f0c50-0fd6-480d-ad51-af2ed04f2177","resolution":{"observed_at":"2026-08-06T18:48:39.761303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T18:48:39.908378Z","title":"Prompt-to-Prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:39.908378Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:ca21aabecf03a4eb9fafa81597464a9f7d423d7505e8a77d740a89c3f8e47df9","observation_id":"fc613fd7-3279-4765-9322-bd541e9a29f7","resolution":{"observed_at":"2026-08-06T18:48:39.908378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T18:48:40.054243Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.054243Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:82aab30399e101bea2e68e8ccea6b30a3c0e2f6fcd02ca0df68e1149b33bb9c3","observation_id":"cc1f3b99-1f29-40b5-a64d-2094ddebe56a","resolution":{"observed_at":"2026-08-06T18:48:40.054243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:40.154473Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.154473Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:df1a85f5f2168f99b2f4a699a1d5463f4f7f8b11b38fef21dbc0f465752227da","observation_id":"e422a841-340b-42c6-9422-4d3695b107ad","resolution":{"observed_at":"2026-08-06T18:48:40.154473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:56.141344Z","title":"Action genome: Actions as compositions of spatio- temporal scene graphs","venue":null,"work_id":"4926029b-c6a7-44fa-8ece-2434b94b737d","year":2020},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.217599Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:e93bc8f8e9900b378118f0105c41e9835c862ee6a7accfda12b38322ff820dd8","observation_id":"75f18027-de1c-4400-b27d-273d352bf943","resolution":{"observed_at":"2026-08-06T18:48:56.262111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04485","last_updated":"2024-11-11T06:32:24Z","snapshot_observed_at":"2026-08-12T23:48:22.756821Z","submitted_at":"2024-06-06T20:15:42Z","title":"GenAI Arena: An Open Evaluation Platform for Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04485","snapshot_observed_at":"2026-08-06T18:48:40.299542Z","title":"Genai arena: An open evaluation platform for generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.299542Z"},"links":{"cited_paper":"/paper/2406.04485","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:eccfba00353748944ed731ef15f9e0c07ad34bb66885ab74f61ad0944297ed15","observation_id":"2560f2a4-585c-465e-96cb-ecc9f473ae27","resolution":{"observed_at":"2026-08-06T18:48:40.299542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:55.920933Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"02c79add-bfc3-44b5-8bc9-2ab62a6aeaf5","year":2017},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.392429Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:5f9aeeaf3c4fa97ff49ca36d4de949269866ac9cedc48f7b1b4af75200646eda","observation_id":"e91b6027-b560-4ee7-960b-ed6ed8549437","resolution":{"observed_at":"2026-08-06T18:48:55.981983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:55.667504Z","title":"What’s “up” with vision-language models? investigating their strug- gle with spatial reasoning","venue":null,"work_id":"85cbe8ce-b291-4cbf-9be5-ee7e3549a511","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.508645Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:6782a8d2ba33d45e86faac806f4a3d7ac58f1f50c935d354a921d3b20e19283e","observation_id":"c37c56fe-5ab7-4df3-a94d-6b5ca9c7359c","resolution":{"observed_at":"2026-08-06T18:48:55.774617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:55.412678Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image genera- tion","venue":null,"work_id":"aeaab37a-38be-4c53-9131-6fbf3cd76e67","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.651286Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:9a14acd74ded27f9a39de3e962941b2440a94fff580b8832e142a0e028140c7f","observation_id":"85d71823-4eb0-4e36-af0b-940643c377bf","resolution":{"observed_at":"2026-08-06T18:48:55.524988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:55.235469Z","title":"Learning Action and Reasoning-Centric Image Editing from Videos and Simulations","venue":null,"work_id":"d2dc1ab3-b99c-4deb-a642-22586230c097","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.763102Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:1b0b30a17922a08f241cda36048392ddc875eca2620a9f47fe98612c249afdb5","observation_id":"13b85a26-e7f0-47f4-996b-90bc6c1e1ba5","resolution":{"observed_at":"2026-08-06T18:48:55.296234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14867","last_updated":"2024-06-03T16:59:20Z","snapshot_observed_at":"2026-08-13T04:55:05.773072Z","submitted_at":"2023-12-22T17:45:19Z","title":"VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14867","snapshot_observed_at":"2026-08-06T18:48:40.925409Z","title":"Viescore: Towards explainable metrics for conditional image synthesis evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:40.925409Z"},"links":{"cited_paper":"/paper/2312.14867","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:29c9a1319b772444a4a18a16df1a70dd801d4ba4722297302278435ee362d86b","observation_id":"a3bd7ea0-470b-434b-9038-2b132119e827","resolution":{"observed_at":"2026-08-06T18:48:40.925409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:55.020125Z","title":"Imagenhub: Standardizing the evaluation of conditional image generation models","venue":null,"work_id":"5288ba87-0bdc-4ec7-8365-77e409fa5b3e","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.094239Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:b418ca20760824abc22e2f8f7d2c08c1d5831137160a0d14b476c4be33ae9275","observation_id":"e38527a1-a279-4413-bc17-0dbf56168060","resolution":{"observed_at":"2026-08-06T18:48:55.134883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-06T18:48:41.170936Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.170936Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:c261fbb4708c4cbc937645b380f38cf77dd5a736bde50b1b0a167485efa2f320","observation_id":"273f83b8-2f55-4422-b866-b56ff5e11ddb","resolution":{"observed_at":"2026-08-06T18:48:41.170936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:54.784459Z","title":"Introduc- ing idefics2: A powerful 8b vision-language model for the community","venue":null,"work_id":"6659819c-3e14-4429-8981-f4b6c3837fe5","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.328554Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:76063d86e05af0b5809b0f3acd03e90cb2c146953ec013475caec4cf0742ee97","observation_id":"5d425981-fd93-4cfc-9610-296a2aac90b4","resolution":{"observed_at":"2026-08-06T18:48:54.842646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T18:48:41.472557Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.472557Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:d43a6935d352bded9526f0ebd7c56a9b2eda46a982c8db2c8496cb87529e78b2","observation_id":"c2fa4195-ca75-476c-bac3-732febbd8811","resolution":{"observed_at":"2026-08-06T18:48:41.472557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:41.543773Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.543773Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:a158346dacf85ac1db42baa750b20f1a2b7a6dbec4975dc39720a85e9c2996a3","observation_id":"70baf567-1bc0-4c63-bd42-dea7ad167215","resolution":{"observed_at":"2026-08-06T18:48:41.543773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:54.556844Z","title":"ZONE: Zero-shot instruction-guided local editing","venue":null,"work_id":"e5a6e077-51e2-40a3-9de2-7cbe2181e15c","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.666684Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:d95e642e0c7916717c64d4a1ab3d47a264e41e7987e4774c619457a208086724","observation_id":"ffb0ec51-6caf-4aa3-89b2-77cf5dd41369","resolution":{"observed_at":"2026-08-06T18:48:54.663638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:54.305668Z","title":"Rich hu- man feedback for text-to-image generation","venue":null,"work_id":"f3b8c721-aa47-4067-a54d-ef1e6dd63bd8","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.778736Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:5d2bba07e70d47e2775c60a61015d70f9d5b909a89acc3fc3155a2bc42d945ec","observation_id":"ed81f119-4d62-4a1e-b5d2-643bc5d08a86","resolution":{"observed_at":"2026-08-06T18:48:54.408687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:54.116961Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":"9f1d38bd-4689-4588-8a47-061b46203d0a","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.932198Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:d566720cadf46ee9d1d2f6d331000a00c0170403138e9d8d7edb974e03c90d67","observation_id":"35157127-5dbe-4d91-a02a-ebbc8c33f484","resolution":{"observed_at":"2026-08-06T18:48:54.181411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:53.942728Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"eb8fd14f-e342-4731-aefc-46989eb52046","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.044640Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:06858e15323b06c5d0e69688e6e27e4135c56e3b33303de51e6d1d0bcbd91ec2","observation_id":"fe292af6-2fba-4015-b442-285d7662e961","resolution":{"observed_at":"2026-08-06T18:48:54.009132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:53.740563Z","title":"Visual instruction tuning","venue":null,"work_id":"02f4b614-80b6-4a37-830b-a74255d0c829","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.110125Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:6dc65a7f530c01f73ad68bbfd2cf996ca68583ab509f23a643176912c6559f7c","observation_id":"de4403b8-8010-4dce-935d-617b596dc5a4","resolution":{"observed_at":"2026-08-06T18:48:53.803553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:42.239498Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.239498Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:0eaf54bf17191ebb8f955d48cadd84e99336a910e292c96de9c95860dd323140","observation_id":"efd8b911-2f75-4d3a-8a9e-9659053125a4","resolution":{"observed_at":"2026-08-06T18:48:42.239498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-06T18:48:42.388687Z","title":"Latent Consistency Models: Synthesizing high- resolution images with few-step inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.388687Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:09cd73a891568941826953af3e34635fc02857c55d3d088ee601f15a1f445802","observation_id":"dacaa74e-4b55-4d74-a232-6d874d6d3146","resolution":{"observed_at":"2026-08-06T18:48:42.388687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14180","last_updated":"2024-09-27T13:12:04Z","snapshot_observed_at":"2026-08-12T22:57:30.090578Z","submitted_at":"2024-08-26T11:08:44Z","title":"I2EBench: A Comprehensive Benchmark for Instruction-based Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14180","snapshot_observed_at":"2026-08-06T18:48:42.511233Z","title":"I2ebench: A comprehensive benchmark for instruction- based image editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.511233Z"},"links":{"cited_paper":"/paper/2408.14180","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:35cbdea5da71c764f50e38747d80d48a1059f4bdc80c14269274025fed218bb4","observation_id":"07d900e7-ac67-43a5-9e58-24830fffbc03","resolution":{"observed_at":"2026-08-06T18:48:42.511233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-13T13:02:41.137021Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-06T18:48:42.647440Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.647440Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:c14c11943f8f42f6711e2652dc7305a392331616d9e05aae62377e78822f5279","observation_id":"c4b4b26c-8708-43fa-a6a8-971199d3f9ae","resolution":{"observed_at":"2026-08-06T18:48:42.647440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:53.497975Z","title":"Watch Your Steps: Local image and scene editing by text instructions","venue":null,"work_id":"9aa58c4e-7650-44b3-bba8-487f097fb239","year":2025},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.778364Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:2e3ed61ddde17b27ea44b4cb2f68de0ee75848790958d1b61b936b28ff4b6549","observation_id":"3c18578f-3c62-4eee-9cae-6545d5f94e31","resolution":{"observed_at":"2026-08-06T18:48:53.622904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:53.272441Z","title":"Null-text Inversion for editing real images using guided diffusion models","venue":null,"work_id":"7a113587-d233-4e52-bfbc-8a13b9ea29a8","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.853041Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:ee2ba3dc3cb01e78be041b5d82c4b4bcd967a028e10d6e5676adafe460b38db0","observation_id":"9a4772f2-fbac-487d-803a-c6815fa42fc7","resolution":{"observed_at":"2026-08-06T18:48:53.365096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T18:48:42.928679Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:42.928679Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:ffab7e4bfb74baf393fc1e2e3b6360e481007457a83aa676009d90683dd000ee","observation_id":"601f0582-615a-48d7-b0ca-9a285694f71e","resolution":{"observed_at":"2026-08-06T18:48:42.928679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:53.032840Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":"9d50e2e6-1df9-441b-bf70-43eba5b3557b","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.018862Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:56f0e718a9ca99a97821e429794f96659442d551ac9d27f40c13aeab6809fe87","observation_id":"229a0c2d-1188-4b68-92e6-46532039745b","resolution":{"observed_at":"2026-08-06T18:48:53.165587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T18:48:43.156247Z","title":"SDXL: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.156247Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:cb316b330b1e3f648ac4771c42d1ebf988b10f40565706b64eeefcbc5c22e675","observation_id":"b3080117-a3f8-4b4a-8d7d-6d700189f94a","resolution":{"observed_at":"2026-08-06T18:48:43.156247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:52.783310Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"91174db0-b4d1-40ff-9c78-b917f29c2b59","year":2021},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.294518Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:3d5cf5349ddf7a482feb386ce933eb0033aef506063564f3702497906cc19459","observation_id":"09854faa-21f6-4fb5-8c77-519bf6872ec0","resolution":{"observed_at":"2026-08-06T18:48:52.881947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T18:48:43.438852Z","title":"Hierarchical text-conditional image gen- eration with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.438852Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:97c569a726da86d71f221a06e6d358f811c8ca42931eb24ed99df7efec7fd1da","observation_id":"09d01c24-5c1d-4661-992e-ce783d53ac0c","resolution":{"observed_at":"2026-08-06T18:48:43.438852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:52.508361Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"1df12cf0-7f4f-4d6a-8e2f-3bcc0a3042e3","year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.638757Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:6e6b680eed27bce7d2a82384717af41d0ffe2e5fd8b774aa1e642eadff9ab401","observation_id":"4e3a6838-2556-48b7-badd-5e638a794f9b","resolution":{"observed_at":"2026-08-06T18:48:52.623565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:52.260691Z","title":"Emu edit: Precise image editing via recognition and gen- eration tasks","venue":null,"work_id":"376ccad5-c90d-4b2d-8bc8-a71c043bb1aa","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.698204Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:d5314eca8f64ceff050c36af1475bb0567994cfc6823e463c3c12d43db7f8bad","observation_id":"35f71e6b-2bfe-459a-b7b6-b6c4089570f1","resolution":{"observed_at":"2026-08-06T18:48:52.368993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2310.67890","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:47.199745Z","title":"Aria: Advancing multimodal ai","venue":null,"work_id":"f5a27e9b-48c0-432c-b069-39050950e25b","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.804495Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:2ab092629868e1f22ece2cd4dc39993e68a2c7603f2e742d1fe9f79618e53a9d","observation_id":"b32463c9-32f5-4501-ae26-d93768503d1b","resolution":{"observed_at":"2026-08-06T18:48:47.318442Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T18:48:43.954569Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:43.954569Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:847a62c3957d07074f3b9b5c442a3f4bed6025f5dc23ab47fedb4f188779197d","observation_id":"2152a224-2206-4fba-8722-4e3ed131b37d","resolution":{"observed_at":"2026-08-06T18:48:43.954569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09927","last_updated":"2025-01-17T02:47:25Z","snapshot_observed_at":"2026-08-12T23:55:21.276578Z","submitted_at":"2025-01-17T02:47:25Z","title":"IE-Bench: Advancing the Measurement of Text-Driven Image Editing for Human Perception Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09927","snapshot_observed_at":"2026-08-06T18:48:44.077282Z","title":"Ie-bench: Advancing the measurement of text- driven image editing for human perception alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.077282Z"},"links":{"cited_paper":"/paper/2501.09927","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:b9b9d9873e310e1f2c8833e11e98953d820bb28ed615a44dbe0d75361b770d25","observation_id":"08b2c90e-c4ba-43fd-98e1-1110031dbea4","resolution":{"observed_at":"2026-08-06T18:48:44.077282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T18:48:44.180428Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.180428Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:f28933fd4a997b1d8ce483805c6f677553af6dc8daa52c528291acee9d11ed6d","observation_id":"445f8659-fb5b-4566-8c39-0f50ed8a2670","resolution":{"observed_at":"2026-08-06T18:48:44.180428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:52.067059Z","title":"Plug-and-Play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"ff782d66-f666-4796-b009-2df3e75cb748","year":1921},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.295558Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:b99ebc09683cf81004e8a6169d9c28b655d92b2a25373f0d03b7bcf07d2fd0a6","observation_id":"05dfb526-9c39-40de-8b2e-3edbf472e13b","resolution":{"observed_at":"2026-08-06T18:48:52.143028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:51.822480Z","title":"EDICT: Ex- act diffusion inversion via coupled transformations","venue":null,"work_id":"b1520f3b-5cd7-4450-8a14-e57ee01e2237","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.405595Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:30028e7b5e0f82738b7943c8d0e4dcc03c72c9eef250e6ed65968ae04c3016d1","observation_id":"55527c56-02bd-4408-8d9d-e4e5ecbb3a97","resolution":{"observed_at":"2026-08-06T18:48:51.934383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T18:48:44.469725Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.469725Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:f018c5b5825c5ed1168db88500bb557266f89b1437a421c0d6f50a2b84846095","observation_id":"ee6d5465-21ad-4c2f-b1f7-cbfec2c7a076","resolution":{"observed_at":"2026-08-06T18:48:44.469725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:44.522758Z","title":"Cogvlm: Visual expert for pretrained language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.522758Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:cf22377e3fa8e95b5e34de21bcea605b42a39261a5c6090e566bcae14828b2c1","observation_id":"a542c4b8-016b-4404-9502-a97b63c1b5ea","resolution":{"observed_at":"2026-08-06T18:48:44.522758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:51.558583Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"7e853719-86c5-4025-981c-b88b318e0a41","year":2004},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.613567Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:4f87fd49ef45097b350c5feac550821c62d3a6b2f744bc53c510b0eb121c36c1","observation_id":"6c547196-5242-45f6-ad04-474f1adf368d","resolution":{"observed_at":"2026-08-06T18:48:51.661975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07199","last_updated":"2025-04-28T14:16:29Z","snapshot_observed_at":"2026-08-12T22:03:02.963211Z","submitted_at":"2024-11-11T18:21:43Z","title":"OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07199","snapshot_observed_at":"2026-08-06T18:48:44.706303Z","title":"Omniedit: Building image edit- ing generalist models through specialist supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.706303Z"},"links":{"cited_paper":"/paper/2411.07199","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:e30628d59ef6bbb4c27a8508bd6f55dc26e664b11696d872b321419f5d8f1e5c","observation_id":"ec506cb9-3f42-4de6-b3f2-5ae60bd1a379","resolution":{"observed_at":"2026-08-06T18:48:44.706303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:51.369651Z","title":"A latent space of stochastic diffusion models for zero-shot image editing and guidance","venue":null,"work_id":"46fdc0b6-5c0f-4616-803d-a123f36c8b21","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.848440Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:05b30cbd91f4f4aae6d89e74765fc42f1c180b7dacd04aa959c82567c9c071bf","observation_id":"2df7148e-531d-4d25-9337-322a52b82641","resolution":{"observed_at":"2026-08-06T18:48:51.457038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:51.193318Z","title":"Uncovering the disentanglement capability in text- to-image diffusion models","venue":null,"work_id":"6d03a2bf-5041-497d-a4cf-743c5c357ac3","year":1900},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:44.968134Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:b889094561bc64e53c57a0d8db632dc134d5ce38193af1edbf7d11b9d4faede4","observation_id":"a72c81cc-f3fb-433b-a8bd-549b68e2626c","resolution":{"observed_at":"2026-08-06T18:48:51.269087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-13T09:05:45.892435Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-06T18:48:45.124627Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.124627Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:bad5caefbc533c7b1cfaacd469eb23acf729186b4ccdcf7f62ace1c815d660d2","observation_id":"98f7c310-02ba-486c-9cc2-3360905cbdde","resolution":{"observed_at":"2026-08-06T18:48:45.124627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:50.942423Z","title":"Multimodal large language models make text-to- image generative models align better","venue":null,"work_id":"352632e3-e8a4-44da-9675-7c2c8ba1950c","year":2025},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.244020Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:85eaad5a3b5241bd330c2444c89d9ce89c2a36a5f9cc924a95074156466b6313","observation_id":"5767bcff-6c33-422a-91c1-7e7ad09062b5","resolution":{"observed_at":"2026-08-06T18:48:51.082936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15100","last_updated":"2024-04-23T14:53:15Z","snapshot_observed_at":"2026-08-13T00:23:45.161578Z","submitted_at":"2024-04-23T14:53:15Z","title":"Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15100","snapshot_observed_at":"2026-08-06T18:48:45.322166Z","title":"Multimodal large language model is a human-aligned annotator for text-to- image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.322166Z"},"links":{"cited_paper":"/paper/2404.15100","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:90ec9b6a707dda7031076df9211c9b389100037b98baaea0bb202ee470b9b258","observation_id":"f2883f65-6823-4ff0-ae40-905a7a59639b","resolution":{"observed_at":"2026-08-06T18:48:45.322166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:50.682622Z","title":"Human preference score: Better aligning text- to-image models with human preference","venue":null,"work_id":"1db3f9c4-142b-4c91-80d6-725b2590a75c","year":2023},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.426857Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:e211b71288a888f66b0386813814e76030a534147626156e1037b9f68f684c0e","observation_id":"a236bf43-d83d-42a8-8ba2-a8ba8ae1c26f","resolution":{"observed_at":"2026-08-06T18:48:50.816393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:50.424502Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"6c32eddc-a44a-4d73-a9c7-83d2b10c18cb","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.562550Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:4a2d16eb83680c9c1c7997e213782b2ed528a9e39c1598ad622051849badeebf","observation_id":"7bc553e3-d597-4a0d-96a5-3c733c4c4341","resolution":{"observed_at":"2026-08-06T18:48:50.561184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:45.697618Z","title":"Inversion-free image editing with natural language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.697618Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:0710220762656e4f90bae3ef009646f8229470ecd1acddfdb6ca996d481a9a14","observation_id":"3e5e715d-3bf9-467b-be0d-808afe6ccbc4","resolution":{"observed_at":"2026-08-06T18:48:45.697618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T18:48:45.861490Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.861490Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:7718da546b358e4424231b11d1dcf85d1ddab2ded1620697b200d46ebe69c7d9","observation_id":"9666feda-0088-42e3-b9bf-84424452a916","resolution":{"observed_at":"2026-08-06T18:48:45.861490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:50.179373Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"e105507e-6815-4130-9215-390d3ad9e17e","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.909446Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:d323b8701123ebf89f799cd5c8d0d200cd18f23f8ad195c059add45fedfb3730","observation_id":"a4d73f97-fff5-47e6-9079-cf3839a4e9af","resolution":{"observed_at":"2026-08-06T18:48:50.288946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-13T14:13:01.385510Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-06T18:48:45.958345Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? arXiv preprint arXiv:2210.01936, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:45.958345Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:48bd0f1afd6bfae86fc857b6ac03b07e9a963b2b58442198377887a6b462755e","observation_id":"48d636dd-8c85-446d-acd7-e7f440c730b8","resolution":{"observed_at":"2026-08-06T18:48:45.958345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:49.866856Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"c2cfea9d-6e03-4f56-b8ea-4155bdf0eb8c","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.055557Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:f442384f3eaa7eb252907a46ea4bbb8b198f9873a787ebeeeded52a019e3cdb0","observation_id":"a979365d-1191-46f0-8491-d82a85753118","resolution":{"observed_at":"2026-08-06T18:48:50.019536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:49.644897Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"0804b321-2d3a-46fd-8d4e-598f26bb3965","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.208380Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:79f50714b91674233208abc01c39d0aa53e1c925f45b31be3374761dc637da22","observation_id":"75fd2958-d867-4973-a9a6-ac2e722471aa","resolution":{"observed_at":"2026-08-06T18:48:49.728766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:49.409653Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"e8e51d1d-79fc-4e45-812e-bc847f640f78","year":2018},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.313062Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:04c8f7b48600b18fd9f1bd21c99270dd10d0e5dc92ebbfe710738711bfe42217","observation_id":"03a1bcbd-f75b-4f0d-a28f-4bbefc6f4f15","resolution":{"observed_at":"2026-08-06T18:48:49.519550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:49.136929Z","title":"Learning multi- dimensional human preference for text-to-image generation","venue":null,"work_id":"f54858b6-e070-4bb9-9d82-366f91cd36a7","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.376211Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:0eb664bc4238d0bb18637b3243067e3304ffa9cd62faa1e4dd7bce4f2311a5d1","observation_id":"e991b1d4-3cab-4cec-a433-a5ba5a8b1f55","resolution":{"observed_at":"2026-08-06T18:48:49.280332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:48.863419Z","title":"Hive: Harnessing human feedback for instructional visual editing","venue":null,"work_id":"9dfc8f17-cf3a-43b7-83ae-9af43d1e8246","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.496584Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:8e8388f848bd7e1ec590bab0feb46e086dbde2defeafcb840699315baebe36c4","observation_id":"aaa52f07-c2a3-4c94-b459-c7435d1050ce","resolution":{"observed_at":"2026-08-06T18:48:49.021181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05282","last_updated":"2024-12-19T04:42:41Z","snapshot_observed_at":"2026-08-13T22:56:43.546810Z","submitted_at":"2024-07-07T06:50:22Z","title":"UltraEdit: Instruction-based Fine-Grained Image Editing at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05282","snapshot_observed_at":"2026-08-06T18:48:46.618116Z","title":"UltraEdit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.618116Z"},"links":{"cited_paper":"/paper/2407.05282","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:33b2aa448f20fca4db79b020af3f1b683da904d7fd4142a86776c66062cc7af1","observation_id":"1fef0756-b515-4779-be69-9de6e264fb0f","resolution":{"observed_at":"2026-08-06T18:48:46.618116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:48.574298Z","title":"Can you rate how successful the edit instruction [IN- STRUCTION] has been executed from the first image to the second image with a score from 0 to 10?","venue":null,"work_id":"1224fb61-2c77-44a6-8a61-e563011eec38","year":2024},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:46.673046Z"},"links":{"citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:ff94f4ce0ef55971407969b7b1c2b95c52cef59a2aef663a2b99859d685f5ac2","observation_id":"1f9888cd-41c0-49be-a770-d0ce2f9a8846","resolution":{"observed_at":"2026-08-06T18:48:48.700573Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":36},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2507.07317."}