{"as_of":"2026-08-10T02:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d82ff5bb2712fe81d0c31d86e576fb32c20a2dae62016260eed6f35906f8808","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:01:45.312578Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20155/citation-record","integrity":"/paper/2506.20155/integrity","json":"/paper/2506.20155/citation-record.json","paper":"/paper/2506.20155"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.523645Z","title":"In: Eu- ropean Conference on Computer Vision","venue":null,"work_id":"af7dea9c-f8cc-49cd-abf3-aef8194b8792","year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.229697Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:500ac5287cd6cf68d4cf5613491fcd003f72461b97329fa405bc6bc10e1624d9","observation_id":"63842f2a-a4f4-426d-84f7-9719f0a8d446","resolution":{"observed_at":"2026-08-06T23:01:45.525858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.232608Z","title":"Advances in Neural Information Processing Systems35, 25005–25017 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.232608Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:2b013c134a067c1e5b0fa3a8479f1f90a0cc6f2329138bf1cc175b869cdb0934","observation_id":"7a9c4dc9-f9cc-4346-a289-f053b251e658","resolution":{"observed_at":"2026-08-06T23:01:45.232608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.235520Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.235520Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:a45eb2fd4175d9b6b82a2f92bdb7811e2086828321fd4930d8de8229d3c6f329","observation_id":"f8d52d0a-0b8c-498b-9b2e-a49dacac768a","resolution":{"observed_at":"2026-08-06T23:01:45.235520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-01T15:07:11.635426Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-06T23:01:45.238141Z","title":"arXiv preprint arXiv:2210.11427 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.238141Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:61c42d1da3a64985547aa11e37d50cf5ff1082bf645a040bdbfbff0bb9be161d","observation_id":"26216aec-dd4b-4631-bdb3-2504119f249f","resolution":{"observed_at":"2026-08-06T23:01:45.238141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-06T23:01:45.240497Z","title":"arXiv preprint arXiv:2208.01618 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.240497Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:bacc015d9324bb1141f08df04006656576fbe510e96ec1dc6ad7b955d1dd4900","observation_id":"2d5b915b-9238-4344-bc73-ff7e2a55b5e7","resolution":{"observed_at":"2026-08-06T23:01:45.240497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.510586Z","title":"ACM Trans- actions on Graphics (TOG)41(4), 1–13 (2022)","venue":null,"work_id":"b33c21ca-4d3f-4e33-85f2-601983a2da34","year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.243496Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:01c302b121a5a126986265425d4377d84e7c74ca094340de3e0fb4cbe6fb6e34","observation_id":"f369d4c6-545e-4ce1-a20c-7614b311dc57","resolution":{"observed_at":"2026-08-06T23:01:45.512517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00946","last_updated":"2021-12-16T17:05:46Z","snapshot_observed_at":"2026-08-08T05:43:23.144119Z","submitted_at":"2021-08-02T14:46:46Z","title":"StyleGAN-NADA: CLIP-Guided Domain Adaptation of Image Generators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00946","snapshot_observed_at":"2026-08-06T23:01:45.246786Z","title":"corr abs/2108.00946 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.246786Z"},"links":{"cited_paper":"/paper/2108.00946","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:53b4bc458ebb01f1aae58bd557d427e36284d31da8a4d042137d3954311a19c3","observation_id":"4934b2df-c7be-49e9-b650-e1d05ee493f7","resolution":{"observed_at":"2026-08-06T23:01:45.246786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T23:01:45.248861Z","title":"arXiv preprint arXiv:2208.01626 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.248861Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:ee80cfa6bb01f60c92418c5f4d8417e35fdaad31a2ed898f8349cc5266d6a320","observation_id":"e34c8a15-1589-4969-828d-987e952791b5","resolution":{"observed_at":"2026-08-06T23:01:45.248861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.504645Z","title":"In: Seminal Graphics Papers: Pushing the Boundaries, Volume 2, pp","venue":null,"work_id":"beb0c4b7-4ba6-490f-b529-4f5c8584622c","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.250924Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:f7a189b2ff1f777ea4212a56b71fea67a7c70102cbf3128f801b7f9ef87ee47d","observation_id":"d0c51ae3-6939-4672-bb59-bfdf9b5d6f39","resolution":{"observed_at":"2026-08-06T23:01:45.506900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T23:01:45.253190Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.253190Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:ba1ba050e4ca18e401ae8b3bfe8444138af80b7b812411a80c64bc1c83017df3","observation_id":"105111a4-c3de-4497-b8ff-0da809f39dc9","resolution":{"observed_at":"2026-08-06T23:01:45.253190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.256268Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.256268Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:e7fca5073daf279e94065e44ec6aebf00bb7f5b9e737604a6d2e2cdf547ff16d","observation_id":"6cbc26f2-1ba0-4598-b454-aa31b300031e","resolution":{"observed_at":"2026-08-06T23:01:45.256268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13495","last_updated":"2024-12-01T14:04:22Z","snapshot_observed_at":"2026-08-06T06:27:20.237446Z","submitted_at":"2023-03-23T17:56:10Z","title":"ReVersion: Diffusion-Based Relation Inversion from Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13495","snapshot_observed_at":"2026-08-06T23:01:45.258068Z","title":"arXiv preprint arXiv:2303.13495 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.258068Z"},"links":{"cited_paper":"/paper/2303.13495","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:9fbdcbbf14308e45fe68789f41040fa21b7173755371504bdea73fee2507ca36","observation_id":"9abc3702-6b80-470c-ae08-dab24f450d5b","resolution":{"observed_at":"2026-08-06T23:01:45.258068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-08-06T23:01:45.260035Z","title":"arXiv preprint arXiv:2404.09990 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.260035Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:c0e3851c83757a8e80a1c28b3ed138dceeeb3fbd20636b152c7829f9d48ad042","observation_id":"b0baf622-1999-46c8-b38d-23b2e2f7f2fa","resolution":{"observed_at":"2026-08-06T23:01:45.260035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12974","last_updated":"2024-02-21T14:04:30Z","snapshot_observed_at":"2026-08-09T14:50:35.586296Z","submitted_at":"2024-02-20T12:51:17Z","title":"Visual Style Prompting with Swapping Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12974","snapshot_observed_at":"2026-08-06T23:01:45.262389Z","title":"arXiv preprint arXiv:2402.12974 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.262389Z"},"links":{"cited_paper":"/paper/2402.12974","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:1316d5078c97023e1d5b68fc6934afbb61531b660b9fda27b4ca4cdca9b2e87d","observation_id":"21b567c9-9b21-4e09-84fb-8251b44c839e","resolution":{"observed_at":"2026-08-06T23:01:45.262389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.264208Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.264208Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:8d00b949f9277bdaacb93fc03f2613a99864dd33b07f69d0ab3f10ac065cb6d8","observation_id":"b3cdd97b-0cdd-4f8e-b9cb-c635a6775789","resolution":{"observed_at":"2026-08-06T23:01:45.264208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.492419Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"6234f32a-e076-4362-b1e9-08acee1f8468","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.266091Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:dbed4fec6ae440f31e049cf3d943e19a550c51b3b9fba076f75078815e0a921e","observation_id":"71c56441-30b6-48ae-9e55-ddb8d0edebcf","resolution":{"observed_at":"2026-08-06T23:01:45.494392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.485260Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"75882bc0-7f13-41be-b2e6-d481689a0b23","year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.267725Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:c2b30fbe3ab32706a2bd0a810fdcaaf1612babe3e7b802cd4ea353e83c270eac","observation_id":"2834c3ec-0d68-4381-8cf3-761c4a8be13d","resolution":{"observed_at":"2026-08-06T23:01:45.487638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10960","last_updated":"2023-03-29T06:39:50Z","snapshot_observed_at":"2026-08-06T07:04:39.017029Z","submitted_at":"2022-10-20T02:07:23Z","title":"Diffusion Models already have a Semantic Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10960","snapshot_observed_at":"2026-08-06T23:01:45.269442Z","title":"arXiv preprint arXiv:2210.10960 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.269442Z"},"links":{"cited_paper":"/paper/2210.10960","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:e789b02767ccf4d35587cfb114f7c8892c1372d74ecba038fdd7981e3dbdce20","observation_id":"6bea4e3f-dd61-4cf3-a3ef-ef0225c73abb","resolution":{"observed_at":"2026-08-06T23:01:45.269442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.01088","last_updated":"2017-06-06T15:16:19Z","snapshot_observed_at":"2026-07-06T05:40:31.165782Z","submitted_at":"2017-05-02T17:44:01Z","title":"Visual Attribute Transfer through Deep Image Analogy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.01088","snapshot_observed_at":"2026-08-06T23:01:45.272000Z","title":"arXiv preprint arXiv:1705.01088 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.272000Z"},"links":{"cited_paper":"/paper/1705.01088","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:ea53c7243866a73cf2634f7cc57ac55319d00e577bbabe7097296af105203e2d","observation_id":"58c40735-d3a7-4b17-9039-954907774a6f","resolution":{"observed_at":"2026-08-06T23:01:45.272000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.274265Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.274265Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:d96754ea17e2298283fa5fbd4f280d6959b16c64ac6e688a7df20ea5c19498fd","observation_id":"8d7ee6fe-8ef2-4e4d-b2e8-5fa26769f3b3","resolution":{"observed_at":"2026-08-06T23:01:45.274265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.276351Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.276351Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:184812b6ecbfab200bb57b6e31a86b499716d196c3a43d44cfef6ab8c44baace","observation_id":"8deb9195-55cf-491c-bd84-f1d4935b364b","resolution":{"observed_at":"2026-08-06T23:01:45.276351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.278560Z","title":"Advances in neural information processing systems36(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.278560Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:b2db69502ec8dd6060d03dfc0116e9284f77e24d07e01f858c3a88bdae222069","observation_id":"c47c203b-50ac-4780-866f-bfebb66343c5","resolution":{"observed_at":"2026-08-06T23:01:45.278560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04040","last_updated":"2022-02-08T18:08:24Z","snapshot_observed_at":"2026-07-06T12:35:45.839780Z","submitted_at":"2022-02-08T18:08:24Z","title":"Self-Conditioned Generative Adversarial Networks for Image Editing","version":1},"cited_work":{"arxiv_id":"2202.04040","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.04040","snapshot_observed_at":"2026-08-06T23:01:45.351930Z","title":"Self-Conditioned Generative Adversarial Networks for Image Editing","venue":"cs.CV","work_id":"42afa1f0-6bc6-4b44-bec6-6a98a6f7cbff","year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.280479Z"},"links":{"cited_paper":"/paper/2202.04040","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:92b386a81491ff432e83412116dac0bd215f3d4aea2905a97a7ce2f501b20863","observation_id":"39171219-d684-40ba-add2-30ac1086b6eb","resolution":{"observed_at":"2026-08-06T23:01:45.356190Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-08T06:35:17.078531Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-06T23:01:45.282474Z","title":"arXiv preprint arXiv:2108.01073 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.282474Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:4043485ab6c1f35fef47cc1f11fb64bf590fd25eb53a677faa4b1c884342809b","observation_id":"8402d21b-fbe6-4127-a2b9-a02fa61fdc37","resolution":{"observed_at":"2026-08-06T23:01:45.282474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.467179Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"3f17330b-be51-4fa6-b242-ead9771b5cb5","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.284521Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:845675e2a1e587a20c658f0f3288d643d343d31593470db3f5b550625fc8ef40","observation_id":"d599e44a-63e2-43c4-9112-8ae192f773ad","resolution":{"observed_at":"2026-08-06T23:01:45.470118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.460467Z","title":"Advances in Neural Information Processing Systems36 (2024)","venue":null,"work_id":"ada0cfeb-5bb2-4151-9e34-9a94ccbbe091","year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.286698Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:1b951b9afdea9150cef4fe730825e2a1b29d6049eb98508b15e159556fcdcea1","observation_id":"2c658cac-b56d-471a-8773-500518eeabe9","resolution":{"observed_at":"2026-08-06T23:01:45.462818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-06T23:01:45.288371Z","title":"arXiv preprint arXiv:2112.10741 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.288371Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:d26467ebdef166993dfb8c2e8a25e9ff550aa8e49bde6ca47f3edb7d7d42e335","observation_id":"f7b71cce-8b33-4546-9127-3ad99d450057","resolution":{"observed_at":"2026-08-06T23:01:45.288371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.290692Z","title":"In: ACM SIGGRAPH 2023 Conference Proceedings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.290692Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:299b37a580117089b16dfca4b041709bd2d202d104567594ea1756c8eb0d0915","observation_id":"8aa51fc3-2f46-4484-b968-4093d8037714","resolution":{"observed_at":"2026-08-06T23:01:45.290692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.292311Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.292311Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:39c744891ce525577e6deffd54c218e8af32a1d8713fe29d83285cabff4e8a1c","observation_id":"751e79de-6253-47d4-b8f6-73730eb21ec5","resolution":{"observed_at":"2026-08-06T23:01:45.292311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T23:01:45.293871Z","title":"arXiv preprint arXiv:2010.02502 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.293871Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:0d04e681385438cb759b16627cf8bfb78021c33212c24c94c3ec8ee8992026c5","observation_id":"bfaf7c27-9c29-4668-84ee-5f8db63db33e","resolution":{"observed_at":"2026-08-06T23:01:45.293871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.448286Z","title":"In: ACM SIGGRAPH 2023 Conference Proceedings","venue":null,"work_id":"314b5543-51f4-4b21-b1c3-c17977f6813e","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.295669Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:6b42f42592b317f3dd8ee45be1751bc5397b61b9d20766c71599b727d54d4094","observation_id":"64db538b-27e0-4416-a65d-efb3bbd75e41","resolution":{"observed_at":"2026-08-06T23:01:45.450239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.441919Z","title":"In: Proceedings of the IEEE/CVF Con- ference on Computer Vision and Pattern Recognition","venue":null,"work_id":"b01c4a15-954d-4eec-b98e-a768f40cf281","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.297670Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:9fdfcd2eb6b928a65ecc20e925d74430ce3362237fd8f0b892bfd04531d1903c","observation_id":"6a6681aa-8972-41bf-aa6e-d74f7025c196","resolution":{"observed_at":"2026-08-06T23:01:45.444563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.299381Z","title":"IEEE transactions on image processing 13(4), 600–612 (2004)","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.299381Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:26a8c9c502144537b8104c34acdedd0c84ab093a43a5721d5bee66735e657e13","observation_id":"787c204e-ae6f-4844-8ae5-aef6cf94a459","resolution":{"observed_at":"2026-08-06T23:01:45.299381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.301015Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.301015Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:115f1011f4eea30c2724734892096dcba07cb920db85f791adffb8789db22e9e","observation_id":"ce3abd96-e015-47a2-a4bb-d9846fc5d5a4","resolution":{"observed_at":"2026-08-06T23:01:45.301015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.429273Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"282193b1-e9c1-444d-a94a-a8cd426ee203","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.303045Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:c91eab69a679f01af84f7415a3c3c2f45c90de1b27a9b72b37d1a5445b1c3598","observation_id":"857c6975-e461-497b-a6ad-45751ac944cd","resolution":{"observed_at":"2026-08-06T23:01:45.431350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.423581Z","title":"Advances in Neural Information Processing Systems36(2024)","venue":null,"work_id":"2aa80d5e-96fe-4553-a4b4-ced813173764","year":2024},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.304887Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:7a5869088a05ae234e49e079adf4818a8db029643c56c875ee6c05f3a3c11717","observation_id":"5c9b7524-6092-46e0-8cf5-7457ab91b62c","resolution":{"observed_at":"2026-08-06T23:01:45.425581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12149","last_updated":"2024-03-18T08:36:02Z","snapshot_observed_at":"2026-08-06T13:30:35.015470Z","submitted_at":"2023-10-18T17:59:02Z","title":"Object-aware Inversion and Reassembly for Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12149","snapshot_observed_at":"2026-08-06T23:01:45.306612Z","title":"arXiv preprint arXiv:2310.12149 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.306612Z"},"links":{"cited_paper":"/paper/2310.12149","citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:70a8805ea04636aca5c44079f30a3dc7cddaeebb0c9cca4d2afd0f46fe628e46","observation_id":"77c5360f-6e25-470e-9d49-77d3f099229c","resolution":{"observed_at":"2026-08-06T23:01:45.306612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.308626Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.308626Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:c2166a7016c495a63b31171c87c016764cfe76e1eab418671ec4b0a3434d059d","observation_id":"1fe0a712-0ad0-4684-bf72-d80ffc01ea95","resolution":{"observed_at":"2026-08-06T23:01:45.308626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.310339Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.310339Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:3e68569922cd4940d84cadcc2155c8a4ffd5010ed11845595c46ceaf5bdf5717","observation_id":"e8896f84-c290-4ec2-a2bb-902e102321dc","resolution":{"observed_at":"2026-08-06T23:01:45.310339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:45.411479Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"3c127e3e-8145-4f07-a88b-b8f8132162c6","year":2023},"citing_paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:45.312578Z"},"links":{"citing_paper":"/paper/2506.20155"},"observation_digest":"sha256:a9fcfc5f461ed113df490025769bab27b62630842cf26ed1fc465bca1c4f84b4","observation_id":"cc9d4e10-4d87-42cd-aa45-fcde98b9ce88","resolution":{"observed_at":"2026-08-06T23:01:45.413558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20155","last_updated":"2025-06-25T06:20:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T07:52:14.406842Z","submitted_at":"2025-06-25T06:20:36Z","title":"Towards Efficient Exemplar Based Image Editing with Multimodal VLMs"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.20155."}