{"as_of":"2026-08-11T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa5f93941ea1f0d435514f11a674e49a965c36c2bce7472c9f9a002590b38213","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T04:30:28.636915Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T21:23:41.271521Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T21:28:58.249219Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"cited_work":{"arxiv_id":"2604.24625","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24625","snapshot_observed_at":"2026-07-03T21:28:58.249219Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","venue":"cs.CV","work_id":"1fa26006-b6e7-47ac-8395-f4578fca660a","year":2026},"citing_paper":{"arxiv_id":"2605.24674","last_updated":"2026-05-23T17:22:14Z","snapshot_observed_at":"2026-08-07T07:22:50.887133Z","submitted_at":"2026-05-23T17:22:14Z","title":"Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T13:37:09.892339Z"},"links":{"cited_paper":"/paper/2604.24625","citing_paper":"/paper/2605.24674"},"observation_digest":"sha256:97a4b8ddcbd4c1e110b14df81e9b5a9d39e68217e3f899cba250c5c9f672939f","observation_id":"ed7c5895-4410-421c-a7c9-af892091f48f","resolution":{"observed_at":"2026-06-30T13:44:41.150231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"cited_work":{"arxiv_id":"2604.24625","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24625","snapshot_observed_at":"2026-07-03T21:28:58.249219Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","venue":"cs.CV","work_id":"1fa26006-b6e7-47ac-8395-f4578fca660a","year":2026},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-03T22:17:48.449247Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-02T13:56:43.671622Z"},"links":{"cited_paper":"/paper/2604.24625","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:6f38ba8615af301bc4b23aa927a661fac898ef85d065db3aa2c1b7b02212d2c3","observation_id":"81170c89-5dcd-4806-b952-1138c72f9bc5","resolution":{"observed_at":"2026-07-02T13:56:59.012818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"cited_work":{"arxiv_id":"2604.24625","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24625","snapshot_observed_at":"2026-07-03T21:28:58.249219Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","venue":"cs.CV","work_id":"1fa26006-b6e7-47ac-8395-f4578fca660a","year":2026},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-03T22:17:48.449247Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-03T21:23:41.271521Z"},"links":{"cited_paper":"/paper/2604.24625","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:2be9840ed93c7e3bd897dac800fa9167f25ed04a873f910d4b51a3b64ca1277e","observation_id":"2cac8ef2-7c57-4dd2-a656-8f1d4d6fb016","resolution":{"observed_at":"2026-07-03T21:28:58.250641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.24625/citation-record","integrity":"/paper/2604.24625/integrity","json":"/paper/2604.24625/citation-record.json","paper":"/paper/2604.24625"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:4e2f065efcffccb3d6d5722ff983f607c0489d3edc4f7eec0ee5a8b2724e9058","observation_id":"2874846a-c909-4187-bb09-5518e054697c","resolution":{"observed_at":"2026-05-11T21:41:19.360977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:59c4ca0e95ab2cfda693da9685ab9ca81a3629d2dddf473f9c4570ee65baada4","observation_id":"a78a23f0-fd8a-41dd-a087-df2d0e9e740c","resolution":{"observed_at":"2026-05-11T21:41:19.383070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"ca0b12aa-6e3d-4776-a623-5fb794cd099d","year":2023},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:5f42522b6655d4b864a86039864599b74f3dea87a0b9b99ab2d4b1bfc9de93c2","observation_id":"9451513a-ac71-49f7-83b3-8e578c0c2cba","resolution":{"observed_at":"2026-05-26T20:53:02.747717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:a67ecbd1426d17078c66c43dbf6b6d7d916701f708fe95aa28e62185b1e99892","observation_id":"c64ff326-3b9b-4328-a666-044ec560aa0d","resolution":{"observed_at":"2026-05-11T21:41:19.216281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T16:51:14.299739Z","title":"Blip3o-next: Next frontier of native image generation","venue":null,"work_id":"b51bf787-a19b-47bb-9114-1a1a29263297","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:63aa489f9a69a2f01898391cbeb6736015911c68c2ffe10b35d2ce085a048f5f","observation_id":"abe6e895-6ab0-4119-bfb8-9dfd70fff197","resolution":{"observed_at":"2026-05-11T21:41:19.222593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:9eefb402f5c04ca9d1b63423a5167046b12ad9697a4d5fc95d3fcbc0671a587c","observation_id":"e8ea0ca8-cd9e-45c2-9baf-38e0b3f0acbf","resolution":{"observed_at":"2026-05-11T21:46:14.055858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"cited_work":{"arxiv_id":"2602.06442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.06442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatumm: Robust context tracking for conversational interleaved generation","venue":null,"work_id":"6c1fcebd-1fe2-4179-b518-3b6bcf72241f","year":2026},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2602.06442","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:3fdaf746bfca6b09dbd5a9a9e5f92aab76c98d4507637eb3d36df85cde466615","observation_id":"38fdb81e-6299-4b00-bdb2-00d92e0fe034","resolution":{"observed_at":"2026-06-02T04:04:28.060339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-11T10:16:40.394612Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:d62ea13318fc45abc3d20e4dbb8b7b9ebc6bd50a17ef52b8226a932e1c19a22d","observation_id":"a67b3420-a60c-476f-94ec-7d97852d5a32","resolution":{"observed_at":"2026-05-11T21:46:15.005174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamllm: Synergistic multimodal com- prehension and creation","venue":null,"work_id":"c3400e50-ad37-4a33-9cbc-424c2834aa50","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:e9193f1e0ec98cd68e62354df052722e648e6454bc97a633bc5edb17939a03d8","observation_id":"e0f0ab6a-cd87-46e2-989e-2f305261a917","resolution":{"observed_at":"2026-05-26T20:53:02.721789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17022","last_updated":"2026-04-12T04:05:04Z","snapshot_observed_at":"2026-08-11T11:50:45.646138Z","submitted_at":"2025-05-22T17:59:58Z","title":"GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.17022","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17022","snapshot_observed_at":"2026-07-04T16:39:58.241853Z","title":"GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning","venue":"cs.CV","work_id":"b2fba730-5ab1-403b-aa1f-8dffe2424629","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2505.17022","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:9c528a411ccc749e99db5b4dd3ea2aac86bb505ffd7b01a1d46e59b4b1967f39","observation_id":"e500cf13-84a6-4c94-95e4-5c45e0173aef","resolution":{"observed_at":"2026-05-11T21:46:13.279370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:39f770814682114cd38a170c1b18aefeec86616d5b24cd9e682b2c8db86af37c","observation_id":"c251ec09-3171-4a66-8787-bfef63b28c40","resolution":{"observed_at":"2026-05-11T21:41:19.274947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-10T21:10:42.989653Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:33a6fe9d293c803391f0118a5cc059070e95f93ba73757eef106065ad9bdc1fa","observation_id":"f704a458-45c9-43e1-8da5-c1b1fe9776f4","resolution":{"observed_at":"2026-05-11T21:46:12.382365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:86765f19005ea797475c95968a55a1062070f2dd255a6ff276a8d1e2effad8b0","observation_id":"7cd4543e-76bc-4aef-82f1-3d065e399684","resolution":{"observed_at":"2026-05-11T21:41:19.313335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":"a21de029-4ef2-461b-ab31-6156d3fad31c","year":2023},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:be11d7b0525459a867d44bc23366b82e8981b94707624729290c464d4b415dbc","observation_id":"2e74d709-3e64-4ee9-9ac0-419bbc4f41fb","resolution":{"observed_at":"2026-05-26T20:53:02.731617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03596","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.720228Z","title":"Controlthinker: Unveiling latent semantics for controllable image generation through visual reasoning","venue":null,"work_id":"7d3bfb90-d10a-45c2-9e1a-0ebbd433aa63","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:ef5fa19d17017d5eb67f0045cdcef303268585359f6888b3cab6019e355b3ac1","observation_id":"99275ec5-d445-46e7-863e-b3cad79f3f72","resolution":{"observed_at":"2026-05-11T21:46:13.486416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Freeedit: Mask-free reference-based image editing with multi-modal instruction.IEEE Transactions on Pattern Anal- ysis and Machine Intelligence","venue":null,"work_id":"a0d13119-1503-4e37-aa61-109ad379186d","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:99fe44ce771dae35198e57a487be7dbcedd4bb2710e0045cf4d4b71c892e1892","observation_id":"a5a5a9e4-34e3-42e7-9d68-fa2c3498179d","resolution":{"observed_at":"2026-05-26T20:53:02.738145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05124","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re-align: Structured reasoning-guided alignment for in-context image generation and editing","venue":null,"work_id":"d4265198-ccc1-4302-befc-bc7509155eb5","year":2026},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:8573042c90fbc66fe118a4cbdad1c2acde754a1364fec6b85bb8ea1d9deb1fb7","observation_id":"88dc8d79-2fae-4b63-a436-cc0ab1b8eb68","resolution":{"observed_at":"2026-05-11T21:41:19.157170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.NeurIPS, 37:139348–139379","venue":null,"work_id":"9051cfdc-2571-4354-a401-c686bb89bf01","year":null},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:3b3d011f3c30e81d9811d21dc1e857d3d5560ef2c3cd34b215be5ac11197e6bf","observation_id":"f312a434-02c4-4b04-845b-00bc95d56784","resolution":{"observed_at":"2026-05-26T20:53:02.753884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04158","last_updated":"2025-06-04T16:57:24Z","snapshot_observed_at":"2026-08-08T10:26:28.640432Z","submitted_at":"2025-06-04T16:57:24Z","title":"Image Editing As Programs with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.04158","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04158","snapshot_observed_at":"2026-07-02T07:36:45.164765Z","title":"Image editing as programs with diffusion models.arXiv preprint arXiv:2506.04158","venue":null,"work_id":"a1c6decb-b86a-428a-8ec0-152fa02923da","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2506.04158","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:737172cd823a079f5845a8e6a73a81a4249bc27b326b84e7a34145abad8a1ae3","observation_id":"e3172cd7-0357-4060-9b32-6c9124654e42","resolution":{"observed_at":"2026-05-11T21:46:12.360685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":"2210.11610","doi":"10.48550/arxiv.2210.11610","metadata_source":"pith","pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models Can Self-Improve","venue":"cs.CL","work_id":"6830fb5e-ffe7-4200-8b19-a56a5152a37a","year":2022},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:742a651102e20bd4003dd7fbd37268a0acc37d45a76b65ab99bc1a01039a51d5","observation_id":"f4689a43-976b-4aa1-9c08-4105a9fbbe3f","resolution":{"observed_at":"2026-05-18T17:00:48.316458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:22.369728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:22.369728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-07T20:36:07.154043Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:ac9ce4b9b6e853bd9290ecdd5994290ee886dada2c27c1e0779bcc1e7d686afa","observation_id":"78c1b218-e674-4b05-b64c-8811eeaa877c","resolution":{"observed_at":"2026-05-11T21:41:19.288085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06590","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:32.106180Z","title":"Ming-univision: Joint image understanding and generation with a unified continuous tokenizer.arXiv preprint arXiv:2510.06590, 2025a","venue":null,"work_id":"27f83b26-431a-430b-82c3-1c56eccec44d","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:8030aeebdc102f60f1fc91140f534c3986e959324ef4caf412ab1006ac25c2d0","observation_id":"a73b6f31-13d3-4787-a20f-47c5863a97e3","resolution":{"observed_at":"2026-05-11T21:46:12.750885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-07T20:35:00.460457Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:1ea42cb20288a97cb8f98c917874614bcd178af650502e81717a8c86a22a5b6a","observation_id":"660225a3-82dc-469d-bbf7-5c2231f9b071","resolution":{"observed_at":"2026-05-11T21:41:19.265561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4d671154-368b-4a01-a524-2ae892fa0cde","year":2017},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:6ab81a2e549fc9d5837c3c891975f514566cdf7ee5af18e42aced0b360e70ecb","observation_id":"81b3d0eb-df2e-4e77-ac49-c87c051354fd","resolution":{"observed_at":"2026-05-26T20:53:02.724507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14867","last_updated":"2024-06-03T16:59:20Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:45:19Z","title":"VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation","version":2},"cited_work":{"arxiv_id":"2312.14867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14867","snapshot_observed_at":"2026-07-04T12:59:52.750964Z","title":"Ku, Dongfu Jiang, Cong Wei, Xiang Yue, and Wenhu Chen","venue":null,"work_id":"938da770-47a0-42c7-9360-ee368ef1de59","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2312.14867","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:56d7773fb3cc6c9715e61d8377cbf54d59267caeeb7d88b86ab5f81307a39890","observation_id":"d48f321e-3acf-45a1-943f-faf5e2b1b736","resolution":{"observed_at":"2026-05-11T21:41:19.200450Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-10T10:43:25.582099Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":"2506.15742","doi":"10.48550/arxiv.2506.15742","metadata_source":"pith","pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","venue":"cs.GR","work_id":"5dfe19d5-3541-4803-8fe9-3c8b9e29b281","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:f4a78104717cc103b287f6b6426ae8781b3d4dffe6fe1b4961f7ff5e3fe039b3","observation_id":"d306eb2f-bc74-4aaf-a228-a81bff10a227","resolution":{"observed_at":"2026-05-11T21:41:19.248810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prometheus-vision: Vision-language model as a judge for fine-grained evaluation","venue":null,"work_id":"548eecfd-b9e4-4204-a0a1-58383da6aa50","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:3cbf0977e8d1503bfafd5b617eff6ed329cec0003c689018a61483c71893ba55","observation_id":"872c16db-089b-4603-a488-9ee45b070041","resolution":{"observed_at":"2026-05-26T20:53:02.727850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:81313e1da3da98066a4be80add88ee555d84c807006e3f783267a63da1e6286b","observation_id":"f929c851-287c-483d-a507-922dd376e1a7","resolution":{"observed_at":"2026-05-11T21:41:19.168309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-02T11:23:33.987927Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":"2501.07542","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-07-10T13:37:06.824298Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","venue":"cs.CL","work_id":"fe549c4a-19fa-421a-9a30-230932ba737e","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:f2da3ca8a24088661fafd37568f9972e31ac7ae2248658dcdd6e8e741f5ae603","observation_id":"0724f602-58d2-42b9-9adf-cf1c64ca76c1","resolution":{"observed_at":"2026-05-16T23:09:34.995208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10881","last_updated":"2025-08-14T17:50:11Z","snapshot_observed_at":"2026-08-09T17:52:02.451515Z","submitted_at":"2025-08-14T17:50:11Z","title":"ToonComposer: Streamlining Cartoon Production with Generative Post-Keyframing","version":1},"cited_work":{"arxiv_id":"2508.10881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10881","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tooncomposer: Streamlining cartoon production with gen- erative post-keyframing.arXiv preprint arXiv:2508.10881","venue":null,"work_id":"11b6cf42-237c-4b13-bc81-088e8a2174a3","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2508.10881","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:7d1c367c12b47edb971e03f5bbd4b4286979c32a1b4d2c52f1f86a483fec7828","observation_id":"2bdb0531-36c5-4ea3-8f4b-b7963a30f91e","resolution":{"observed_at":"2026-05-11T21:46:12.593382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nvcomposer: Boosting generative novel view synthesis with multiple sparse and unposed images","venue":null,"work_id":"7a683a33-7747-4b45-a6a2-0e086ab3ebf5","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:e266c6833ee7b4654e895983cbf71ce8b39e89517a2a801d5f3f3b18a21949bd","observation_id":"e1df8cdf-e095-434f-ae49-2dac8b1e6f08","resolution":{"observed_at":"2026-05-26T20:53:02.734711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"cited_work":{"arxiv_id":"2411.04996","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04996","snapshot_observed_at":"2026-07-04T11:59:50.940046Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","venue":"cs.CL","work_id":"82eb1f7e-d598-409b-9fec-8a7e82965d26","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2411.04996","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:5fc5b4e023bede9bae8627ec0a184e1e3981de1925dbcb2c957522a7202ca460","observation_id":"756f4290-0c5c-4196-bd51-fc05f3e49e5e","resolution":{"observed_at":"2026-05-18T02:48:45.158778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":"2505.05472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-07-10T07:36:57.986858Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","venue":"cs.CV","work_id":"f2badd0e-c06a-45f9-9d9e-7ceda62176b8","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:26c5a7e5ad10233fcae9e798caa009360605cffbd71f30554b2c6bc0146a7ad5","observation_id":"e7352c77-fad4-4aaf-ad4c-57d751daddd9","resolution":{"observed_at":"2026-05-17T07:24:05.047503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":"2506.03147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-05T16:51:14.197597Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","venue":"cs.CV","work_id":"488a273e-95d8-46f1-87c7-2244068d00d0","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:d8f832191a3b2cfe4d462aa7e685c6d9dabcc3c23ad0824b25486c9d7990cba4","observation_id":"cc8a5292-4147-40e5-866f-cbb95b73c7be","resolution":{"observed_at":"2026-05-12T17:34:27.304691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17612","last_updated":"2025-06-21T06:36:00Z","snapshot_observed_at":"2026-08-11T16:09:39.977271Z","submitted_at":"2025-06-21T06:36:00Z","title":"JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent","version":1},"cited_work":{"arxiv_id":"2506.17612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17612","snapshot_observed_at":"2026-07-02T20:37:22.746354Z","title":"Jarvisart: Liberating hu- man artistic creativity via an intelligent photo retouching agent.arXiv preprint arXiv:2506.17612","venue":null,"work_id":"8bb225e0-e849-4dd7-87ce-05ceaf11b4aa","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2506.17612","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:6396825c1adb4085584cde70409c1a5b84b4a2b3fb889118df7ec488d5b9c19d","observation_id":"7c33a7aa-d548-43d8-bbef-b586cbd9fb8f","resolution":{"observed_at":"2026-05-11T21:41:19.240606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:43:13.994646Z","title":"JarvisEvo: Towards a self-evolving photo editing agent with synergistic editor-evaluator optimization","venue":null,"work_id":"a8df6034-be76-449d-b2a7-7f7ae72db474","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:7b34700e1034615c3d12a05add6da88020b19619c24964ac4cd8305f7d0f85e2","observation_id":"55bda6c0-36bc-4bf9-9f8e-95778907e6dd","resolution":{"observed_at":"2026-05-11T21:41:19.178955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-06T11:11:00.378627Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":"2505.05470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-07-09T02:25:55.898592Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","venue":"cs.CV","work_id":"bf1e8e81-ff31-401a-a5dc-d9c49df168ab","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:ebf6c3cff6c4a4138a32b1e5a28ee3a11a8623e00accc1ba6b8e2a47fb55ba1b","observation_id":"10895829-856d-46f2-9f14-1a283cc64d6f","resolution":{"observed_at":"2026-05-11T21:46:15.121348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":"2504.17761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-10T01:46:41.223286Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","venue":"cs.CV","work_id":"3392f2c8-a1cb-4d6c-8c82-2cdccffa33f9","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:caa94575ef37914b22c55e6ba2aae64c101c978e07325461314b667c6d9e2a97","observation_id":"21440f07-a99d-4170-b9e5-072bbb325427","resolution":{"observed_at":"2026-05-11T21:41:19.319109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"a8e03bb6-5887-409b-97f2-e7b64bdeb253","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:7b4cd92f98f1f641abc39e4d42a968ea43d14df25d89bb18fca0b74e4bcf1bdb","observation_id":"c0f9f15c-61ab-4142-8d71-357f084edb35","resolution":{"observed_at":"2026-05-26T20:53:02.741290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.NeurIPS, 35: 2507–2521","venue":null,"work_id":"4ef16e78-49fa-4189-9a55-4baa9bec3203","year":2022},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:17b2e24096de9e2ffca6e6e39269efd3c3f2964c6089276342fb4cb996cc7a99","observation_id":"f6bb620b-1011-4536-b087-b4b9e68fec27","resolution":{"observed_at":"2026-05-26T20:53:02.756900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":"f98b2365-4ff5-4ba4-bdef-d62e8f182802","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:4c92b02f67499c974a543bee63178e4c6d67ac6e7b137b8863386851febd4792","observation_id":"5cdc5a57-7228-4b44-8af1-82bd98dad454","resolution":{"observed_at":"2026-05-26T20:53:02.759771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-08-10T17:11:09.825158Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2411.07975","doi":"10.48550/arxiv.2411.07975","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2411.07975","venue":"arXiv (Cornell University)","work_id":"57d73d19-7fb3-40ec-aa67-42c6d678ec43","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:b707c2e427d1f1d71c91b377b7d1fc4e834f54e3e0204351aa0332e6446c997e","observation_id":"60008d92-5c65-45e4-8f25-fa10b455564d","resolution":{"observed_at":"2026-05-11T21:46:12.347080Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:51.115808Z","title":"Fastvmt: Eliminat- ing redundancy in video motion transfer","venue":null,"work_id":"1f3c20da-64ae-422b-99cf-941f90a602da","year":2026},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:ecda1ba8ae41ce7c3f2ec4a14f8e2437f07156d6c5c61027e916f18cb2100e84","observation_id":"67ca32ca-fb9e-4c6e-9a85-b183b026f6d1","resolution":{"observed_at":"2026-05-11T21:46:16.183811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-image-1","venue":null,"work_id":"1ce7dadc-d1f7-4580-a726-c487d66b3c5d","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:924c5b2057b94ff08f36554795d0b632b8329510f497605d19bc10da2655c5bd","observation_id":"b716aeb6-631a-453f-a487-15391d81d25b","resolution":{"observed_at":"2026-05-26T20:53:02.744311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing 4o image generation","venue":null,"work_id":"2da88263-dce5-4441-a7db-388a84459e55","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:f323242c966784a9d019cfe55e4f68c53da1929710394182b34694ca3f9890dc","observation_id":"0594f594-434e-41ea-afa6-31cef20c1094","resolution":{"observed_at":"2026-05-26T20:53:02.702266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":"2504.06256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-07-04T16:39:58.250680Z","title":"Transfer between Modalities with MetaQueries","venue":"cs.CV","work_id":"a89f31c1-6a3f-451e-9971-692c11219ea3","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:ac1e2b09207ccd1339c6af465b46e90b4cd1817d042230a65774222a41f09c18","observation_id":"1c5628e3-af67-4ad0-ad82-63288334c44e","resolution":{"observed_at":"2026-05-14T22:49:23.311693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.715460Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"292e4202-5927-473f-b73e-1d6883498f14","year":null},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:401dfb5ce1525adae3cc4f8e61b7dc1e3e28fecccc56ac359b3694e700d41c8e","observation_id":"be94396a-a4d1-46cd-a52a-af3776768c43","resolution":{"observed_at":"2026-05-26T20:53:02.685938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2412.03069","doi":"10.48550/arxiv.2412.03069","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":"arXiv (Cornell University)","work_id":"6a964215-761a-438d-b579-a2699f32913f","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:20ac614376dcfc9f8a1b508985eef7d7b020f897d7929556da70268109c1b5ca","observation_id":"fec4d6af-7265-4a0e-a833-957939712b01","resolution":{"observed_at":"2026-05-11T21:41:19.367534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: An open large-scale dataset for train- ing next generation image-text models.NeurIPS, 35:25278– 25294","venue":null,"work_id":"63ce0d14-e14f-4073-ab38-4010cbf7d0c3","year":2022},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:211d4b86e80ebab8f5dff3219c1c40f930b29d13bb621ce68ffa812a3b495626","observation_id":"9b98ae0b-e1a8-43d9-9f6d-162ce98e9c99","resolution":{"observed_at":"2026-05-26T20:53:02.698904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual cot: Advancing multi-modal language models with a comprehen- sive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":"36d7363e-f957-42b3-af29-af24a79ea3c9","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:50dbf7577d45ab4eb9fb1d0b4ea58f0867797b0906f237e724e6f4221a474977","observation_id":"e52a145d-34a0-40e6-8743-b0a0781312ac","resolution":{"observed_at":"2026-05-26T20:53:02.692609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:36333c75a225f64340dc8d2b6ff35d45f06c9196fdf7941af5fa327da03526b0","observation_id":"3d594a3f-26bd-4e08-956d-66a4a06485f8","resolution":{"observed_at":"2026-05-11T21:41:19.232172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-11T11:31:09.745295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:4cba8ab9ab712b09e10d0473b2bf61d6afebeb8d6c3057f0554a2e8e72fc7184","observation_id":"66ee8cee-fdc4-41e5-ab3a-66281e56cb1d","resolution":{"observed_at":"2026-05-11T21:46:14.691378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"052f1593-e48a-4670-90d8-a6e5cdadd336","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:59e054174659b066a1aac6615d6bf19923fe7d68026b563c5798b870229db910","observation_id":"161c3c34-404e-4c82-9490-1f4baa4ec993","resolution":{"observed_at":"2026-05-26T20:53:02.695626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:2236f68c3ecb58b27ccd563041280d6f12555ee76add4bb3576ad36c127835de","observation_id":"cc5f570f-630f-453d-84a3-f96aa4ebf832","resolution":{"observed_at":"2026-05-11T21:41:19.340833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the estimation of relationships involving qualitative variables.American Journal of Sociology, 76(1): 103–154","venue":null,"work_id":"838d8a7d-e289-4352-975b-6c03d814b803","year":1970},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:b68d8a6ca3dc14e25e0088db8335a0f234913f1eb4c78d0ef55727ca93f2da39","observation_id":"465c08dc-a505-4d6f-9d24-1dc2ffdb1557","resolution":{"observed_at":"2026-05-26T20:53:02.661332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2412.14164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-07-04T10:09:44.713840Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","venue":"cs.CV","work_id":"cc1e25c3-90c2-4e87-9268-d28d48c546a1","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:0dfe59d4951341f28efef56892800dac7ada4b3b4f0593801fa74c843c95e379","observation_id":"eceae1de-462f-4abb-8b01-5d30f5df3546","resolution":{"observed_at":"2026-05-17T07:51:13.882527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:27d81b57d64ec8de97b2b111339432ee274e5b089506953d5e99f5f91e522b2d","observation_id":"9649be60-f329-4e82-94cc-5e60515e225e","resolution":{"observed_at":"2026-05-11T21:46:12.896794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:ef140af2e42b65504fed3b4b672120e9ecfa998b242df45b67ae02697db09c53","observation_id":"e136563d-1708-4680-9821-b224abf183f7","resolution":{"observed_at":"2026-05-11T21:41:19.293621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models.NeurIPS, 35:24824–24837","venue":null,"work_id":"cf92c7bf-ec92-4b9f-a49c-cf00f7b47dd6","year":2022},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:77f4a9ce5daee491fc96313afdfea995b0ade0f6d35a416cbc7f0ef21aa341d1","observation_id":"5dc32682-7d7e-4624-a17d-5b97596ce755","resolution":{"observed_at":"2026-05-26T20:53:02.675239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Janus: Decoupling visual encod- ing for unified multimodal understanding and generation","venue":null,"work_id":"cd715fef-efc6-4b48-bce6-dbea65aa9ea1","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:256484bb5ef97896af407bbac1f976454a1262da4377a73498dee5661dd33fdd","observation_id":"510a65ff-dae2-48c0-a321-0d6264a02ce1","resolution":{"observed_at":"2026-05-26T20:53:02.709369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:5def0eee791c704cfb40004e88fd34bef4a114c3e7c8eb2ac3fe3bd3ca780581","observation_id":"3b0951c5-58ba-4e25-a937-a4fe2693acdf","resolution":{"observed_at":"2026-05-11T21:46:15.895704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:8c18c793fb8a0710f94dd67f81c9da2c7062dc8ea4a1704a78b1259b92bf7e4a","observation_id":"36dc96e8-3034-440d-9ee5-ea5454ba3ee7","resolution":{"observed_at":"2026-05-11T21:46:12.247983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V?: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"db65c194-55c0-4580-b406-eb059912bd60","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:c3b72dbccc89e8edc14091d8d5887cce710d7ca15835c35a09689db3a1f9fac9","observation_id":"8802737e-8f9e-45ec-9e3b-31b192b74c79","resolution":{"observed_at":"2026-05-26T20:53:02.672018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"33d41cec-2e4f-4583-8c86-40eb403d8c18","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:a6adc34a22948c788b76889f53e257b38967b537ffd3b9a7257c58459e22d2d4","observation_id":"1f2d14b7-c754-4f67-b28e-a1cc6d0abef9","resolution":{"observed_at":"2026-05-26T20:53:02.682123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnigen: Unified image genera- tion","venue":null,"work_id":"b2db63a4-6830-4b23-8e1f-128246e3c227","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:710d2ccdaa0799731a5334e9dd8208278d6fde9263f75002a3789b64238721c0","observation_id":"31a92358-c2fc-4b2f-9642-a82f0129ff5f","resolution":{"observed_at":"2026-05-26T20:53:02.678741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:6416e286a85a04d17cfafbfa52a93e5fd4730bc28e836b4065bf10ceca95c480","observation_id":"fd93135a-5da6-4330-99b7-9a43a7b57548","resolution":{"observed_at":"2026-05-11T21:41:19.375413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":"2506.15564","doi":"10.48550/arxiv.2506.15564","metadata_source":"pith","pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o2: Improved Native Unified Multimodal Models","venue":"cs.CV","work_id":"77f00563-1ce6-4fba-9d4e-c8ce83f716ac","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:88123d030215ce85116eb5a15721af65d4023f2cbbe641f6d9ba087f5b62e5c6","observation_id":"0ee58263-b97d-40d9-8dfc-66c1e6a3e39a","resolution":{"observed_at":"2026-05-12T18:51:16.424084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15034","last_updated":"2024-11-22T16:08:03Z","snapshot_observed_at":"2026-07-06T19:54:27.776746Z","submitted_at":"2024-11-22T16:08:03Z","title":"HeadRouter: A Training-free Image Editing Framework for MM-DiTs by Adaptively Routing Attention Heads","version":1},"cited_work":{"arxiv_id":"2411.15034","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15034","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Head- router: A training-free image editing framework for mm- dits by adaptively routing attention heads","venue":null,"work_id":"97c52a23-18ad-45e0-8544-5810fade1bff","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2411.15034","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:2a8ffc9536b96f32dd91608098931b8a905904a12a116b745f4af2122a4885e9","observation_id":"2a62e55b-571b-4b3a-9b9c-189ddd77d5b1","resolution":{"observed_at":"2026-05-11T21:41:19.256048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.08881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tag-moe: Task-aware gating for unified generative mixture-of-experts","venue":null,"work_id":"c718bf77-39cf-4c75-b76a-95a7920e539d","year":2026},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:e312da674a060de274bb18d364b4168810730f54f3a79e202b14ad8d8db28762","observation_id":"cb10bf85-c4dd-46fb-9be9-edc8b41d8094","resolution":{"observed_at":"2026-05-11T21:46:14.436382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:95c15d7774739a88a00241074f69d61aeeaa83b2e19fe3f1ee9993764dcde2e5","observation_id":"46081f00-a955-4a7e-94dd-dff49f1de582","resolution":{"observed_at":"2026-05-11T21:46:13.357969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uni-paint: A unified framework for multimodal image inpainting with pretrained diffusion model","venue":null,"work_id":"6881606f-2864-4ad2-8f47-3527bd63469a","year":null},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:10abdd2f5a69e6f9ce5b3754b7f0761a0012dc8b829711d17cbed19dc658dd54","observation_id":"71e30a2b-0cb7-4087-b6ea-f1a9a9f6e029","resolution":{"observed_at":"2026-05-26T20:53:02.705890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct-a-video: Customized video generation with user- directed camera movement and object motion","venue":null,"work_id":"f8ef8fc9-d2ca-4fe1-92b4-8803b2c68c17","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:f20e6927845cb450ed141a577bff8afb3d68fb6c3759058d7007300f8a076e4f","observation_id":"cc25ebff-3400-45ed-b60b-55baa2014840","resolution":{"observed_at":"2026-05-26T20:53:02.664587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13143","last_updated":"2025-04-17T17:51:59Z","snapshot_observed_at":"2026-08-07T16:01:22.045620Z","submitted_at":"2025-04-17T17:51:59Z","title":"$\\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark","version":1},"cited_work":{"arxiv_id":"2504.13143","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13143","snapshot_observed_at":"2026-07-02T01:06:23.900532Z","title":"Complex- edit: Cot-like instruction generation for complexity-controllable image editing benchmark.arXiv preprint arXiv:2504.13143","venue":null,"work_id":"3e4778c3-81ed-439d-b5ee-96b6f734ff44","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2504.13143","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:087d8e843076e2f9d003e2a824dd0b0231e0d67e1e8f3055090e212010429995","observation_id":"efde17d6-ad2d-44dd-aaea-9b9f2aa228af","resolution":{"observed_at":"2026-05-11T21:41:19.354347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal rewardbench: Holistic evalu- ation of reward models for vision language models.URL https://api","venue":null,"work_id":"d019887a-8de5-4a53-8cbd-5d97838c5379","year":null},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:b8b139b0b9e768ff3f975145efc028a62daba49e4ef9ce1d49b5b57877f06579","observation_id":"1a19edff-0b81-4eb3-a4aa-fea9d1253aa0","resolution":{"observed_at":"2026-05-26T20:53:02.750831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2505.20275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-07-10T13:27:05.927875Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","venue":"cs.CV","work_id":"059b5c3a-404c-4d30-a631-68c1d88a08a7","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:297320dff4a76ebd016da2a1ed50fce3187cde96db981e93c2c8e970e1874a99","observation_id":"c0dd0fc4-9bfd-48f1-8795-d705e41db21c","resolution":{"observed_at":"2026-05-12T18:17:45.693018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anyedit: Mastering unified high-quality image editing for any idea","venue":null,"work_id":"9a925bfa-9287-4d53-ac21-3a6e4116349e","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:baa8e1f8fd05eb2ff493487c6aafdb760f93576f1d13bbfde68bbb57b220299d","observation_id":"9db8e75f-a664-4a45-8a2f-1bb1886b8f9c","resolution":{"observed_at":"2026-05-26T20:53:02.715699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing.NeurIPS, 36:31428–31449","venue":null,"work_id":"788d2a11-f4df-43ef-bf3e-a4f6f17c39b4","year":2023},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:e6ae1667437fe6e28f09270d961494d731a872716bdcf4e4b35b1095367fac5a","observation_id":"3fad433e-784f-4789-9415-48455184384a","resolution":{"observed_at":"2026-05-26T20:53:02.718964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Logo: A long-form video dataset for group action quality assessment","venue":null,"work_id":"2fb41090-f576-43bc-a98a-c9718ffe1aa6","year":2023},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:7e702063d3a8e4cafcd9fa1bb3651e78b2f6a48359f52e95fdd4100e15cc6c73","observation_id":"9b5f7015-e7c9-4fe7-8366-46901c619d5a","resolution":{"observed_at":"2026-05-26T20:53:02.712401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Narrative action evaluation with prompt-guided multimodal interaction","venue":null,"work_id":"5ea6823d-472a-463f-afb9-4b6aec2275f8","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:91c2bbf68034cd5d9700c4b21e19f88c5f914a6303068a850a6ad04d3a64de3a","observation_id":"d05b10c7-fc7a-4060-9475-ba70dfdfa0ad","resolution":{"observed_at":"2026-05-26T20:53:02.689075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flexiact: Towards flexible action control in heterogeneous scenarios","venue":null,"work_id":"c1ab4798-451e-4d42-9b69-aeb0e5da8499","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:e2925c9138ab92ae7259f85e31f7adb6290ee54e2074813e0169effac66c0a6e","observation_id":"83242267-11e7-4be0-9e72-e108910d5a22","resolution":{"observed_at":"2026-05-26T20:53:02.668687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:c8f591a5341593a3efc284984b79e53e3b5b60a4e0727608bbf217e6469837e3","observation_id":"b6533477-c6b4-43e5-8708-eb4dc00684ca","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-05T06:11:45.068217Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":"2504.20690","doi":"10.48550/arxiv.2504.20690","metadata_source":"pith","pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","venue":"cs.CV","work_id":"8cafd680-1279-4695-8156-9079db325469","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:298bb28fb771a0c20382ff52576acb6b8b9b8524c514d5835ce37e2c7f3b805d","observation_id":"413de24d-53a8-4232-a463-30151c361b93","resolution":{"observed_at":"2026-05-16T16:07:53.247084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale.NeurIPS, 37:3058–3093","venue":null,"work_id":"dee87418-aeaa-4ed9-a051-830c440bed55","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:6dd0ab1ef93a3e62e2d39a191aee9eccc6f26d6cd1fe5a99582fdc9e5af0c561","observation_id":"e9a17fd4-de51-4ae6-bd7f-c38be8a334ab","resolution":{"observed_at":"2026-05-26T20:53:02.654541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02826","last_updated":"2025-05-27T15:54:58Z","snapshot_observed_at":"2026-08-10T18:55:14.702372Z","submitted_at":"2025-04-03T17:59:56Z","title":"Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing","version":4},"cited_work":{"arxiv_id":"2504.02826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02826","snapshot_observed_at":"2026-07-04T13:19:50.681869Z","title":"Envisioning beyond the pixels: Benchmarking reasoning-informed visual editing","venue":null,"work_id":"e46f260d-7abe-40b5-9905-5115e6088591","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2504.02826","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:9f45aa250f22bf1cb97ade7aadc7501d30933f79a1c5895386395a5ab3a59163","observation_id":"037c69fb-a8b6-40f6-bb6f-ccdf74121747","resolution":{"observed_at":"2026-05-11T21:46:13.957691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":"2408.11039","doi":"10.48550/arxiv.2408.11039","metadata_source":"pith","pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","venue":"cs.AI","work_id":"c2bb4d2d-29de-4bf2-9150-3d6373ff358f","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:36199c5784c25d1c6875a3492132f69effac5f165c3adb712f67767f122f79ad","observation_id":"ee8cee85-5f76-40f0-abf5-7c297284993e","resolution":{"observed_at":"2026-05-13T05:57:27.005672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kv-edit: Training-free image editing for precise background preservation","venue":null,"work_id":"c6253862-27ad-41c9-8c62-94a8c69c1648","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:64e86723118a75484eeb3e6bf91b7db6bafce6627acb2110288e3ff5f8e9b4ba","observation_id":"8efda024-697b-4795-8dd5-fec457353b44","resolution":{"observed_at":"2026-05-26T20:53:02.657787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11815","last_updated":"2025-05-04T08:10:51Z","snapshot_observed_at":"2026-08-11T14:30:48.918655Z","submitted_at":"2024-12-16T14:32:49Z","title":"ColorFlow: Retrieval-Augmented Image Sequence Colorization","version":2},"cited_work":{"arxiv_id":"2412.11815","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11815","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ColorFlow: Retrieval- Augmented Image Sequence Colorization","venue":null,"work_id":"19bec423-2959-47b8-916c-284df988cc15","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2412.11815","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:b4124e5bc1319a4bf84601ffd16ef79337440fba8e6a9a45f99fcd75b87ce736","observation_id":"f097a609-7b8b-458a-922a-e6b8fb7312fa","resolution":{"observed_at":"2026-05-11T21:41:19.148799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":51,"verified_fuzzy":32},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 3 inbound Pith citation observations for arXiv:2604.24625."}