{"as_of":"2026-08-17T21:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6faeefb4fdc695ec8d42a2f944f448a88cf2835df850d4cb8495e823affc2771","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:42:04.839943Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18227/citation-record","integrity":"/paper/2607.18227/integrity","json":"/paper/2607.18227/citation-record.json","paper":"/paper/2607.18227"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:57.216633Z","title":"Consistent video- to-video transfer using synthetic dataset","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:57.216633Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:960c91a4438fdec55ef0b54a8d4b15e7e3822830a5f6e45fdc97588bc6bc73c0","observation_id":"db4b9e09-a94e-4a25-a399-18232edd01e3","resolution":{"observed_at":"2026-08-01T15:41:57.216633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:57.309571Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:57.309571Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:5aa0a51cd07d98742f471e18926609ebb51b2d1f59cdfce36ce2225f46be0420","observation_id":"bb45c8f6-09df-4293-b10b-ae71b8b2fe99","resolution":{"observed_at":"2026-08-01T15:41:57.309571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:57.389862Z","title":"Se ˜norita-2m: A high-quality instruction- based dataset for general video editing by video specialists","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:57.389862Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:c6db54154d4fc062af15ecb401bb931ea204882c3c988b8cced6e2ac2d1297e1","observation_id":"9dc9ce9b-fc9a-41ba-825a-e4436e22697c","resolution":{"observed_at":"2026-08-01T15:41:57.389862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:57.476293Z","title":"Scaling instruction-based video editing with a high-quality synthetic dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:57.476293Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:8fc30db53366956de34b0a8972ad9371794d8b2a11f69ed224968af6fccde30a","observation_id":"8bb09e9e-2dce-4615-b583-77763e8c81d0","resolution":{"observed_at":"2026-08-01T15:41:57.476293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:57.544673Z","title":"Insvie-1m: Effective instruction-based video editing with elaborate dataset construction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:57.544673Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:533189a16e4c0d0e769ee1c75baf7e7a49b9c40fa8701bd6a2c261012b93b339","observation_id":"9d669d84-7cce-4215-b10e-494b14cdcd0c","resolution":{"observed_at":"2026-08-01T15:41:57.544673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:57.644996Z","title":"Openve-3m: A large-scale high-quality dataset for instruction- guided video editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:57.644996Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:8819a16fa5f1f64639fec7170031f946b41dc5a6876750cea1e0980e0751bd34","observation_id":"0e3ab94c-c493-4979-b1dc-fd69ee435dcc","resolution":{"observed_at":"2026-08-01T15:41:57.644996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:57.752787Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:57.752787Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:11abe11865255408579408206bd1205fc80aa7a576b4f4303de140b97938be75","observation_id":"04edd82e-593b-4d23-a14d-8d1e98717c8d","resolution":{"observed_at":"2026-08-01T15:41:57.752787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:57.837722Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:57.837722Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:9830035e934b02b8c030fcff82bbdafb956d9bb6f509bcad9b734c3d9141422c","observation_id":"dc8805d0-144f-4f38-a18c-b4b7a34fcea8","resolution":{"observed_at":"2026-08-01T15:41:57.837722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:57.874659Z","title":"A survey of state of the art large vision language models: Benchmark evaluations and challenges","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:57.874659Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:ff1f85810b461c62770364c99301fe14adfa8f7ae30230fafc4cb760ee898485","observation_id":"9132d125-fe69-4e05-a142-a134c8d5c319","resolution":{"observed_at":"2026-08-01T15:41:57.874659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:57.895487Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:57.895487Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:05b140b61af99c077ba5b093e1eecea3ba408b8e5290975f27e1f4ddecffcc12","observation_id":"902a6ec3-b3b8-4cb4-bd7c-e6028a7de5ce","resolution":{"observed_at":"2026-08-01T15:41:57.895487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-01T15:41:57.930637Z","title":"Sam 3: Segment anything with concepts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:57.930637Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:d8075685d50fa66754bf4a31d375f75cbdbd25ca839d8be9fcd7898c52193876","observation_id":"097c0cc7-9512-4dc6-b49f-01d4e86b4728","resolution":{"observed_at":"2026-08-01T15:41:57.930637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:58.005473Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:58.005473Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:d703b3d13f58b740be8f8d651a1a4c1edf37b0f95ce235f0c6330a9127efb586","observation_id":"e29a3d2e-d272-45cb-9fa0-e4a216646e16","resolution":{"observed_at":"2026-08-01T15:41:58.005473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-01T15:41:58.117595Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:58.117595Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:df81185657d6007af58df9897a73702d38b3d33f620f88a5cf25c5a5c8bfaf68","observation_id":"12383843-5f11-4ce1-b646-a5fe3208c906","resolution":{"observed_at":"2026-08-01T15:41:58.117595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T15:41:58.279994Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:58.279994Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:56a306f44510b1bca3d23d69ea5299ed21f8b26537470af118dbe57a94eb250f","observation_id":"b198bacd-7ab3-4d96-bea5-3ed693003e16","resolution":{"observed_at":"2026-08-01T15:41:58.279994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T15:41:58.433414Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:58.433414Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:b9efa254a8290109dd765dc856365ae4b6983231430d0084196db4a3a29c2419","observation_id":"47d4546d-9693-406d-aae4-57a0a789e7dc","resolution":{"observed_at":"2026-08-01T15:41:58.433414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:58.559802Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:58.559802Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:a99b1045ec0fabf78ecf90e276a4178778673fa676a0d09820065118ec04c420","observation_id":"2b063174-dfb5-4d46-849d-fcbe204261a1","resolution":{"observed_at":"2026-08-01T15:41:58.559802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:58.664064Z","title":"Reward models in deep reinforcement learning: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:58.664064Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:f5f613b6a2be464965baaf8d35a4dc4d21df39a4b6e663effa2c2860e333287b","observation_id":"d17c1185-4208-4f5b-9042-89acc1d71905","resolution":{"observed_at":"2026-08-01T15:41:58.664064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T15:41:58.802918Z","title":"Wan: Open and advanced large-scale video gener- ative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:58.802918Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:7643d10703aa6a6843d2c0ecaf97e65fb8251f4e2d93f5c4f47aa2bd583118de","observation_id":"c3de7022-46a5-4441-927f-6a18d4cf0139","resolution":{"observed_at":"2026-08-01T15:41:58.802918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:58.910602Z","title":"Instructx: To- wards unified visual editing with mllm guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:58.910602Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:88be76e8676e11980460fe10b7d9c3fcec6e65532f38b4f3c29b8e12dd604668","observation_id":"c1b422bf-e369-48e9-8c2c-5d1ed6766777","resolution":{"observed_at":"2026-08-01T15:41:58.910602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:59.030453Z","title":"Vino: A unified visual generator with interleaved omnimodal context","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:59.030453Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:89547d20ca022a29a54d02285d43bb5cf9836cef67e7ab0b3262c20b9e6c8235","observation_id":"8076f39d-5fbd-4c3d-8f93-465637181a2e","resolution":{"observed_at":"2026-08-01T15:41:59.030453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:59.199648Z","title":"Videopainter: Any- length video inpainting and editing with plug-and-play con- text control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:59.199648Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:e60f661501ac20eedd0062f9e715a98f7f61c9d35f45dd5b3e74425b11bf3f2e","observation_id":"4bbb1ef0-d25a-4c57-a803-b2f19a08d1de","resolution":{"observed_at":"2026-08-01T15:41:59.199648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04216","last_updated":"2025-06-04T17:57:43Z","snapshot_observed_at":"2026-08-17T15:59:48.747710Z","submitted_at":"2025-06-04T17:57:43Z","title":"UNIC: Unified In-Context Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04216","snapshot_observed_at":"2026-08-01T15:41:59.332116Z","title":"Unic: Unified in-context video editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:59.332116Z"},"links":{"cited_paper":"/paper/2506.04216","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:a4afb0543dda46e0aba22f6da5654792d2d69bf5e179894511d90b997d72a66c","observation_id":"fe60997d-7e33-4d78-a61b-20ae20b55594","resolution":{"observed_at":"2026-08-01T15:41:59.332116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:59.393693Z","title":"Anyportal: Zero-shot consistent video background replacement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:59.393693Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:56fdc0648e9f918c1aa94ef138934fd46cb813a11c988704813a631bcfbdc208","observation_id":"d47b1e4b-adc2-4d98-8090-bc7e559b5e24","resolution":{"observed_at":"2026-08-01T15:41:59.393693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:59.430887Z","title":"Generative video propagation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:59.430887Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:9a65becd6d1e8ec8fb450d7f1b917f558da6aae15e7af0afc41d69963ecb1795","observation_id":"473f52da-8405-4c57-bf27-939dc2d89906","resolution":{"observed_at":"2026-08-01T15:41:59.430887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:59.508246Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:59.508246Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:cc1ea478854f3d8e8931809a572157d81e830ba3f45116a46aa836b680b610d8","observation_id":"74c70681-e811-4e96-b91b-88e528340fa1","resolution":{"observed_at":"2026-08-01T15:41:59.508246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:59.564471Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:59.564471Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:76e833954713993705ea2e0854340c25f0d96d79afcbb46d9cac92079ee45281","observation_id":"d32479a3-12d2-40c3-bd90-aa52ec5fcebc","resolution":{"observed_at":"2026-08-01T15:41:59.564471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:59.660118Z","title":"Pico-banana- 400k: A large-scale dataset for text-guided image editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:59.660118Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:b65ada33196f1794ffb61cd52b2cf284333cd04da85fee3a1c4785942d0fdccd","observation_id":"e69a4e1b-61c9-450f-a2a5-2af79d2057d7","resolution":{"observed_at":"2026-08-01T15:41:59.660118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21033","last_updated":"2025-07-28T17:54:04Z","snapshot_observed_at":"2026-08-12T23:50:24.433472Z","submitted_at":"2025-07-28T17:54:04Z","title":"GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21033","snapshot_observed_at":"2026-08-01T15:41:59.773307Z","title":"Gpt-image-edit-1.5 m: A million-scale, gpt-generated image dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:59.773307Z"},"links":{"cited_paper":"/paper/2507.21033","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:3e4f7b7f2338e923c63acb33b60038002a416f262193a6697daa765b1c55055c","observation_id":"8d95ddc0-def7-4859-a94a-c6d646f64f28","resolution":{"observed_at":"2026-08-01T15:41:59.773307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-08-17T20:13:42.723617Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-08-01T15:41:59.890584Z","title":"Imgedit: A unified image editing dataset and benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:59.890584Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:c3ca7749e803196c4170e1d3437689de0e93828eb7c13f9bd164a580efac8787","observation_id":"069060ca-1a49-4793-94c3-07211f5aabe8","resolution":{"observed_at":"2026-08-01T15:41:59.890584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:41:59.994300Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T15:41:59.994300Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:07ec51fc58da613a89daa454651b5f4741008c7216bb7d3bed893c0032cd24c9","observation_id":"2680f12b-3e70-43b2-a087-ecf4f94c3ee6","resolution":{"observed_at":"2026-08-01T15:41:59.994300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.083678Z","title":"Relightmaster: Precise video relighting with multi-plane light images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.083678Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:8f3bd7b4d12999ccd15ad6a92e07ad1b1400fa13e53f349034c8a2c9d563b5be","observation_id":"132791cd-6678-469d-9ec6-62f6e4eaf2ab","resolution":{"observed_at":"2026-08-01T15:42:00.083678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.141560Z","title":"Recammaster: Camera-controlled generative ren- dering from a single video","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.141560Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:2aace0adab87b08daaa1cd5d4ebaf1119795c873971b31fc3b6ce2d5c59e3978","observation_id":"7ef07ade-f10e-4026-acbe-28cd9ba96df2","resolution":{"observed_at":"2026-08-01T15:42:00.141560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.211910Z","title":"Anyv2v: A tuning-free framework for any video-to- video editing tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.211910Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:8010f8ce837818fa8e9f492b80dbfa5a69c282c0d2802d27b6f4b1653126cd02","observation_id":"d6515028-dcb6-4411-82a4-bd546e07a900","resolution":{"observed_at":"2026-08-01T15:42:00.211910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.292306Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.292306Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:b8ef60fa33697f68d47666f799f910ed0c2fbf91b7bebf8e50c84629bb718a63","observation_id":"4d1a38c1-c1cd-411e-b8a7-092789483474","resolution":{"observed_at":"2026-08-01T15:42:00.292306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.349393Z","title":"Videoshop: Localized semantic video editing with noise-extrapolated dif- fusion inversion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.349393Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:119cb0745a5cb7df0b47879b8bab9f38076d078df037e04f679583b5692e959b","observation_id":"fc7ffa9e-a825-4a02-8557-aa58b2871bd0","resolution":{"observed_at":"2026-08-01T15:42:00.349393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.430575Z","title":"Con- textflow: Training-free video object editing via adaptive con- text enrichment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.430575Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:f4de6e6791f6474c66a0010bb0f736efc7bced41f25ada9c5561382e023d32d0","observation_id":"6e5a6677-e040-4002-bf5f-279feef7a571","resolution":{"observed_at":"2026-08-01T15:42:00.430575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.490828Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.490828Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:4d9bbb1d8a70876abd51eae74a5dd3360feb32847cfa033272bba92fd85412fc","observation_id":"bce70e99-11d4-4a5a-9037-21538531cc14","resolution":{"observed_at":"2026-08-01T15:42:00.490828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.571605Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.571605Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:3436250cca3b5eb712cc45cbbfa48e4aabc11737c16a15d480414fd11057c743","observation_id":"b1ef6fe4-9529-4bec-942f-e9c8dcb572e5","resolution":{"observed_at":"2026-08-01T15:42:00.571605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.654441Z","title":"I2vedit: First-frame-guided video editing via image-to- video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.654441Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:c69b4dee4abcfa309d47db764030bb23c35c854ecdb7dc42b11df8dfc03c64f1","observation_id":"ece7d761-759d-4d6e-bddc-ceeebfdabad4","resolution":{"observed_at":"2026-08-01T15:42:00.654441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.710693Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.710693Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:4bab7d7d153a474a5fd2b58f3beff7ff69789c83e6b82725ab6b8cbbe49e42b0","observation_id":"9aeb0504-5cf4-40f7-a750-65e1448be076","resolution":{"observed_at":"2026-08-01T15:42:00.710693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.787997Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.787997Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:fa261f0f895baba13107b90e8c5f501d16b37a7401d0a299aedcc54e9b13add5","observation_id":"e1044260-f59b-42f7-828f-1d63cedad4a6","resolution":{"observed_at":"2026-08-01T15:42:00.787997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.845057Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.845057Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:c038f5a7b21c6112987e4da7cfe91cf93ec3b71a41eb6a1d2930ebf5d8b61272","observation_id":"308d5689-58c5-4a7c-8980-d6e8d2d1209c","resolution":{"observed_at":"2026-08-01T15:42:00.845057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:00.920461Z","title":"Light-a-video: Training-free video relight- ing via progressive light fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:00.920461Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:da4e30cad2e25cd6d9facb34028f9af9dc0d778fb370b9dafc38ec37135ba5d5","observation_id":"e7c95de6-ee28-45fb-bbe9-d2b66a21b745","resolution":{"observed_at":"2026-08-01T15:42:00.920461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.002588Z","title":"Vface: A training-free approach for diffusion-based video face swapping","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.002588Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:3a004395d41ca9f9e1bceb5a2cf99a0523a3600ff3c0e5c3576309723e438f4f","observation_id":"9baccbf0-d7de-49da-a7f9-4d4118096b1c","resolution":{"observed_at":"2026-08-01T15:42:01.002588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.20340","last_updated":"2026-04-29T12:00:44Z","snapshot_observed_at":"2026-08-02T10:18:36.960036Z","submitted_at":"2025-12-23T13:15:31Z","title":"The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.20340","snapshot_observed_at":"2026-08-01T15:42:01.141862Z","title":"The devil is in the details: Enhancing video virtual try-on via keyframe-driven details injection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.141862Z"},"links":{"cited_paper":"/paper/2512.20340","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:4956f727160d0fc1df40ddb50daf0edcb2bc719ed0a785308020aceacf09df7e","observation_id":"b380c154-95a2-4fd3-a9f0-39f6253027c2","resolution":{"observed_at":"2026-08-01T15:42:01.141862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.238742Z","title":"Rig-your-portrait: Controllable and re- lightable portrait video generation with explicit 3d guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.238742Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:0e57e6576e7469b1a567676abea93cea5a97af63cb1f17f73102a434ab5f81e6","observation_id":"3d3c9405-a7ca-434b-99c2-3fc9926e6b20","resolution":{"observed_at":"2026-08-01T15:42:01.238742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20360","last_updated":"2026-04-18T01:38:10Z","snapshot_observed_at":"2026-08-17T05:59:16.348201Z","submitted_at":"2025-09-24T17:59:30Z","title":"EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20360","snapshot_observed_at":"2026-08-01T15:42:01.295762Z","title":"Editverse: Unifying image and video editing and generation with in-context learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.295762Z"},"links":{"cited_paper":"/paper/2509.20360","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:b7af7f340b4fbd7db4c75bc011fba24a97bd4a380dd6a713adf529a0013a685c","observation_id":"2dbbc15c-a895-42bb-b53e-859a3cff9773","resolution":{"observed_at":"2026-08-01T15:42:01.295762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.349038Z","title":"Omni-video 2: Scaling mllm-conditioned dif- fusion for unified video generation and editing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.349038Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:2431d99cdde2b7460a8c6b45618b24fe62c30ef1481e375c7f8631d5f58c7ba8","observation_id":"90ce21e6-5192-4ada-8dd2-481f6db9b704","resolution":{"observed_at":"2026-08-01T15:42:01.349038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00265","last_updated":"2025-08-05T11:42:44Z","snapshot_observed_at":"2026-08-08T00:36:11.607815Z","submitted_at":"2025-08-01T02:14:00Z","title":"Multimodal Referring Segmentation: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00265","snapshot_observed_at":"2026-08-01T15:42:01.408279Z","title":"Multimodal referring segmentation: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.408279Z"},"links":{"cited_paper":"/paper/2508.00265","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:5d985867a43b7e2f675cb99fd0086d63f42cc41d86576bb21fc4be0f0fb70839","observation_id":"c60929e1-3d70-4e85-9233-cbde4651bf32","resolution":{"observed_at":"2026-08-01T15:42:01.408279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.475772Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.475772Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:ba8b8d85a3fc02fe1ad1152ae99d4d509a63417ac7345b22df5ad3959ce33ef9","observation_id":"ac111978-ed64-4c35-99e1-cc3123246abc","resolution":{"observed_at":"2026-08-01T15:42:01.475772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.533862Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.533862Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:3323b1f1e6c18d92390aa7eeab3889d193f4a8a22dddf64a1430842e5316fb02","observation_id":"90d47f93-34ab-49bd-bac6-23a715397341","resolution":{"observed_at":"2026-08-01T15:42:01.533862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.592204Z","title":"Five-bench: A fine-grained video editing benchmark for evaluating emerging diffusion and rectified flow models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.592204Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:c370d1b1ab175bb4857459f424f2f1f74f4ac85bd3b0bebad67250314946d419","observation_id":"bc1d0608-13d9-48d5-8242-5cd1f60e5406","resolution":{"observed_at":"2026-08-01T15:42:01.592204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.633450Z","title":"Sparse videogen: Accelerating video dif- fusion transformers with spatial-temporal sparsity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.633450Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:34c98750b2d54ba2e9c98db046acd62bb6591548d487a8dc150ff94dccb9d13b","observation_id":"39151521-f7ab-45af-b4a1-d1f0529135e6","resolution":{"observed_at":"2026-08-01T15:42:01.633450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.687587Z","title":"Kullback-leibler divergence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.687587Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:fe757b3199ecf2318c512225d6fa9a09b2fda20a9c94318264466b8d0eae0217","observation_id":"39c76206-ff77-4633-8e83-8d71448ed968","resolution":{"observed_at":"2026-08-01T15:42:01.687587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.721201Z","title":"Unireal: Universal image generation and editing via learning real-world dynamics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.721201Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:90199e7eb54fa8d02b4ccfe94bc57a5160ef46e70aac42ca6b2f545f382215ab","observation_id":"3d0f420c-d045-4a89-8da2-107e48479fab","resolution":{"observed_at":"2026-08-01T15:42:01.721201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.764727Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.764727Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:0e233092ac1bae2e080c0525f2e949aac55729c2f97cc4caa649d81f282cb51d","observation_id":"8402ac5c-9fe2-4365-ae60-e5919807b066","resolution":{"observed_at":"2026-08-01T15:42:01.764727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.877327Z","title":"Language as queries for referring video object segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.877327Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:360693ccda3533d51c8079c49c80d584a6f9500d9220d7d44ed0f3ea13eafb9d","observation_id":"c915adf0-ccfb-423a-83d9-a118cbb3b96c","resolution":{"observed_at":"2026-08-01T15:42:01.877327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:01.937601Z","title":"Semantic and sequential alignment for referring video object segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:01.937601Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:b25de6f66c630197412eecb75a5471fc47934f896387da44756361f63571c4da","observation_id":"068fbd4c-5a11-4744-ab8b-a5311ae12732","resolution":{"observed_at":"2026-08-01T15:42:01.937601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.044488Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.044488Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:b8258b6a567a058298dc8cbd17564f3383be8f9c1387f3ec07395bcf74ca0a90","observation_id":"885e126b-855d-4857-89ef-8ea50c3df001","resolution":{"observed_at":"2026-08-01T15:42:02.044488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.129971Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.129971Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:dcabcdbfc127cb757820764c2ad9607fef9aff0449b0445ade19bf03912041a5","observation_id":"debb7b83-fbb4-48ca-a7df-1bb13a57e61d","resolution":{"observed_at":"2026-08-01T15:42:02.129971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.287822Z","title":"Gres: General- ized referring expression segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.287822Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:3a4fa601c8d352c09969a2986557a1d0ae11b8b514127dcf4c69b2408bd1ef03","observation_id":"f58afcc8-b1d0-47d1-9d67-72c26498e48a","resolution":{"observed_at":"2026-08-01T15:42:02.287822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.393858Z","title":"Fastcomposer: Tuning-free multi- subject image generation with localized attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.393858Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:df731db530b19fafb23f12ce257ba515e02a454e3d4bb82f51a68b9589928e35","observation_id":"2c382caa-896e-4ade-8f2c-8884926d3b61","resolution":{"observed_at":"2026-08-01T15:42:02.393858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.454872Z","title":"Do vision trans- formers see like convolutional neural networks? InNeurIPS,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.454872Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:330ea14d84b4d558deb59ad315e20c0e641f3ebfd79f7ba3bfb090a988d298a3","observation_id":"024da12c-81f7-4ac7-a56d-95084efce18c","resolution":{"observed_at":"2026-08-01T15:42:02.454872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.09283","last_updated":"2026-04-22T02:23:50Z","snapshot_observed_at":"2026-08-13T04:21:08.842508Z","submitted_at":"2026-03-10T07:07:27Z","title":"From Ideal to Real: Stable Video Object Removal under Imperfect Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.09283","snapshot_observed_at":"2026-08-01T15:42:02.522075Z","title":"From ideal to real: Stable video object removal under imperfect conditions","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.522075Z"},"links":{"cited_paper":"/paper/2603.09283","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:117d24acaa0ef5e245929492f0ee074e8aff296ac9aad5952825bc34995c59ac","observation_id":"1d1d8e9c-335a-4228-aebb-f53b1f644213","resolution":{"observed_at":"2026-08-01T15:42:02.522075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.559921Z","title":"Deep multi-scale convolutional neural network for dynamic scene deblurring","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.559921Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:27f004b85d0b7bdd72ba92cf46a1a7f117cb155b9f6e727232b632f214c35151","observation_id":"a42aa916-6d44-4a0f-944e-d1c5d7b7b16f","resolution":{"observed_at":"2026-08-01T15:42:02.559921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.651514Z","title":"First frame is the place to go for video content customization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.651514Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:0609a0248da69542182a9c766129c4091a8b52f047ab69f64328d3b40cf88885","observation_id":"ce0f7f52-7dbf-4df0-8378-763e71df8486","resolution":{"observed_at":"2026-08-01T15:42:02.651514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.721564Z","title":"Deep learning-based image and video inpainting: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.721564Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:307e8560ff53ffe3d2c30ade7d56a22fa0acd5bb2cbd7545d7cc6e01be1e0a48","observation_id":"c48a6c3d-08c4-4b11-a3c4-faa1f8f7af9e","resolution":{"observed_at":"2026-08-01T15:42:02.721564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.765993Z","title":"Unboxed: Geometrically and tem- porally consistent video outpainting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.765993Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:4fd2a8d22de276ae1b073ee516d27069b9479e970fb470a19878b08ba5938dc0","observation_id":"88765cda-8bd2-4af9-8ba9-579a9717b0d7","resolution":{"observed_at":"2026-08-01T15:42:02.765993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.816873Z","title":"Colorflux: A structure- color decoupling framework for old photo colorization","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.816873Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:38e4333a75a593ae1c47db01151979c0f8392c96cc1f777ac8124d3b1f399965","observation_id":"369cb4f9-9d91-4d7f-9480-0e902e5a5739","resolution":{"observed_at":"2026-08-01T15:42:02.816873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.887156Z","title":"Colorsurge: Bringing vibrancy and efficiency to automatic video colorization via dual-branch fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.887156Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:9aa813d6ebde15633f132a582f67ebf10c72ddb4ef5299f9eefbbae0d78a0cd7","observation_id":"abdd9e1d-96df-4533-9a0e-4e3412fb0779","resolution":{"observed_at":"2026-08-01T15:42:02.887156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.955598Z","title":"Objectclear: Complete object removal via object-effect attention","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.955598Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:7a988890e9be4f6aad7d736169815d66899d426e4af71823d8a00659fd5552ae","observation_id":"6fd347bc-9ec5-4e6e-bf41-61c4d22ea039","resolution":{"observed_at":"2026-08-01T15:42:02.955598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:02.993948Z","title":"Insert anything: Image insertion via in-context editing in dit","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:02.993948Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:4db7f5b9ff2a633f0cd277d43168955ca11ef8a6d40140d1c9a3abd5f75c1e19","observation_id":"fcf6de5f-7bae-4346-9673-4fa637c79b03","resolution":{"observed_at":"2026-08-01T15:42:02.993948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:03.085818Z","title":"Champ: Controllable and consistent human image animation with 3d parametric guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:03.085818Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:ccfc9b782f134b4139577037d1769b2a09dbaccefc2f206aff81bd6b7e7506ec","observation_id":"3f2b1c8c-c7cd-40e2-8a68-3e0d2aa37d9e","resolution":{"observed_at":"2026-08-01T15:42:03.085818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-08-01T15:42:03.214892Z","title":"Phantom-data: Towards a general subject-consistent video generation dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:03.214892Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:f54c66e7711a8fd58525c0f95a228be9cadb424b4e232813d0a030651debe720","observation_id":"d0b5bbb2-e48a-4852-b2d2-ab7b4d43a9b4","resolution":{"observed_at":"2026-08-01T15:42:03.214892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:03.324083Z","title":"Phan- tom: Subject-consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:03.324083Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:13fb0717f38a26300fad90bddf502ec6cf0b1dba90016986f14437889885bb8b","observation_id":"3a0c24fa-408a-4714-81e7-a29a5bb819fe","resolution":{"observed_at":"2026-08-01T15:42:03.324083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-01T15:42:03.441093Z","title":"Self-distilled reasoner: On-policy self-distillation for large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:03.441093Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:7f20d79047c1a152629ea6335d66273811fad8a6faf0c4af6c421d8440aaed64","observation_id":"8ff40304-302a-4389-b3fb-85f422fe1622","resolution":{"observed_at":"2026-08-01T15:42:03.441093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-08-15T00:53:33.148301Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-08-01T15:42:03.593454Z","title":"A survey of on- policy distillation for large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:03.593454Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:587c31330d45c51fa185ed3289d54bb0b22b6ee1f8f77f4844c396b5ca290a89","observation_id":"8c688440-66e0-4cde-8beb-54a04b18f25c","resolution":{"observed_at":"2026-08-01T15:42:03.593454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:03.746335Z","title":"Reinforcement learning: A survey","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:03.746335Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:7bac888f1f7bb6f77cbb391defe8091dd386e0744e3e01c6aa1594abcdc52b99","observation_id":"d8063b2e-6ab6-4e30-9d1e-51f5ff310729","resolution":{"observed_at":"2026-08-01T15:42:03.746335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-16T18:20:01.123890Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-01T15:42:03.829206Z","title":"Z-image: An efficient image generation foundation model with single-stream diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:03.829206Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:3aed8503b14bb8aa1d913008f83ba6fc1538932b5f3e59ca137706fb47c97108","observation_id":"56001c31-aace-44cd-a66a-47299c962e2c","resolution":{"observed_at":"2026-08-01T15:42:03.829206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:03.903557Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:03.903557Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:32fce356addfcf08d13a290849c6324bd6b1b8c870c907edf187bc1e67c8932b","observation_id":"fd2ffb50-983a-4100-80e0-3e00f6bbf298","resolution":{"observed_at":"2026-08-01T15:42:03.903557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:03.989549Z","title":"Enhancing robustness in multi-agent reinforcement learning via temporal consistency regularization: A self-distillation framework","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:03.989549Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:a44498cf1bb963c566f0f0fdd68bf80eb8e84e5bd3830b972a43bddf8348fed7","observation_id":"5c5b56b1-23cb-47c2-ad6c-9f1f9ce36476","resolution":{"observed_at":"2026-08-01T15:42:03.989549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-08-13T06:21:09.710371Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-08-01T15:42:04.082077Z","title":"Unisd: Towards a unified self- distillation framework for large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.082077Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:0a335b0c0e31362f9007217be3c52f963d66b8a65a84f7107da7b111625e5ff0","observation_id":"2fff4f34-bfc2-4241-9075-c35dec88808d","resolution":{"observed_at":"2026-08-01T15:42:04.082077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:04.171705Z","title":"Cccaption: Dual- reward reinforcement learning for complete and correct image captioning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.171705Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:0150d0da64cde25b979c3e41b38dc984765684779874d96bf911a347734b846a","observation_id":"4b14d1bf-525e-4373-8683-fd5722250de4","resolution":{"observed_at":"2026-08-01T15:42:04.171705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:04.231784Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.231784Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:07e69d1bbbd819e5eb8fd80e771b7843f48d7ec11ecc38b9b6629755e3e24a82","observation_id":"ab000c22-e877-49f8-b07b-4556e75884f3","resolution":{"observed_at":"2026-08-01T15:42:04.231784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-01T15:42:04.315681Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.315681Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:08a24abeddcc5d57de8bcfe13bbab05e63e6488784ffe26acfd0d773588913ab","observation_id":"883dfdec-422d-49c4-8220-884b27918352","resolution":{"observed_at":"2026-08-01T15:42:04.315681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:04.380346Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.380346Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:8223a66d759f351357e980318c3d72b09519bb2ec6a76a9b27799d7f05ebd258","observation_id":"c911c923-e79e-4cfd-b091-d322e5db12c1","resolution":{"observed_at":"2026-08-01T15:42:04.380346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:04.466521Z","title":"Stam: Zero-shot style transfer using diffusion model via attention modulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.466521Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:313079ec8aef947ea1bf1b8b443228c3d5d24a8b01a43f295a50d98134218be9","observation_id":"fbec9734-90ec-4c6a-9deb-6718b62060d2","resolution":{"observed_at":"2026-08-01T15:42:04.466521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01292","last_updated":"2024-04-01T17:58:30Z","snapshot_observed_at":"2026-08-16T14:04:34.113791Z","submitted_at":"2024-04-01T17:58:30Z","title":"Measuring Style Similarity in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01292","snapshot_observed_at":"2026-08-01T15:42:04.526135Z","title":"Measuring style similarity in diffusion models.arXiv preprint:2404.01292, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.526135Z"},"links":{"cited_paper":"/paper/2404.01292","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:2fa5471bd2a7608056f6c11894533cb29b9808393f93496be53eeef137c8d691","observation_id":"19e5bd6e-bf03-48da-9fb0-411722176122","resolution":{"observed_at":"2026-08-01T15:42:04.526135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:04.604088Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.604088Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:43e7121cb06cb81aa5cc7ca9f2140a018c5a772bc76ac10eca6f1dcafb342ceb","observation_id":"f0cd5703-1622-47c9-83b3-2361ea843bb9","resolution":{"observed_at":"2026-08-01T15:42:04.604088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:04.666043Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.666043Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:b25bfb90f4012ff94f4772c6e6dbe42a98f4f05cfe355eea2be01de03bf3c695","observation_id":"08e24ebb-a40f-4b8f-89d9-042fcf6c91a0","resolution":{"observed_at":"2026-08-01T15:42:04.666043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:42:04.746401Z","title":"You only look once: Unified, real-time object detec- tion","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.746401Z"},"links":{"citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:da5e8433037435562ffab1f14354a77c2f85df2ef302ac92d244545c576874f0","observation_id":"db8a38bc-31e6-4979-b732-f065c3f0a96f","resolution":{"observed_at":"2026-08-01T15:42:04.746401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10391","last_updated":"2025-03-13T14:07:58Z","snapshot_observed_at":"2026-08-16T12:50:22.094509Z","submitted_at":"2025-03-13T14:07:58Z","title":"CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10391","snapshot_observed_at":"2026-08-01T15:42:04.839943Z","title":"color block abstraction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:04.839943Z"},"links":{"cited_paper":"/paper/2503.10391","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:e3b60d9f784bf88ec86018ab464588aac2b9914d099d4877535d76131e92ed9d","observation_id":"c2ea64d7-54ec-4967-92ac-74862def1255","resolution":{"observed_at":"2026-08-01T15:42:04.839943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 0 inbound Pith citation observations for arXiv:2607.18227."}