{"as_of":"2026-08-10T13:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:597ca42d69bd03d2c6228449dd8849866ab85c7349fbb0d6f86935288b76042f","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T12:43:34.724121Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T12:43:34.724121Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T07:49:39.355337Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"cited_work":{"arxiv_id":"2606.22042","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.22042","snapshot_observed_at":"2026-07-04T07:49:39.355337Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","venue":"cs.CV","work_id":"c6ec1122-2f57-465b-9b5c-e620f8a9095d","year":2026},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"cited_paper":"/paper/2606.22042","citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:a26d12b1df1cca3447139ddcc69f8a47301433377f57a33ec0fc4f60f5291e7a","observation_id":"e14e79f9-b237-406b-8572-aa4a2d6098a3","resolution":{"observed_at":"2026-07-04T07:49:39.356838Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.22042/citation-record","integrity":"/paper/2606.22042/integrity","json":"/paper/2606.22042/citation-record.json","paper":"/paper/2606.22042"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"cited_work":{"arxiv_id":"2606.22042","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.22042","snapshot_observed_at":"2026-07-04T07:49:39.355337Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","venue":"cs.CV","work_id":"c6ec1122-2f57-465b-9b5c-e620f8a9095d","year":2026},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"cited_paper":"/paper/2606.22042","citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:a26d12b1df1cca3447139ddcc69f8a47301433377f57a33ec0fc4f60f5291e7a","observation_id":"e14e79f9-b237-406b-8572-aa4a2d6098a3","resolution":{"observed_at":"2026-07-04T07:49:39.356838Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Overview Framework As shown in Fig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:833c8049f43af416adb34279cddfc0db06d2c8864c5d596532f0b582b0329917","observation_id":"7e303af9-295d-4958-9e34-14d3e9dd1010","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:51bb1ee2558d6e14c2f59a894182aad71fa983631968ac7a3b99f8e1ce113556","observation_id":"b1513b35-f65c-4117-911d-4f6141908c24","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:c5779ac0378d1e595780f5f4e3318655602e3b295499e191a0c47711744e7978","observation_id":"f27b9877-8e18-43fd-ab14-b642580299e4","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:ad3afa553615409a8b18b9d44b7e7e60c2ab8499164e9fff0e55168af6db1581","observation_id":"019b7041-adea-415d-8af4-bbee8381394c","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05922","last_updated":"2024-02-29T21:06:58Z","snapshot_observed_at":"2026-08-10T03:14:56.876279Z","submitted_at":"2023-10-09T17:59:53Z","title":"FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing","version":3},"cited_work":{"arxiv_id":"2310.05922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05922","snapshot_observed_at":"2026-07-04T10:29:44.581037Z","title":"Flatten: optical flow-guided attention for consistent text-to-video editing.arXiv preprint arXiv:2310.05922","venue":null,"work_id":"fcf71241-5358-4d1c-b4e8-be2d6238d521","year":2023},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"cited_paper":"/paper/2310.05922","citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:00031a2849dd701efd604d35e5a175355359b4ba9675326db7cf7fc5a1ecf6eb","observation_id":"e591eaa2-6ed4-407a-b9a8-17583f8d6390","resolution":{"observed_at":"2026-07-04T07:49:39.367022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Flowvid: Taming imperfect optical flows for consistent video-to-video synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:6e8818e0700df000ba86965994be2ee47e357911af774560ead0f2b0548b3307","observation_id":"38c1c136-26eb-4eb6-9b20-171852a61ae5","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Tune-a-video: One-shot tuning of im- age diffusion models for text-to-video generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:fccb854712e3aace2313010397ffca512b9c0ffb1b11ac5d057337c50948614a","observation_id":"83888145-6cc6-4366-a36d-c8d400cb7cab","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13077","last_updated":"2023-05-22T14:48:53Z","snapshot_observed_at":"2026-08-08T20:41:37.700266Z","submitted_at":"2023-05-22T14:48:53Z","title":"ControlVideo: Training-free Controllable Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2305.13077","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13077","snapshot_observed_at":"2026-07-04T17:40:00.876998Z","title":"the words ‘KEEP OFF THE GRASS","venue":null,"work_id":"31856993-b01c-4e20-8380-fae90b49a405","year":2023},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"cited_paper":"/paper/2305.13077","citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:60ba1b10a38aeb12cba83e1b076c724e479b46e649e1e8fa6cd7e4eccff0cb67","observation_id":"0247e34f-c2f6-4e24-9e30-601382f083ee","resolution":{"observed_at":"2026-07-04T07:49:39.347979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Videograin: Modulating space-time attention for multi- grained video editing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:8aea1c3e607cf4dff6fd09673f75453abdc4efef40114bf228104b847c07d47b","observation_id":"48329f95-5c49-4570-aa2d-1a5111960914","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01107","last_updated":"2024-02-24T19:39:37Z","snapshot_observed_at":"2026-07-06T16:26:26.426279Z","submitted_at":"2023-10-02T11:28:37Z","title":"Ground-A-Video: Zero-shot Grounded Video Editing using Text-to-image Diffusion Models","version":2},"cited_work":{"arxiv_id":"2310.01107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.01107","snapshot_observed_at":"2026-07-04T07:49:39.349120Z","title":"ArXivabs/2310.01107(2023),https://api","venue":null,"work_id":"64b08f2b-0d4f-4228-ad4b-d0fc43132daa","year":2023},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"cited_paper":"/paper/2310.01107","citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:5097ff898ece41b0033fc0d9c425b3af67e8f4d1b64527d16ea410447c83d59d","observation_id":"6bc0c686-a498-4e38-a11f-c10426f96f59","resolution":{"observed_at":"2026-07-04T07:49:39.350674Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Fatezero: Fusing attentions for zero-shot text-based video editing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:554ace0b7a10ed7dee2afc3d9a3e7d0bef8e42c62f4b148e5e12a3a4df7b2656","observation_id":"c8bf65e4-a999-4dd9-a8dc-41cfae508dc7","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Pix2video: Video editing using image diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:0de74fb9a0b454630540d0bafde739c111fb67367b42c1d2ea10e4b6c9375c21","observation_id":"3547360a-df69-46c1-9318-7514e0bfe95b","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-06T08:12:35.134201Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":"2307.10373","doi":"10.1109/iccv51701.2025.005","metadata_source":"pith","pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","venue":"cs.CV","work_id":"2e967b53-6386-4564-b468-ffd540817064","year":2023},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:ed64cbfcd134a3b56d3db92ebfeb23092b775c4625f60c0aa017b2fd1fc72551","observation_id":"a2be8264-82e6-49c5-8272-25df6ae46328","resolution":{"observed_at":"2026-07-04T07:49:39.349833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:05745b482b3a0390cbcb8f1d165e4ac82a3d03a69286d62e3a4b2d92c2e2fad1","observation_id":"fd87b3d6-acb2-4f88-b126-bf3850ea1af8","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Videodirector: Precise video editing via text-to-video models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:bc4c2a45688177ebd4ab3d5f8293a226613d70d4ab52fc40c2686335b6db92a7","observation_id":"93aa88d6-b135-4de2-a947-77420f7ef6e3","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":"2403.14468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-07-04T10:29:44.541818Z","title":"arXiv preprint arXiv:2403.14468 , year=","venue":null,"work_id":"91372074-cd42-4426-bf90-2d27dee1a1c9","year":2024},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:e4bdc47f1336e011725965112c492fad71d5eb0a06fc2d6f5d93bb38aafd90f7","observation_id":"2fd1bcb0-2cac-4c97-8393-b070b931ec90","resolution":{"observed_at":"2026-07-04T07:49:39.360807Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Stablev2v: Stablizing shape consistency in video-to- video editing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:2a2edbad5cb55df9d62ccaa92d6c395eb1fb1e769b708415e2087c64b204645f","observation_id":"bcbc293f-c2a2-4c30-a384-197a6ac3a016","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:994c2952c3777f5923a3ea3aba94fc57b398d574dbaa8d3d7481a75b7fb126ed","observation_id":"da2a343d-6e09-4831-a9fa-500ce06e9f1c","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:928af01532d4ed6a2db2077919917e85bb81a401a4e075643212b797ae9c7514","observation_id":"9dc34f72-fbf0-4797-aca7-141b2c5c089c","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:1934684f81644d12ee1868ba1aefe461ec20bd343d78399c36fc2617a672e892","observation_id":"c7d43a11-e123-4b12-acb4-2afdbd8dc002","resolution":{"observed_at":"2026-07-04T07:49:39.344868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:5c1dbfe2013db34f41da35f03b3c5faa3ac7fcdb9629b430b34ea8690f6e4bac","observation_id":"6569343c-d998-49e6-9ea4-ea67c4deb698","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Dense text-to-image generation with attention mod- ulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:a8419f20ed63b5e6cf8960a4fc44bba1a68467842448bc36e8943d33a75c24a4","observation_id":"8453f64e-ee19-4da7-ab63-afb5989f7da2","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"A benchmark dataset and evaluation methodology for video object segmentation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:b1733455dd52aa57bc8c4554b4350efa2eb00bf2c5c0ec26708df7e9d902944d","observation_id":"97b15be1-477f-4600-85ee-2cf080f4efd5","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"The 4th large-scale video object segmentation challenge - video instance segmen- tation track,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:fcd76af3292aa72447a99bc98096cfc80dda49527c1dcaa458ab76f56cc415c1","observation_id":"415ae39a-96d8-4d1d-ba1e-3f642459539e","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Sam 3: Segment anything with concepts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:7da00634c33f98f7c7e22c0bbf92dcc5a7a6ff016487705a69350e42b90ef3c2","observation_id":"8da24bb6-4e2b-4e7d-93c8-a060f1c11975","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"VBench++: Comprehensive and versatile benchmark suite for video gen- erative models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:e318ed245e4406f0c175e11e6692d985039b4e65bf29c6ba0436c4751c77b141","observation_id":"a96a30d6-0893-4079-8ebb-b7b17ccd8201","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T12:43:34.724121Z","title":"Learning transferable visual models from nat- ural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T12:43:34.724121Z"},"links":{"citing_paper":"/paper/2606.22042"},"observation_digest":"sha256:1713fac23be0bf56fe8f28576328b392c83f080d5f8b07606dc73a9c4d1b2e8e","observation_id":"9ad08ccb-ccba-44e4-a200-4dd6b4b79627","resolution":{"observed_at":"2026-06-26T12:43:34.724121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.22042","last_updated":"2026-06-20T13:47:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T13:19:43.915662Z","submitted_at":"2026-06-20T13:47:39Z","title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":21,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2606.22042."}