{"as_of":"2026-08-13T15:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4754d11a441734d15c60f8df43fc1d4f7ae6093d57309ae734df48d344a04c10","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:58:20.867051Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22868/citation-record","integrity":"/paper/2506.22868/integrity","json":"/paper/2506.22868/citation-record.json","paper":"/paper/2506.22868"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.779811Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"0329c6f3-8c83-4629-825c-01b13295cfe7","year":2020},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:17.548575Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:739147dca4f1ebc5c5620db33f8a5a74144df60f4bf302dd96c952ba1b78a752","observation_id":"5e74f456-8650-4173-be87-565e6a239d3b","resolution":{"observed_at":"2026-08-06T21:58:24.816014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:17.655661Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:17.655661Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:009ccd53e7527f68f3e988865454f40dab0dbba0c6a69f0a384e195b4a899c1a","observation_id":"0a455bb6-a9dc-4241-b35f-8c306e1ab19c","resolution":{"observed_at":"2026-08-06T21:58:17.655661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:17.820669Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:17.820669Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:4d196d69640e67885dc2040231cb82545a196efd6c6f53f01647690f8a6e56f3","observation_id":"b8d1f45a-fe28-4dbb-bb9d-7eb102f9440f","resolution":{"observed_at":"2026-08-06T21:58:17.820669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.650811Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing","venue":null,"work_id":"373440a2-8df2-4be2-b4ce-e07263bc2496","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:17.935195Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:12c37473260836592a7a66c6700355d23dc719131174a8a402aa38f51bf66fdd","observation_id":"107e24cd-4f68-4bc1-98e1-37209ca6c7c0","resolution":{"observed_at":"2026-08-06T21:58:24.702536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:18.052273Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.052273Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:b65df413c2f444bd0d1c2d7ed3aa38c474242e35d8ed8d903a769c312c8b51d6","observation_id":"7cd4fdec-6816-4bc0-993a-374ed89aedb3","resolution":{"observed_at":"2026-08-06T21:58:18.052273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:18.095880Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.095880Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:12ea0641ec0d4b62a912b7f4b00db09f2a4ee1ddfec189fd62caceabd651aa06","observation_id":"d35b103f-4a85-4b55-ab8c-94281935532d","resolution":{"observed_at":"2026-08-06T21:58:18.095880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.499325Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":"6fd20596-f0d8-4883-b785-efaa6f5d0d2f","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.191747Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:923254975658bda0f256a81ff003cd5275c856d86840fafd72053370a845b631","observation_id":"922ab1d7-938a-403a-a33f-ddf1d5c4041a","resolution":{"observed_at":"2026-08-06T21:58:24.546779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.333838Z","title":"Diffusion-based conditional image editing through optimized inference with guidance","venue":null,"work_id":"55a3f5e6-3f12-45c7-9407-d6a7e7d1eb45","year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.239810Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:ab3775b8bfa6a68a9410e53ac6219004029c3fd584880d6fcbb39126b62e0d26","observation_id":"4ffa6e88-a951-4ab8-bfd7-4f553d2c6256","resolution":{"observed_at":"2026-08-06T21:58:24.435134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20484","last_updated":"2025-03-26T12:15:25Z","snapshot_observed_at":"2026-08-10T02:40:09.660983Z","submitted_at":"2025-03-26T12:15:25Z","title":"Contrastive Learning Guided Latent Diffusion Model for Image-to-Image Translation","version":1},"cited_work":{"arxiv_id":"2503.20484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.20484","snapshot_observed_at":"2026-08-06T21:58:21.277318Z","title":"Contrastive Learning Guided Latent Diffusion Model for Image-to-Image Translation","venue":"cs.CV","work_id":"87c67186-dad9-46e7-badf-058a08266a2d","year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.339617Z"},"links":{"cited_paper":"/paper/2503.20484","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:ce12ab9b9b54be7cacd376b6f8a768c013954def6455003f9cc98f9c20909e4e","observation_id":"32715537-9fec-4306-8bdc-a846424c135d","resolution":{"observed_at":"2026-08-06T21:58:21.369912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.159148Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":"debe7035-8ee0-428a-9cb8-16c7b2393dfd","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.424360Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:3b208250558ca5c441cafa87091e0c7a845646951e5ce4d7d7122f75c4f9becf","observation_id":"873a7229-90dd-474e-8195-c17a7a193b5e","resolution":{"observed_at":"2026-08-06T21:58:24.269288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.008694Z","title":"Diffusion-based image-to-image translation by noise correction via prompt interpolation","venue":null,"work_id":"ce290626-761a-4e3d-aa56-f31afaf7ee13","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.496822Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:6360882529fc0929f19707ea531dd6d39148e806cb27fff76df1e7c7dbc6a80d","observation_id":"c13b1b38-61da-45b5-a693-3212ca8e3ec7","resolution":{"observed_at":"2026-08-06T21:58:24.083225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.889715Z","title":"Fatezero: Fusing attentions for zero-shot text-based video editing","venue":null,"work_id":"240cc3f4-c56b-49b0-966c-41c0e8979106","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.604831Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:dfdfad430726b6f0528213244df29976de7ca57f64530e55875134d4391253c5","observation_id":"b547edd8-55f9-42be-89bc-808ff42db11e","resolution":{"observed_at":"2026-08-06T21:58:23.947233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.781253Z","title":"Ground-a-video: Zero-shot grounded video editing using text-to-image diffusion models","venue":null,"work_id":"83bc933b-f5f0-4608-b2aa-da42e2e3abc1","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.658776Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:ed103ab8b3060fcb4a03fbffa03f0f08382b474a1f0a900656a3ae20d7bd2efa","observation_id":"213f5a34-c815-4097-9e1f-f6533f66d8c2","resolution":{"observed_at":"2026-08-06T21:58:23.840518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.606312Z","title":"Flatten: Optical flow-guided attention for consistent text-to-video editing","venue":null,"work_id":"83876e93-3cbc-4edf-9c7c-f54f62da60a6","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.748764Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:4257a56919b2a595d838497f90dd6be162e04f65f75c8e1429e3aed4357de210","observation_id":"00da7c19-34bc-4ec4-b69a-88af6dfed89a","resolution":{"observed_at":"2026-08-06T21:58:23.692616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.427470Z","title":"Videograin: Modulating space-time attention for multi-grained video editing","venue":null,"work_id":"e9aa07e5-f522-4015-9e5f-a790ea172d70","year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.854827Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:01bf8153241a1bc8e1a14b452411aad77f758d971dce7f6489da18114157b792","observation_id":"8029e461-c15a-4368-a52f-e093bcd6fad3","resolution":{"observed_at":"2026-08-06T21:58:23.510644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05275","last_updated":"2024-12-06T18:59:12Z","snapshot_observed_at":"2026-08-11T20:46:57.322730Z","submitted_at":"2024-12-06T18:59:12Z","title":"MotionFlow: Attention-Driven Motion Transfer in Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05275","snapshot_observed_at":"2026-08-06T21:58:18.941915Z","title":"Motionflow: Attention-driven motion transfer in video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.941915Z"},"links":{"cited_paper":"/paper/2412.05275","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:08c2663378632b2f8cee64f26b8b752c0a045720fbbc9cf4221aeadcb565cd4f","observation_id":"e82dd3cc-86c2-4191-846b-b7efb7a306f5","resolution":{"observed_at":"2026-08-06T21:58:18.941915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.233664Z","title":"Space-time diffusion features for zero-shot text-driven motion transfer","venue":null,"work_id":"105d041e-e4fd-4ecb-9cb4-852c76d965d0","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.000948Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:ae4e8a199231d575aa3db16eb49bbe4dbd9757df2c5c181033bdf8d0daf997fa","observation_id":"fe586e70-3c36-49c0-a6bc-1ea795a58e7f","resolution":{"observed_at":"2026-08-06T21:58:23.335708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07563","last_updated":"2025-01-13T18:53:08Z","snapshot_observed_at":"2026-08-13T04:30:30.429905Z","submitted_at":"2025-01-13T18:53:08Z","title":"Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07563","snapshot_observed_at":"2026-08-06T21:58:19.098685Z","title":"Training-free motion-guided video generation with enhanced temporal consistency using motion consistency loss","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.098685Z"},"links":{"cited_paper":"/paper/2501.07563","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:bb51366823d48347be3b403ceeb7db7eea39844567b0719685eed2f8a752f415","observation_id":"48e4c4a0-03a6-4156-a7d1-2bccfee42363","resolution":{"observed_at":"2026-08-06T21:58:19.098685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13185","last_updated":"2024-04-07T12:11:28Z","snapshot_observed_at":"2026-08-13T04:14:20.836431Z","submitted_at":"2024-02-20T17:52:12Z","title":"UniEdit: A Unified Tuning-Free Framework for Video Motion and Appearance Editing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13185","snapshot_observed_at":"2026-08-06T21:58:19.169735Z","title":"Uniedit: A unified tuning-free framework for video motion and appearance editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.169735Z"},"links":{"cited_paper":"/paper/2402.13185","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:1297fb0a35b199ef6300346a9d9c1742691046c2323bb36a775232ce0af384b4","observation_id":"35b42fb0-da08-4b86-aec2-87dee749593c","resolution":{"observed_at":"2026-08-06T21:58:19.169735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.053462Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"81404e79-5642-45cb-94f4-09e289dfdf55","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.304177Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:fb1e3e3e0312cbe77e6543a234a1453326bcf7ed472bcff98c145f670624873b","observation_id":"711a8b93-4d1d-4d0c-8bc9-76791c13f96d","resolution":{"observed_at":"2026-08-06T21:58:23.124861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:22.825027Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"82ed4526-62d5-4a62-80a9-ed6ec32176e5","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.383976Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:8671ead81d5dc0cb7e7ba5f51daa2d964c707e6e4f30ea8bab0a7548632114da","observation_id":"d715c2bb-58a6-4ded-adad-b4256979c1a3","resolution":{"observed_at":"2026-08-06T21:58:22.926987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:22.637611Z","title":"xformers: A modular and hack- able transformer modelling library","venue":null,"work_id":"9784c19a-d105-443c-ba81-1d26be39a5e8","year":2022},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.476075Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:b586eb1728d85d5385388753cf8f6b52a3109c42836daf70e64365c3207c0636","observation_id":"7f1c43dd-7448-41b0-81fc-6011d74e3b19","resolution":{"observed_at":"2026-08-06T21:58:22.729405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:22.419521Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"5d9f888c-7158-4da1-9f49-1772b1ff2f18","year":2022},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.555041Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:7b0de0c3c7c277d2af9308c9be3333bb5e949d66cfb61bf4e89edb87ba83cdbc","observation_id":"d252c641-7901-4f73-964c-068b42da3100","resolution":{"observed_at":"2026-08-06T21:58:22.526603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:19.621676Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.621676Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:97e386f0c17fcf1fcde8fc3ff09a7e9e363aa9239d622ad28e0c4490e44a62ea","observation_id":"8839af71-a749-41f0-a6f1-2ce3d380d583","resolution":{"observed_at":"2026-08-06T21:58:19.621676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-11T23:38:12.766811Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-06T21:58:19.736689Z","title":"Open-sora 2.0: Training a commercial-level video generation model in $200k","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.736689Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:067463f07f87e42b02ae563260cdcb2210b4cfe1df36133ce573a1da742f6016","observation_id":"20279b19-f2fa-4203-854a-7eaffbecba57","resolution":{"observed_at":"2026-08-06T21:58:19.736689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:22.260005Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"6c9345d6-a4e7-46a7-9cec-ef27c57c92e9","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.836926Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:b022bd09eddc7deabe2edb731778271a217cc2726ec5e80e0d3cca98f8679ebb","observation_id":"f81c149c-9cd6-42c5-b1f9-780c84b5eb49","resolution":{"observed_at":"2026-08-06T21:58:22.326965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:19.924667Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.924667Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:6a70cebf0d75923fdb3b57d57dc2a9e9658be7d08182895cfed1e933a70d4513","observation_id":"353db1de-2c42-4ba2-981c-f5f832c53a03","resolution":{"observed_at":"2026-08-06T21:58:19.924667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-06T21:58:20.015575Z","title":"Zoedepth: Zero-shot transfer by combining relative and metric depth","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.015575Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:6122bff6c6e7435ffd6e4b3ae02c9e5532b0fa30cfdb1fa77d9f90f84c73d91d","observation_id":"e92248f5-fd44-4016-bed4-f6fa8cc1f4f5","resolution":{"observed_at":"2026-08-06T21:58:20.015575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:20.134361Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.134361Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:34073d736e6257bcd432e993c86624a2e5c78fdc2065a9f303c3d01b857c6d1a","observation_id":"0941b655-dbeb-4eb2-9602-ab1fde92ebb6","resolution":{"observed_at":"2026-08-06T21:58:20.134361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-13T11:44:43.834756Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T21:58:20.179134Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.179134Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:b76372ea4630e3f271bd7e231ec2a1b8929cb74ee3d0de962b09d4325316be82","observation_id":"9fb9494b-f604-4bec-bb6a-b100b8452b68","resolution":{"observed_at":"2026-08-06T21:58:20.179134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:22.080919Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":"31186074-2089-4d3b-b8a0-0174c911973b","year":2022},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.276208Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:ba867a31756e147deac7444cb6f92e2902696c5ca513b2785579ff51c80a9274","observation_id":"1eb3b22d-476f-4235-b34f-8c69f500a7f8","resolution":{"observed_at":"2026-08-06T21:58:22.152618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:21.944069Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":"bd399a9c-586b-4e3c-8770-72020f491c65","year":2021},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.367889Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:151b15e4f981c0c11f774507f31ee46d45b60597cde6804ca7b901f1ce0772b5","observation_id":"bf5cd6b0-a255-4458-a194-c13574e158ad","resolution":{"observed_at":"2026-08-06T21:58:22.020567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16003","last_updated":"2023-10-24T16:56:58Z","snapshot_observed_at":"2026-08-13T05:59:17.585606Z","submitted_at":"2023-10-24T16:56:58Z","title":"CVPR 2023 Text Guided Video Editing Competition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16003","snapshot_observed_at":"2026-08-06T21:58:20.436889Z","title":"Cvpr 2023 text guided video editing competition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.436889Z"},"links":{"cited_paper":"/paper/2310.16003","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:8c680c47315db2a7398bd5ff422e36dc87e5ebfa38811f72dc99a8ade47d8a7b","observation_id":"41243e34-8d12-4ebc-a532-7e5ec9ba7103","resolution":{"observed_at":"2026-08-06T21:58:20.436889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T21:58:20.495158Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.495158Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:89e6f26af0ce235ed64cd5c481e81d34e3b0e317082184917a72882f785268e3","observation_id":"23fc5b55-0769-450e-9dea-95e8c182564c","resolution":{"observed_at":"2026-08-06T21:58:20.495158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:21.824500Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"cf70b230-6c89-421e-b8d3-34bd71aea641","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.566749Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:19f30b373e3ae379fae99dfd92e09ea4d116294b8c3f7a1375b7cf42a27807c3","observation_id":"8050547f-13ea-4b48-90b8-e044b211af55","resolution":{"observed_at":"2026-08-06T21:58:21.891490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:21.677911Z","title":"Amt: All-pairs multi-field transforms for efficient frame interpolation","venue":null,"work_id":"75933b26-b065-461f-a5a7-9375e5a7550f","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.674027Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:9156b92f1d9f5671ecd29f525eb554d38720ae5ffb7cde2e7c792ac77fa7f27d","observation_id":"94c8b2bd-11fd-4ec2-a416-a9bd26a4ed84","resolution":{"observed_at":"2026-08-06T21:58:21.739232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:20.751219Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.751219Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:0dcf7dc51ec0981a15f7671f788058309b4ba378c4e36374ec3d54c14487f1ec","observation_id":"3d89db66-bef8-4376-ad15-9bff6d6d0cf3","resolution":{"observed_at":"2026-08-06T21:58:20.751219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:21.488175Z","title":"The unreason- able effectiveness of deep features as a perceptual metric","venue":null,"work_id":"70c4a614-53a3-4986-90bc-c669cc6c539b","year":2018},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.867051Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:3f1859feb1cb1f73b63e60c177195da6ceaa1ebaf9d5cbee82a8ece51611f938","observation_id":"653561fb-c589-4c72-8ba0-bc9ed96106d7","resolution":{"observed_at":"2026-08-06T21:58:21.615045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2506.22868."}