{"as_of":"2026-08-17T23:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:377e336422d638b712130f0451c528fe8de94cf0e59309b7637a0019b06ca615","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T08:52:23.330736Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.23254/citation-record","integrity":"/paper/2606.23254/integrity","json":"/paper/2606.23254/citation-record.json","paper":"/paper/2606.23254"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Tongyi wan 2.7 video generation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:f5ab44f1c5970ae1fef337cf534a6b83aff644c595ed87b2dc3f8fffe26c1487","observation_id":"01a54191-87f2-47e2-81d0-9c26a4ff3c39","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:17c603e894ee05ed67adf015eb0c300935cd8c5f2045df173756df5c005393ff","observation_id":"f5a5541a-0e81-4b0a-b632-0aa8a524679e","resolution":{"observed_at":"2026-07-04T10:29:44.529172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Videopainter: Any-length video inpainting and editing with plug-and-play context control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:4718799aaf1e22dc845cea991d5b65316b2925866eb61e8c1c02c65b775a379f","observation_id":"a8e581ee-5a31-44db-a591-0439240b8e92","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:6b0dc72f2254187e76e1584b900e4ee87df7464629ab9847a0543d940abb07b1","observation_id":"e5d4207f-e998-4989-bdde-93c969933e4c","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Diffute: Universal text editing diffusion model.Advances in Neural Information Processing Systems, 36:63062–63074, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:b8c1aed6c5401d13896aac8c5d6d02f28a2749c4b452619ea40e4badddeed41e","observation_id":"82b66182-6fbf-4582-a3a4-8ca3f67792c9","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Textdiffuser: Diffusion models as text painters.Advances in Neural Information Processing Systems, 36:9353–9387, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:cabaaf74e73b1eb6ab2674b9f6cb06ca1dd32982ca45e8c6c2ea9eededbd9a0e","observation_id":"c2f3816c-bbbf-4401-9a69-fe2164c75568","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Textdiffuser-2: Unleashing the power of language models for text rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:e3483190fe3337334bea669bc0cdef9db6a096ace88760cbbfe23ab7c2fc2db6","observation_id":"5a3f1490-c515-4cde-983d-12e21b079ab6","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00213","last_updated":"2023-12-01T11:41:34Z","snapshot_observed_at":"2026-08-16T14:47:01.867872Z","submitted_at":"2023-11-01T01:20:12Z","title":"Consistent Video-to-Video Transfer Using Synthetic Dataset","version":3},"cited_work":{"arxiv_id":"2311.00213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00213","snapshot_observed_at":"2026-07-04T13:09:51.162552Z","title":"arXiv preprint arXiv:2311.00213 , year=","venue":null,"work_id":"d795adb5-f50a-4e89-a8a5-46b3551f6485","year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2311.00213","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:84b341c5883b2ae2d1ceaa4844cfaeae1624b99badc1a53db6ff11ea82e58bb1","observation_id":"a370b689-cc2a-4335-adfc-9adb30f92714","resolution":{"observed_at":"2026-07-04T10:29:44.591005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:29:44.569521Z","title":"Viva: Vlm-guided instruction-based video editing with reward optimization.arXiv preprint arXiv:2512.16906, 2025","venue":null,"work_id":"3c1a99be-2d67-41e2-bd52-93ab5317ab13","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:36f36b39f9adb1df918ea379cbd104eacd388a2ac260399b8ca7445faff62e2e","observation_id":"b9a5b256-51e6-46db-8dd6-724c0ae8b81b","resolution":{"observed_at":"2026-07-04T10:29:44.571018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05922","last_updated":"2024-02-29T21:06:58Z","snapshot_observed_at":"2026-08-16T14:53:43.757992Z","submitted_at":"2023-10-09T17:59:53Z","title":"FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing","version":3},"cited_work":{"arxiv_id":"2310.05922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05922","snapshot_observed_at":"2026-07-04T10:29:44.581037Z","title":"Flatten: optical flow-guided attention for consistent text-to-video editing.arXiv preprint arXiv:2310.05922","venue":null,"work_id":"fcf71241-5358-4d1c-b4e8-be2d6238d521","year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2310.05922","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:43cf4852be0af856a10f8b7b2fb54ae8b6bc17898c6db5fc9768a48b19ea46ed","observation_id":"3d47ce53-766d-4b8f-9f9d-9269ded40262","resolution":{"observed_at":"2026-07-04T10:29:44.582861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Peak signal-to-noise ratio, 2026.https://en.wikipedia.org/w/index.php?title=Peak_ signal-to-noise_ratio&oldid=1210897995","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:9c662fe15102e25ac7e64eb3d24842ae25c8311145ecae409b700a882aaa67d0","observation_id":"6caf3afb-c236-4023-b898-9f1f0f0739d5","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05595","last_updated":"2025-07-08T02:14:10Z","snapshot_observed_at":"2026-08-14T05:24:51.715708Z","submitted_at":"2025-07-08T02:14:10Z","title":"PaddleOCR 3.0 Technical Report","version":1},"cited_work":{"arxiv_id":"2507.05595","doi":"10.48550/arxiv.2507.05595.url:http://arxiv.org/","metadata_source":"pith","pith_arxiv_id":"2507.05595","snapshot_observed_at":"2026-07-11T02:17:46.362300Z","title":"PaddleOCR 3.0 Technical Report","venue":"cs.CV","work_id":"444c549c-1895-4cae-a2d3-c13d7ed5f462","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2507.05595","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:963ecee06a93acd71d75db9ea097a500405d2f8590c519a700002dc0f977bfeb","observation_id":"45e57e04-289b-4fac-a70c-cfd1cf28c8be","resolution":{"observed_at":"2026-07-04T10:29:44.514082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Diffusion models beat gans on image synthesis.Advances in neural information processing systems, 34:8780–8794, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:4bf3c32b3f2d4612b6e1dec942ed7f76c7da08db338316338851efafc386fb3f","observation_id":"ca51d50a-9086-430e-942b-7a7ee93c3a91","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:7d14011db438fe754503499ff57684bae9186040fec4e7d457181e39974f268e","observation_id":"02321dd6-8e9f-4c76-8cda-fe9205f194eb","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14617","last_updated":"2024-10-24T20:10:30Z","snapshot_observed_at":"2026-08-16T14:07:34.770240Z","submitted_at":"2024-03-21T17:59:03Z","title":"Videoshop: Localized Semantic Video Editing with Noise-Extrapolated Diffusion Inversion","version":3},"cited_work":{"arxiv_id":"2403.14617","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14617","snapshot_observed_at":"2026-07-04T10:29:44.507216Z","title":"Videoshop: Localized semantic video editing with noise-extrapolated diffusion inversion.arXiv preprint arXiv:2403.14617, 2024","venue":null,"work_id":"7b651e03-3d5a-42da-a9a3-74b1aab22fea","year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2403.14617","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:ff5d2bc890d90bf574c9516afa0db4bce17bef10f8beff1acd33f0cc9d657c86","observation_id":"39976ede-3408-4917-bff5-aac230d806a9","resolution":{"observed_at":"2026-07-04T10:29:44.508863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"google-10000-english, 2026.https://github.com/first20hours/google-10000-english","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:a189d09a320221b2fc9ef683dd9cdd14f727a05884b66dce4efb9eb0050a486c","observation_id":"a4d07c76-0f05-4796-9be8-13b9875d467c","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-15T03:17:05.670808Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":"2307.10373","doi":"10.1109/iccv51701.2025.005","metadata_source":"pith","pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","venue":"cs.CV","work_id":"2e967b53-6386-4564-b468-ffd540817064","year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:94f3fee3789a9eba61e9c6850471d022e52234481a046956370545501efd40c6","observation_id":"80c54c28-66af-4bd3-8eaa-12ea81f79a36","resolution":{"observed_at":"2026-07-04T10:29:44.550528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Google fonts, 2026.https://fonts.google.com/","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:b204d480c7c100d6ab0c4b410b9bbff778be7f5f43c2582f88f323140af1b281","observation_id":"db5d6a78-ceb2-4b5c-82b7-202c0b33c627","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:efe738d96ccb91a21468abe4a157eeb8ce744baf5c6ce5e5092735fa286a65c8","observation_id":"94b77fb0-d500-4aaa-a4de-81ea45ae305c","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Videoswap: Customized video subject swapping with interactive semantic point correspondence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:2e696229e3ac4fcae43fdbe741a5d69480f542b089ce9cb2ccb9819a47f77ec2","observation_id":"163fca16-bd3a-477a-9883-eef26dc9e62a","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:8b869cab95b17838e408e60fcb2375faa6e127c112907feecc947bc40818ec1f","observation_id":"99feef22-cde9-4aa7-a86e-3b2fdc8fffa0","resolution":{"observed_at":"2026-07-04T10:29:44.562273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:e3c22ff5e9d041daeceaf94918c40481f21ef9f390d6c9840c854e917f2566b7","observation_id":"ab0ee45a-30a5-4170-b466-36597b38f5b4","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:64f905fb9e48c1f1505d2fb45d49e6262e52e1dfc2e82ed6d3d91a4305b00d65","observation_id":"fea129e5-139b-43c7-a561-a2221eecddd0","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:22bd0be6fae0cf80a71a132d697d11456f1feed69b19940835114ea8f31fadff","observation_id":"4c66eb26-f31d-41c2-8a29-273ca8836406","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15260","last_updated":"2025-07-14T07:52:04Z","snapshot_observed_at":"2026-08-17T22:50:30.756262Z","submitted_at":"2024-11-22T10:04:05Z","title":"VIVID-10M: A Dataset and Baseline for Versatile and Interactive Video Local Editing","version":2},"cited_work":{"arxiv_id":"2411.15260","doi":"10.48550/arxiv.2411.15260","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15260","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vivid-10m: A dataset and baseline for versatile and interactive video local editing","venue":"arXiv (Cornell University)","work_id":"a2c72f0c-816d-4ada-85e4-1976f9aab050","year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2411.15260","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:0ff190261d65383f02a7e20df0ea0ad81440d2e38c862760831058f32bff11c4","observation_id":"de744b06-fdfd-4b1f-a811-e9516906f7d2","resolution":{"observed_at":"2026-07-04T10:29:44.520621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:17.693153+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:17.693153+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:803956bfcf1630a8942921901c3434b6d12204383ab1c46dd91474925bef2675","observation_id":"31992bb2-30c1-4363-9861-da234462f905","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Rave: Randomized noise shuffling for fast and consistent video editing with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:0ec7549b089a7c36e26f6c60c9d36177b2d8470f5a8f4b5b1423c08a1f751da6","observation_id":"716a80d8-ade9-4c87-bf29-4d1ecf04c5f2","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:170e9dbe44ca5cc37dbc8d20b03a35fdcbe3b88b06beb10f34691963fe61c66e","observation_id":"970cdce0-79e0-4a2f-a309-b764aa4db3f2","resolution":{"observed_at":"2026-07-04T10:29:44.576283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-08-16T14:07:39.359261Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":"2403.14468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-07-04T10:29:44.541818Z","title":"arXiv preprint arXiv:2403.14468 , year=","venue":null,"work_id":"91372074-cd42-4426-bf90-2d27dee1a1c9","year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:e29055fe5b1d22e71f40717146597053dfaebf90063e61c75381366a84eff6fb","observation_id":"e60b96ff-866e-42f0-916a-f4d686669f78","resolution":{"observed_at":"2026-07-04T10:29:44.543311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-14T01:48:52.921086Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":"2506.15742","doi":"10.48550/arxiv.2506.15742","metadata_source":"pith","pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","venue":"cs.GR","work_id":"5dfe19d5-3541-4803-8fe9-3c8b9e29b281","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:4defe6f18b0e4428d79f11cfa04a0298ef9fe816c5460ab9be9e643e5d07069b","observation_id":"7b3a8a59-ee5f-4978-a0db-42ba31de23fc","resolution":{"observed_at":"2026-07-04T10:29:44.559581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.03329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:29:44.566556Z","title":"Flux-text: A simple and advanced diffusion transformer baseline for scene text editing.arXiv preprint arXiv:2505.03329","venue":null,"work_id":"1bf6b24b-cdb9-4b2d-b872-9613d9085131","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:75162b17a54b3e9a969480f21047ef03f85adfed77d3fb21341f1915fadf5e58","observation_id":"0e6450ec-c234-46db-8d4e-270342e6a960","resolution":{"observed_at":"2026-07-04T10:29:44.568287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-08-14T12:22:57.900954Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"cited_work":{"arxiv_id":"2601.04720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.04720","snapshot_observed_at":"2026-07-08T20:35:34.399203Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","venue":"cs.CL","work_id":"eb6d74de-e0e8-47b8-ac29-ca460a55fac5","year":2026},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2601.04720","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:56f715c547843ef8a8fc58e900ac8299f8da69369a1f64640da6e26cd1e7cc62","observation_id":"a8b7dad8-42ba-41a3-be69-491d225708ec","resolution":{"observed_at":"2026-07-04T10:29:44.573737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Vidtome: Video token merging for zero-shot video editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:b6fa16c27649ac483c829fbf7b6c0878f986a2eb82b4064d467642a59b56947f","observation_id":"162c3efd-3b47-4d16-96c2-bc468a422520","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14648","doi":"10.48550/arxiv.2510.14648","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.14648 , year=","venue":"arXiv (Cornell University)","work_id":"bb8da1ea-a54e-48c3-b9b4-789e33744d25","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:543d611c488764aa6c40e931055dd5181273e64a2ddb47a9641e11d2c70c40fe","observation_id":"4075c8c0-c139-4129-abc9-ffa784b4d233","resolution":{"observed_at":"2026-07-04T10:29:44.537726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:16.980653+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:16.980653+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":"2412.00131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-07-08T14:44:59.776032Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","venue":"cs.CV","work_id":"51c0ab25-66f7-4d1a-a028-86b9b1b9e313","year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:e66cd7d4be7b5ee2ebb6e4a50b0920fcad01063fe8035033adffc71b4a051564","observation_id":"fd2dd144-f5ed-48d7-bd30-c705d67c59cc","resolution":{"observed_at":"2026-07-04T10:29:44.579365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02175","last_updated":"2026-05-13T06:57:11Z","snapshot_observed_at":"2026-08-16T18:35:03.103072Z","submitted_at":"2026-03-02T18:46:28Z","title":"Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance","version":4},"cited_work":{"arxiv_id":"2603.02175","doi":"10.48550/arxiv.2603.02175","metadata_source":"pith","pith_arxiv_id":"2603.02175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance","venue":"cs.CV","work_id":"d0b46f0f-22ff-43a5-b80b-84efbd9e448d","year":2026},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2603.02175","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:c818e2ce5123f9ad37dbd91cf9dda85b8ba7b392b1bf449322858f28a8a4aa85","observation_id":"e343b75a-e0c2-49da-a78a-8ea2aaf92f89","resolution":{"observed_at":"2026-07-04T10:29:44.551320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:4d82176c2b283cec29b4b60376007f39b1673554add1737f548fb856d8276ed8","observation_id":"5cb9e119-0ec8-44d8-9d43-50f9c9741cda","resolution":{"observed_at":"2026-07-04T10:29:44.544793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19761","last_updated":"2024-12-27T17:42:29Z","snapshot_observed_at":"2026-08-16T04:41:57.606082Z","submitted_at":"2024-12-27T17:42:29Z","title":"Generative Video Propagation","version":1},"cited_work":{"arxiv_id":"2412.19761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19761","snapshot_observed_at":"2026-07-04T10:29:44.515344Z","title":"Generative video propagation","venue":null,"work_id":"55c866be-f05c-4cfa-ab2f-d0c2933f1971","year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2412.19761","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:97b3ba9b9f107e0dc2bf09f784285dc87472aaa3a6f74c4c5b550f8abf802c68","observation_id":"73f69ce3-4f74-4156-976c-604ca9272cee","resolution":{"observed_at":"2026-07-04T10:29:44.517233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Glyph-byt5: A customized text encoder for accurate visual text rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:d5830ecc8ff2910bf503592c248d68173c7d6aa95225a6784cfc67e7758f595f","observation_id":"1594abdc-5ce4-4deb-be71-76803918dd70","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17870","last_updated":"2023-05-23T04:07:00Z","snapshot_observed_at":"2026-08-16T15:43:51.372858Z","submitted_at":"2023-03-31T08:06:33Z","title":"GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2303.17870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17870","snapshot_observed_at":"2026-07-04T19:30:07.398512Z","title":"Glyphdraw: Seamlessly rendering text with intricate spatial structures in text-to-image generation","venue":null,"work_id":"25a92acb-7f31-40c0-85d4-cb2c16bfce7e","year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2303.17870","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:015bd09c52c9ce0edf5177a212c393969e89e7de117315f24d5f3482c72ff945","observation_id":"0849a903-e6b9-4a6e-97c2-802de07a1f7f","resolution":{"observed_at":"2026-07-04T10:29:44.565365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08321","last_updated":"2026-05-11T07:31:16Z","snapshot_observed_at":"2026-08-04T10:28:10.753378Z","submitted_at":"2026-01-13T08:18:49Z","title":"UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing","version":3},"cited_work":{"arxiv_id":"2601.08321","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.08321","snapshot_observed_at":"2026-07-04T10:29:44.551720Z","title":"UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing","venue":"cs.CV","work_id":"ebabeec4-a0a0-451d-b79a-f968e45a55cc","year":2026},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2601.08321","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:ac71ce276ceb123675e2d8a8f1aea0def9a27b71cfaa9b9a13b5935587227b9a","observation_id":"1ae076a6-6e3e-450f-b706-8be6613d2342","resolution":{"observed_at":"2026-07-04T10:29:44.552995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:ddde3d1b329b2a5403cc5fcf6bcc9b45cdfe8676c3604c5b1b1eb9ee20bc5da6","observation_id":"a22746e4-c98e-4943-bd37-6bc5e83c4dd0","resolution":{"observed_at":"2026-07-04T10:29:44.562508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Codef: Content deformation fields for temporally consistent video processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:fa9673e50da3b6ef62d60fe993a430db95484034e97198fc2dbb48bcaf693f6b","observation_id":"fd7a2065-072e-4816-9843-95b573d6226c","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16537","last_updated":"2024-05-26T11:47:40Z","snapshot_observed_at":"2026-08-16T13:49:20.346356Z","submitted_at":"2024-05-26T11:47:40Z","title":"I2VEdit: First-Frame-Guided Video Editing via Image-to-Video Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.16537","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16537","snapshot_observed_at":"2026-07-04T10:29:44.563420Z","title":"I2VEdit: First-Frame-Guided Video Editing via Image-to-Video Diffusion Models","venue":null,"work_id":"2076a396-55d2-4dd3-9a62-35f18e08f6de","year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2405.16537","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:4ca1ba23769101bc713177edfc8158afb24e0f90ca05a51a1865d9c6774f128a","observation_id":"b022a04b-53e8-4314-88b8-90b5af90a866","resolution":{"observed_at":"2026-07-04T10:29:44.564974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:909410bd65e8731a4200852173d034b0c4806433a8374dc4d9544641b5523709","observation_id":"131c6acd-c94f-48d5-9604-c33d349abd47","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Fatezero: Fusing attentions for zero-shot text-based video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:3f2aa412ad55615b688831d96e0d74b4506fe5620ab46206ae6eadc2b76041b7","observation_id":"6c217845-113e-4cb8-9587-02cd7f631cef","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:fcbe8427f916e854a192c7a6cabddc9ca0a5ceefb732e379d95aa71b3e52512c","observation_id":"039162f6-3535-407c-8bcc-656a6148cd0e","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:629946a487f38d9b782f9f5d94c48e1882badce1e783fcd73635326317a803a0","observation_id":"3fee72c8-64aa-44de-ac2f-4b3dc5c6edac","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-16T18:58:56.056540Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:6c960bb2d58e7cc1dc336f4f1684108c17914551cd33e3e0e3ea092ee58afe56","observation_id":"1a4526fa-525f-4115-94b2-ca259bb71f8b","resolution":{"observed_at":"2026-07-04T10:29:44.587961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:29:44.571533Z","title":"Stellar: Scene text editor for low-resource languages and real-world data.arXiv preprint arXiv:2511.09977, 2025","venue":null,"work_id":"1f4018ce-99d8-41c5-b523-a5a594b32959","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:88ec0265047943ec050d1554fdee8dd550d8ca9d7286b636990a9fda93d17b92","observation_id":"4f39e394-0a6d-4586-881d-283783523626","resolution":{"observed_at":"2026-07-04T10:29:44.573176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Fonts: Text rendering with typography and style controls","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:046ca536158e3ded2d704bcb59d455fa5ff90c238346f1007a86de81df4f0c9d","observation_id":"2e0780c9-28ef-4057-8ba1-7b10bf1bd489","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:598322fabb8a54cf957322fca811c3d281bddc345204bd873c1ae290b6d866b4","observation_id":"46f3b731-7b71-4bdc-ae8c-38b3072f35ca","resolution":{"observed_at":"2026-07-04T10:29:44.511476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04877","last_updated":"2025-07-07T11:04:03Z","snapshot_observed_at":"2026-08-17T04:46:16.207753Z","submitted_at":"2025-07-07T11:04:03Z","title":"DoPI: Doctor-like Proactive Interrogation LLM for Traditional Chinese Medicine","version":1},"cited_work":{"arxiv_id":"2507.04877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04877","snapshot_observed_at":"2026-07-04T10:29:44.540672Z","title":"Dopi: Doctor-like proactive interrogation llm for traditional chinese medicine.arXiv preprint arXiv:2507.04877, 2025","venue":null,"work_id":"16473cf0-c632-48a6-83c4-5a1b789dd4b6","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2507.04877","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:839d0718467d4c05220697e8f79f54c0ebf1bf4d99f1ebf8043c409d5865be57","observation_id":"849f1ebf-63aa-41a4-8f95-888c08d12ac4","resolution":{"observed_at":"2026-07-04T10:29:44.542349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.06119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:29:44.547305Z","title":"Omni-video: Democra- tizing unified video understanding and generation","venue":null,"work_id":"ff3fdc36-7023-4bae-ae8b-c28ff8524967","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:bf9150bf1ce4e47f01c4f760891d12aace68033c33bf6f10ca04f779d3e14ba5","observation_id":"6284fcb0-9c0c-422d-8eb8-26dfa3c47c5c","resolution":{"observed_at":"2026-07-04T10:29:44.548965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03054","last_updated":"2024-02-21T07:12:45Z","snapshot_observed_at":"2026-08-16T14:45:42.266486Z","submitted_at":"2023-11-06T12:10:43Z","title":"AnyText: Multilingual Visual Text Generation And Editing","version":5},"cited_work":{"arxiv_id":"2311.03054","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03054","snapshot_observed_at":"2026-07-04T10:29:44.518677Z","title":"Anytext: Multilingual visual text generation and editing","venue":null,"work_id":"6ca52f26-db50-422e-86c6-89c334703122","year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2311.03054","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:9353c95149c643c5c23884cf82532f4480a62e577b67ef2d944898f0d9f68ddf","observation_id":"4cee4815-1fb5-4fb6-b3de-2dc13e548267","resolution":{"observed_at":"2026-07-04T10:29:44.520381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15245","last_updated":"2024-11-22T03:31:56Z","snapshot_observed_at":"2026-08-16T12:17:12.898082Z","submitted_at":"2024-11-22T03:31:56Z","title":"AnyText2: Visual Text Generation and Editing With Customizable Attributes","version":1},"cited_work":{"arxiv_id":"2411.15245","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15245","snapshot_observed_at":"2026-07-04T10:29:44.557918Z","title":"Anytext2: Visual text gen- eration and editing with customizable attributes.arXiv preprint arXiv:2411.15245","venue":null,"work_id":"796c89a1-8a12-4d44-83b0-575d5758f657","year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2411.15245","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:7ec26142fa1a45cc9a30a23798834a69ddcce37286b6e845d86fba019d19f6c3","observation_id":"1ab31c13-c9fa-461f-9c30-e80c086922b3","resolution":{"observed_at":"2026-07-04T10:29:44.559435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:d2b650fc7b14bf8607c115d082e015033f45ac02ed76a6765d602a25c0e2ddc9","observation_id":"38f2a444-445c-4b0b-96c6-7d8f2e29de11","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:ce87e21f43c9d0c93ff986f7dd7556a871fae1824fd1a5368a00c65a5ad447e7","observation_id":"4d5063b6-a8da-498c-9713-a811437e9612","resolution":{"observed_at":"2026-07-04T10:29:44.536395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE transactions on image processing, 13(4):600–612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:102b658682b7232df131787e2b8ba9cd7124ff63ce4dd45e11b96444138d309c","observation_id":"34ca7572-60dd-4cad-93dc-509e429f7a61","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-16T07:03:34.310504Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:d92291982e4ba2c759a4cc2f1a7d2d92cb96f42b9e10ae021ebb048609ae07f6","observation_id":"6a1d2a9e-063f-4382-b861-e68e9b452ec6","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:1a7b1617114d6869ddf6aadd322ffa572060d68ff9f98c600481c79623c1556f","observation_id":"e57e41c7-7de8-4d33-8edc-026a552eeb0c","resolution":{"observed_at":"2026-07-04T10:29:44.585396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:5179ea4476aac89387f2ab0b20644d0b0eee6f13f60122b4605ddbc2185ad223","observation_id":"8c156b7a-7c66-4bc6-86a2-d349d631273b","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04888","last_updated":"2021-12-09T13:21:26Z","snapshot_observed_at":"2026-08-16T17:35:54.753670Z","submitted_at":"2021-12-09T13:21:26Z","title":"A Bilingual, OpenWorld Video Text Dataset and End-to-end Video Text Spotter with Transformer","version":1},"cited_work":{"arxiv_id":"2112.04888","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.04888","snapshot_observed_at":"2026-07-04T10:29:44.533299Z","title":"A bilingual, openworld video text dataset and end-to-end video text spotter with transformer.arXiv preprint arXiv:2112.04888, 2021","venue":null,"work_id":"250adf30-ec1b-457a-ae7c-bb5883a3c78f","year":2021},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2112.04888","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:9699f411d79539d4d14b3d1424163dfb7889972220c0a7727d81bc23ca769047","observation_id":"c3ac5148-4af1-40b7-9969-ed7c7e6b0484","resolution":{"observed_at":"2026-07-04T10:29:44.535026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:58ad2fa29ea83887404ef05d2f7e6574d5049504032ceed3f46e9787b7396c43","observation_id":"b4ff0b57-e9ac-4aac-8189-fd97169f3b9d","resolution":{"observed_at":"2026-07-04T10:29:44.556552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Textctrl: Diffusion-based scene text editing with prior guidance control.Advances in Neural Information Processing Systems, 37:138569–138594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:1b9f5e62edfe38e426217d816dc44962fd1a1653202767d7e49e328bc5dcad0f","observation_id":"f3df1a79-2162-49c6-b5d4-cee49bec0530","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:d410254e0840ea53981153e7baa59f43d3d1023771ec9ad7523b524d7a533d45","observation_id":"9f357f31-8b22-4086-aa85-ed00d312a9c2","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11568","last_updated":"2024-06-05T07:05:15Z","snapshot_observed_at":"2026-08-16T14:08:54.316361Z","submitted_at":"2024-03-18T08:42:08Z","title":"EffiVED:Efficient Video Editing via Text-instruction Diffusion Models","version":2},"cited_work":{"arxiv_id":"2403.11568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11568","snapshot_observed_at":"2026-07-04T10:29:44.568911Z","title":"Effived: Efficient video editing via text-instruction diffusion models","venue":null,"work_id":"53a50404-b2c7-404d-b3d5-7df6edbfa701","year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2403.11568","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:f7d5bc5e919bc0f110b6205de3287aebec7c2739d97be98e8d2da67150188cac","observation_id":"cdd7e922-f6c2-4ff2-a9e4-da55d3f08ec6","resolution":{"observed_at":"2026-07-04T10:29:44.570350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Utdesign: A unified framework for stylized text editing and generation in graphic design images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:905467c54fd8fd0c33beab003fd3da16e251e49f5c9b61106b6dfc4bb786cfa4","observation_id":"ffe46721-f12e-41a3-9d14-18c55bbd7460","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:52:23.330736Z","title":"Describe in detail the typography, color, style, text material, and rendering effects of the text regions {source text} in this image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:33373866b464a3cec073e8993da07092a820c84f6df5c0c8725021347b4a34c3","observation_id":"bc22fe16-ddbd-48d5-ba36-3cdbac3751a8","resolution":{"observed_at":"2026-06-26T08:52:23.330736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":36,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2606.23254."}