{"as_of":"2026-08-15T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b755f06bc218d0610266975a683ab9b3c34869c31b5252f7b322c7afcbf1874","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:29:59.155701Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:59:07.294813Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:19:57.945426Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"cited_work":{"arxiv_id":"2411.16199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16199","snapshot_observed_at":"2026-07-04T16:19:57.945426Z","title":"Vires: Video instance repainting with sketch and text guidance","venue":null,"work_id":"eaff7d3a-1bb8-46d6-a1de-664b00fd3e80","year":2024},"citing_paper":{"arxiv_id":"2512.23709","last_updated":"2026-04-04T08:31:26Z","snapshot_observed_at":"2026-08-15T11:47:43.314086Z","submitted_at":"2025-12-29T18:59:57Z","title":"Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-16T19:14:15.240218Z"},"links":{"cited_paper":"/paper/2411.16199","citing_paper":"/paper/2512.23709"},"observation_digest":"sha256:52f84ef884a478c0fd824a348fe8f976ea7bb489e51025ccffa9822d9bc369a3","observation_id":"89ee7eed-8e20-4c77-99e1-711171968f18","resolution":{"observed_at":"2026-05-16T19:18:19.535839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"cited_work":{"arxiv_id":"2411.16199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16199","snapshot_observed_at":"2026-07-04T16:19:57.945426Z","title":"Vires: Video instance repainting with sketch and text guidance","venue":null,"work_id":"eaff7d3a-1bb8-46d6-a1de-664b00fd3e80","year":2024},"citing_paper":{"arxiv_id":"2606.24336","last_updated":"2026-06-30T03:40:24Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T09:21:36Z","title":"TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T00:45:05.681548Z"},"links":{"cited_paper":"/paper/2411.16199","citing_paper":"/paper/2606.24336"},"observation_digest":"sha256:76943b6c7145f3baee32065f02055c2e2b99525c29c44b9f9b3a0b0bd4494e04","observation_id":"69d6b6b6-a0a4-4dd1-8ca9-7aa53a39df81","resolution":{"observed_at":"2026-07-04T16:19:57.947045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"cited_work":{"arxiv_id":"2411.16199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16199","snapshot_observed_at":"2026-07-04T16:19:57.945426Z","title":"Vires: Video instance repainting with sketch and text guidance","venue":null,"work_id":"eaff7d3a-1bb8-46d6-a1de-664b00fd3e80","year":2024},"citing_paper":{"arxiv_id":"2606.24336","last_updated":"2026-06-30T03:40:24Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T09:21:36Z","title":"TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T06:59:07.294813Z"},"links":{"cited_paper":"/paper/2411.16199","citing_paper":"/paper/2606.24336"},"observation_digest":"sha256:c3793e992752f84aa5bd880372d4caf50cba2309d5ccaf1cba3a91eab76902ab","observation_id":"b6e8d568-da58-418c-bb76-ff9bc6ee697c","resolution":{"observed_at":"2026-07-01T08:55:35.630129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.16199/citation-record","integrity":"/paper/2411.16199/integrity","json":"/paper/2411.16199/citation-record.json","paper":"/paper/2411.16199"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:58.911510Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.911510Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:f4cfc21c48223f16cad0987b8d5d6527f2a144d3f2ac799dba62ee78d9e789d5","observation_id":"a209f8c4-9825-4c3b-83d0-72712a917939","resolution":{"observed_at":"2026-08-12T13:29:58.911510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.896455Z","title":"Is space-time attention all you need for video understanding? In ICML, 2021","venue":null,"work_id":"0e6e1db9-3dad-4bbc-806d-030f92da2af6","year":2021},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.917101Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:fb5e54bf7c44bf352cf5e93bfc91a612b26be2b633a22b0ab32129b6fb850fb8","observation_id":"ae78e377-e94c-434c-beb5-daf85b20551d","resolution":{"observed_at":"2026-08-12T13:29:59.901470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:58.922100Z","title":"Sigmoid- weighted linear units for neural network function approxi- mation in reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.922100Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:1f6bfee75853068894fa366a4885a4532484335a0f4b4afda6642027feff1d38","observation_id":"0b09ca38-e901-43f5-b616-2b975ff4c6a7","resolution":{"observed_at":"2026-08-12T13:29:58.922100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.870042Z","title":"Digital image process- ing","venue":null,"work_id":"9e737bd8-fac5-448f-ac04-ef90eb3a6228","year":1987},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.927030Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:a402551d68bc1039182164b413bedd7025a367e879ef2e6e7683bab30e90f16f","observation_id":"494e5c2e-5ede-4ef7-a7e3-637a837b1294","resolution":{"observed_at":"2026-08-12T13:29:59.874984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-12T13:29:58.932800Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.932800Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:176c0dc2b9e51fd326df9e784d1ad6219bc80c914477dfa811bcc0b5fb609f1b","observation_id":"9f3a6616-4f9c-4b07-8000-43dc8dc4df83","resolution":{"observed_at":"2026-08-12T13:29:58.932800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:58.938005Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.938005Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:5c31d2bc5ab9df3c89890074fc75bb4779c1cb50b4da65bee797ddb128133401","observation_id":"0a40730e-ceae-43eb-a96e-c451c510611e","resolution":{"observed_at":"2026-08-12T13:29:58.938005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:58.942819Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.942819Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:003b54418091c0f69adf047f6e905ed015b4f0a06a3266777501c023af7eab3f","observation_id":"178c04bb-a860-43a0-a855-f36f4677cf5f","resolution":{"observed_at":"2026-08-12T13:29:58.942819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.835591Z","title":"L-DiffER: Single image reflection removal with language-based diffusion model","venue":null,"work_id":"5b3506d6-e4b6-48f2-8f7d-1cc841e88635","year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.947860Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:5629a5b136cc789a88e1cb3a27e8e92e0be912318ace7bc1992fa6e241a3d750","observation_id":"6d075ec8-f105-43ac-ba66-a3146a61a6fc","resolution":{"observed_at":"2026-08-12T13:29:59.840348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:58.952504Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.952504Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:ff88a86e65493fddca8a072f42a1b442188f9ecf2f5c3ece94a2d9a2cd44a0c1","observation_id":"a798eb74-3632-4963-b910-3a685e1f6701","resolution":{"observed_at":"2026-08-12T13:29:58.952504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.810650Z","title":"VBench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"d81eea99-1b03-420c-985f-c486ce9f39fb","year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.957529Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:7aae383171ae54a990ce26dda2a617de4b1472c6a8a607ffb04dd238bdb457c8","observation_id":"57f24a54-5572-40a2-a64d-0bce29ecc929","resolution":{"observed_at":"2026-08-12T13:29:59.815586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:58.962036Z","title":"Scope of va- lidity of psnr in image/video quality assessment","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.962036Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:0f78c58ec573e48ac934bb1a19a1a56f6626f6a2684aa4c993892d0f2f040259","observation_id":"635f8577-bc7d-4001-a36b-84588ba375d9","resolution":{"observed_at":"2026-08-12T13:29:58.962036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.785819Z","title":"Perceptual losses for real-time style transfer and super-resolution","venue":null,"work_id":"03efa28d-ddfb-484b-abbc-a78f51528c8b","year":2016},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.966629Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:10507b6c7972b9976336434aad10a4a1b503ba281d726ab9eb114dba9c92b162","observation_id":"d8f5a263-d1fe-40c8-8fa7-71be048b3da6","resolution":{"observed_at":"2026-08-12T13:29:59.790511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.771279Z","title":"RA VE: Randomized noise shuf- fling for fast and consistent video editing with diffusion mod- els","venue":null,"work_id":"2f950a43-2def-47eb-b307-c394cfab88b4","year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.971285Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:f52fbbd9a4525a3e6747e27f5e660e3f4c798fe344c53553f2c83993a09a7e15","observation_id":"c704d836-70c9-4185-9e13-850e183a5a87","resolution":{"observed_at":"2026-08-12T13:29:59.775947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.756700Z","title":"Text2Video-Zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"51d44c80-41d0-4775-b2de-cafe97adf76d","year":2023},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.975867Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:33c68d86bcc6f61a1ee11a582c308292d23f10712b1c74e7438d4e1bab0778c7","observation_id":"00619ca1-e25f-46fb-8e76-8afc95c88526","resolution":{"observed_at":"2026-08-12T13:29:59.761493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T13:29:58.980712Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.980712Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:30db03acceb78c7d6c997dd19c58c81207a13516c76ddb722420267512e286d9","observation_id":"f1fffb00-f884-4a86-8157-45787a27e660","resolution":{"observed_at":"2026-08-12T13:29:58.980712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.741539Z","title":"On information and sufficiency","venue":null,"work_id":"49e16ca4-fe7a-462e-a046-c445299d4b30","year":1951},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.985587Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:b27a294dcec1b3bf8d3619933bc662b5acbb35de176cfc64172400a013a99153","observation_id":"2d485f0c-3a39-4f67-bd6f-61225de5ed1c","resolution":{"observed_at":"2026-08-12T13:29:59.746579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:58.990083Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.990083Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:2cf7c16c483bb918ce813ec555adad64a6d97b073ea9b583a60a71dc84f16b39","observation_id":"3a21e06c-be5a-4c50-8d48-94813532d102","resolution":{"observed_at":"2026-08-12T13:29:58.990083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.716331Z","title":"VidToMe: Video token merging for zero-shot video editing","venue":null,"work_id":"d673169a-b208-468f-8bc8-3485307bb8a2","year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.994700Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:c71fb84464ac916862162a1c490d3af9a4ece5cd0f1efb0d72aa661efe4528a8","observation_id":"6644b61f-a134-472a-950f-518710e9d908","resolution":{"observed_at":"2026-08-12T13:29:59.721303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.699275Z","title":"Flow matching for generative modeling","venue":null,"work_id":"7cb561f5-7ac8-4224-acdf-d5a58b57eda7","year":2023},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:58.999531Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:44333aa1b2ee64b62db8d840bf5ab5c4b1ae76e4d2824b58ac24f4b0dc44e7fe","observation_id":"091f2d57-f861-458b-acb3-9c80d247feaf","resolution":{"observed_at":"2026-08-12T13:29:59.703888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-12T13:29:59.004337Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.004337Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:03da5beb23f1c8c074558628a973edce57ffe11c1850e13524002239ea8da6bd","observation_id":"58b5fe4d-2941-47bc-9312-bc31b852f894","resolution":{"observed_at":"2026-08-12T13:29:59.004337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.684107Z","title":"SDEdit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":"225c1ffa-6ef2-476c-86f8-e65bf9c4ec39","year":2021},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.009489Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:c7330c29641f7b375efeb4431c4debbbf95dca38fae3f546a719f3367f991ae7","observation_id":"11e09c46-724f-440d-b156-f34f4c23f5eb","resolution":{"observed_at":"2026-08-12T13:29:59.688935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.668760Z","title":"T2I-Adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"b507689f-c953-4baf-b918-91f93df93643","year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.014192Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:56c068027ac6f99d0b87c0773f84b0fe18008016e53a88cf4d0d51f9435e0bae","observation_id":"931ab61b-b006-49eb-a666-b476004b2bde","resolution":{"observed_at":"2026-08-12T13:29:59.673805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.018700Z","title":"Semantic image synthesis with spatially-adaptive nor- malization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.018700Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:856053720839158127db4108a7af6fcb6fe0e574bdbfe7121b41d7ee1207d6b2","observation_id":"87700ab4-1209-4499-8bd7-93eec6ac1b1c","resolution":{"observed_at":"2026-08-12T13:29:59.018700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.643453Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":"95f26607-67bb-4939-88c7-8344c6aefbf2","year":2023},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.023360Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:65b7cbb1e4ae12ebb879936c4c9bf061de5a51384ad9ea8ae5ac49e185f086ab","observation_id":"ccf6aea1-26c5-4d33-81cc-7e93da5d976d","resolution":{"observed_at":"2026-08-12T13:29:59.648477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.627341Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"e09e6463-818b-4860-9c05-a30c9496c76a","year":2016},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.027762Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:d3f06815df06e3fc198dcb23e5a3412597c66e07b66ec57e8bae798533216cab","observation_id":"e653f0fd-d31f-4a94-9769-1cef8a0f4c3f","resolution":{"observed_at":"2026-08-12T13:29:59.632660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.611660Z","title":"FiLM: Visual reasoning with a general conditioning layer","venue":null,"work_id":"3e66da21-3c03-4264-adf1-f31aacd9d92e","year":2018},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.032279Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:bdf10c9957f239feff27d4b741cc940b2e9b2557faae904237997271db18ab8d","observation_id":"be0fbd8b-5578-40b0-9ed8-722974215a48","resolution":{"observed_at":"2026-08-12T13:29:59.616839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.036622Z","title":"FateZero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.036622Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:53965eabd7a8cd59566d7f7124316036ffbc7b2876fd82fd8b1e5436a47b1f07","observation_id":"b333c489-7d86-426a-b3cb-fa842f4e198d","resolution":{"observed_at":"2026-08-12T13:29:59.036622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.041135Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.041135Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:cf4f9ebd407c1f1c1f75b5ac85dfbbb15150505657cbb2613534684d5e845326","observation_id":"325970f3-43b1-40a3-8f34-7724cbb41e0c","resolution":{"observed_at":"2026-08-12T13:29:59.041135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.576047Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"46c778b6-d62d-4b6a-a1e2-125780e6ed98","year":2020},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.045614Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:3c7a6db2b7f7dd3a08d844a79c4abfd29f3a22dac92a04927155b25d3a49862a","observation_id":"2a382dc7-8e64-4e0c-9571-b6e4df2c5040","resolution":{"observed_at":"2026-08-12T13:29:59.581070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-12T13:29:59.050115Z","title":"SAM 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.050115Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:6106f33698583ce129dddae395b80c0e5fbac65edd4495c3818f641fa7118224","observation_id":"62824420-8e27-427f-bc88-8b91bd15877e","resolution":{"observed_at":"2026-08-12T13:29:59.050115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.559743Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"f24c3117-36ad-4605-bcf2-1fd979b12ac5","year":2022},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.055011Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:711d3254c9a7de51927130be8085364511c3b8d4ddcace8f9f4066639086bd44","observation_id":"4827f5de-3482-4538-8343-de52729a7769","resolution":{"observed_at":"2026-08-12T13:29:59.565128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.059206Z","title":"DreamBooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.059206Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:342f151ff815684a23cee49435878ee1d59501f1a7d96cb95ef6f099e0ef4b68","observation_id":"fe9b9e2e-e552-40db-a10b-5f5926499019","resolution":{"observed_at":"2026-08-12T13:29:59.059206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.063533Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.063533Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:bd59f02b2241d3a66a00ed60233be1c14daa80cad60bf4951739def213991a73","observation_id":"a3c21f0d-9d76-4932-be10-eea45f7ad3a1","resolution":{"observed_at":"2026-08-12T13:29:59.063533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.068278Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.068278Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:d46e59b24de9d4b51bad449b199c41be01fa289245e12df9bb34ccaef9a5be4d","observation_id":"5aeff902-3a33-48ba-8bca-4dd231792ed2","resolution":{"observed_at":"2026-08-12T13:29:59.068278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.512584Z","title":"Interpretable 3D human action analysis with temporal convolutional networks","venue":null,"work_id":"0129565b-8aa4-4468-ba6b-17fcb3dadd78","year":2017},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.072649Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:8a89075972c377b03b4a1faf80fbd6f2e47fb9f4ed1013b578149bb259978a3c","observation_id":"132111fa-c026-4746-b7f2-850718a67ec1","resolution":{"observed_at":"2026-08-12T13:29:59.517401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-15T17:26:02.461614Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-12T13:29:59.077307Z","title":"Gen-L-Video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.077307Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:b3a6396b7420034378d66e4c02967a4f94d8f2ce4a845df5248b212ebb4e1037","observation_id":"73fdab96-0d2b-4e16-bc40-035b3de460fb","resolution":{"observed_at":"2026-08-12T13:29:59.077307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00741","last_updated":"2024-10-04T16:10:38Z","snapshot_observed_at":"2026-08-13T18:10:00.574821Z","submitted_at":"2024-10-01T14:33:22Z","title":"VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00741","snapshot_observed_at":"2026-08-12T13:29:59.081986Z","title":"VideoCLIP-XL: Advancing long descrip- tion understanding for video clip models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.081986Z"},"links":{"cited_paper":"/paper/2410.00741","citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:4ff1b62a667bfabbee9b92828fdc48c519decef166712b6ee68bb7ffaafcf99c","observation_id":"9cfa4a79-8cc5-4f7c-b69e-5a984caa60a7","resolution":{"observed_at":"2026-08-12T13:29:59.081986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.497390Z","title":"VideoComposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"892511b3-601a-48ad-bbe2-94986db34c10","year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.086883Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:2260757cfb6f145db6e66738d033c2a8e8e056f028efcae228d771f124f6dbba","observation_id":"911f6c40-cf1c-4343-9081-4b5b13c862f8","resolution":{"observed_at":"2026-08-12T13:29:59.502289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.482004Z","title":"SinSR: diffusion-based image super- resolution in a single step","venue":null,"work_id":"5a295c99-f3fc-48c2-a756-d8f11cb56a52","year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.091254Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:046c39640a0804355d77ac361780437a53a2978d23a4891e4b23c54888971fe3","observation_id":"7f0dedbd-07e4-40a2-9b74-5081dafae0b0","resolution":{"observed_at":"2026-08-12T13:29:59.486800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.466703Z","title":"Bovik, Hamid R","venue":null,"work_id":"5060a838-2ef7-4a89-af8b-64b5d3344dde","year":2004},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.095667Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:707665090bd9d23de656137317dc8c3b2bbf028f6e5b03b46f076f43a51d1cf2","observation_id":"3b1d200e-6315-4006-9434-682eea499c0f","resolution":{"observed_at":"2026-08-12T13:29:59.471575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.450933Z","title":"L-CAD: Language-based colorization with any-level descriptions using diffusion priors","venue":null,"work_id":"09778851-dcb3-4161-bba9-0585129470b0","year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.100484Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:584d28b8a7fe59d32eab52aae46e742b6a80a952845ed8e96189c4e98a1b564f","observation_id":"2a4bbe82-c3de-4761-9f2f-ed2a1c06299f","resolution":{"observed_at":"2026-08-12T13:29:59.455860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.104964Z","title":"Tune-A-Video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.104964Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:96e74c7b027e3eb206bd5858cfcbfd432bf609badf84cd46a2ea3057dc8bfcd7","observation_id":"f12d2e24-6d17-40a8-9d38-f924e18a5c21","resolution":{"observed_at":"2026-08-12T13:29:59.104964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.109283Z","title":"Group normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.109283Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:7de044bdbdd9edec01e6737979bd9fa1e05649b6fcf59591a498fc23dc942067","observation_id":"0d0c45e4-a981-4e89-a2c9-b6b1db1ebb58","resolution":{"observed_at":"2026-08-12T13:29:59.109283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.415876Z","title":"Holistically-nested edge de- tection","venue":null,"work_id":"de062528-7bc2-4e25-a610-b533e81ca76f","year":2015},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.114189Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:ca85b3a3db1372c97bb95e76c86c9373c2d99f0a9bbe24fcd38c2f8c7f2a0101","observation_id":"dde3be38-f9f9-48d9-b02e-69ab4951e81d","resolution":{"observed_at":"2026-08-12T13:29:59.421589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T13:29:59.118569Z","title":"PLLaV A: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.118569Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:b6ff6679fc4221388c7d2d3e79fb48012a92402aeed020735ab94e5ad964e534","observation_id":"174f776a-ec3d-489d-9cf7-b75536be5995","resolution":{"observed_at":"2026-08-12T13:29:59.118569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-12T13:29:59.123262Z","title":"Depth any- thing v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.123262Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:320d8ea5853783ed772e4fdacaaddf7ea88d41326b8bf92c590014e260c9ba2d","observation_id":"79054d7b-5931-4890-9dec-e93b9c8041d6","resolution":{"observed_at":"2026-08-12T13:29:59.123262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.400811Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"ad36d76e-3d00-444f-b261-966ccc2f76df","year":2023},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.127893Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:95187dd9a504c8db0a29bb007226e405415f260924db6cf1d5735acce6b8ede4","observation_id":"973855dc-9e1e-4b71-b74c-5252c7268817","resolution":{"observed_at":"2026-08-12T13:29:59.405529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-12T13:29:59.132657Z","title":"CogVideoX: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.132657Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:b3334380fd5e67b37203b5e9caf902c8ac575e8a350dab2b98e214ccec4845fb","observation_id":"14fa1c86-405a-4889-8316-3dd6d9fd47fe","resolution":{"observed_at":"2026-08-12T13:29:59.132657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.385260Z","title":"Language model beats diffusion-tokenizer is key to visual generation","venue":null,"work_id":"59aa6188-7b9f-4515-9799-259f5874e3e4","year":null},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.137522Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:3a8616d85d5efdbd5bbeedbc157160413d8f121b7285dd6eedaa600810ee2e66","observation_id":"f50df8fd-ff5a-4334-b82a-dc442d884ce8","resolution":{"observed_at":"2026-08-12T13:29:59.390205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.142094Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.142094Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:e424801a7655f4e27f2ca603fcc7703f3aa3816c269d24a1bb23cf9ba8ff28d0","observation_id":"dba27e5a-846e-4561-b875-75c7d901dc82","resolution":{"observed_at":"2026-08-12T13:29:59.142094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.359665Z","title":"ControlVideo: Training-free controllable text-to-video generation","venue":null,"work_id":"a74e0bdc-f32b-45aa-85fa-8d6931aec140","year":null},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.146524Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:833aabe8440f607bcd5b86822411ab0a2751cb14c197e1ab1be8884dcccbdcad","observation_id":"a55b4322-6ddc-4579-b65a-632d6573d69b","resolution":{"observed_at":"2026-08-12T13:29:59.364635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:29:59.342368Z","title":"Open-Sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"f8449e7d-58c7-40f9-8222-ca34cd0102dc","year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.151647Z"},"links":{"citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:c7f00657ff3e7ffd84e5049d137f05e0808776e34a76ea27492203cad58979d0","observation_id":"e0f3f341-0811-4925-9b1a-9a9e61bd6291","resolution":{"observed_at":"2026-08-12T13:29:59.349056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-08-12T22:19:09.109938Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-08-12T13:29:59.155701Z","title":"Al- legro: Open the black box of commercial-level video gen- eration model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.155701Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:ffdefff6e963083dcee24985fc0785201a9cca81a38ad090f70014f05589047e","observation_id":"5749ee67-3660-4968-aec5-4d747236948e","resolution":{"observed_at":"2026-08-12T13:29:59.155701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","latest_version":6,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T19:49:19.811314Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 3 inbound Pith citation observations for arXiv:2411.16199."}