{"as_of":"2026-08-12T08:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:294e2b579f9520815ce0504326306b270ccf41b436b8c8ad3769406b811d4424","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:01:25.565723Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:34:15.790154Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T06:35:29.356653Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"cited_work":{"arxiv_id":"2501.09499","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09499","snapshot_observed_at":"2026-07-01T06:35:29.356653Z","title":"arXiv preprint arXiv:2501.09499 , year=","venue":null,"work_id":"4f5ec41e-a033-41cc-aab5-9afdc15bacaa","year":null},"citing_paper":{"arxiv_id":"2606.31519","last_updated":"2026-06-30T11:32:14Z","snapshot_observed_at":"2026-08-03T23:10:23.282240Z","submitted_at":"2026-06-30T11:32:14Z","title":"RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-01T06:34:15.790154Z"},"links":{"cited_paper":"/paper/2501.09499","citing_paper":"/paper/2606.31519"},"observation_digest":"sha256:abebe43ae5d9dd4283ef655783db46aee0dddebfe3d34fcfb8efbc8ea14f24a7","observation_id":"333dd639-f753-46aa-af36-f6450e2484d2","resolution":{"observed_at":"2026-07-01T06:35:29.359106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.09499/citation-record","integrity":"/paper/2501.09499/integrity","json":"/paper/2501.09499/citation-record.json","paper":"/paper/2501.09499"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.362242Z","title":"https : / / huggingface","venue":null,"work_id":"78afe867-9304-470c-9786-0afbcb1989e7","year":2023},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.319906Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:ccc7f934bd99a60bb2485b6ea77e5306c09fd2e8e704b14070011940fb2f18d2","observation_id":"2cf6c9f1-e94c-4157-ad84-7f0866f58598","resolution":{"observed_at":"2026-08-10T20:01:26.367058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.349702Z","title":"Semantic-sparse coloriza- tion network for deep exemplar-based colorization","venue":null,"work_id":"e5885587-10d9-4cfe-accd-ccd005c6ad09","year":2022},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.324304Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:393c249253a7b15b707b1a5dda9f9568470eb3fca2cd302f1307714e0f56e635","observation_id":"0defbe13-5a0b-4049-bebd-8c47e167281e","resolution":{"observed_at":"2026-08-10T20:01:26.354170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T20:01:25.328376Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.328376Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:cd82d8c217c7c8662c71bb806f6ef54051f00d8c7b47bacad6d4313d0542f52f","observation_id":"35af48cc-26e8-4fee-abe5-f1c60cf775fe","resolution":{"observed_at":"2026-08-10T20:01:25.328376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.337938Z","title":"Versatile Vision Foundation Model for Image and Video Colorization","venue":null,"work_id":"4a125047-d6e2-4356-b0d6-8f2e095c5e9b","year":2024},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.333161Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:28ca8868d47f42c08264f08883c8664aaffab079abaf0612f207211026b82b0f","observation_id":"ef50c5d9-4a13-4ed4-8bb0-ebfc8487ff06","resolution":{"observed_at":"2026-08-10T20:01:26.342326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.326335Z","title":"L-CoIns: Language-based colorization with instance awareness","venue":null,"work_id":"bfc7fbb7-91bb-4619-b651-fa202bf86b0a","year":2023},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.337065Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:69156ddbabd2601458aa14982bad9675f48ee57c33dc13d59e87324c8a5f9859","observation_id":"e41be00a-72a6-4014-a8d0-6a6b6f506c40","resolution":{"observed_at":"2026-08-10T20:01:26.330446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.315023Z","title":"Deep colorization","venue":null,"work_id":"bcb3277f-859c-4353-8c06-7bce0636d27f","year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.341105Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:d574710389601ea76736a94739171848a934c8ec9aded268d326cdb3a011f9c3","observation_id":"cb042cab-4f17-4eee-81d6-1f72e4427904","resolution":{"observed_at":"2026-08-10T20:01:26.318969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.303117Z","title":"Automatic Controllable Colorization via Imagination","venue":null,"work_id":"902222a9-587f-4192-85fe-027dd5176d73","year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.345154Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:3fb78f7099d4443f2e1aa2a3d13fbae5bbaa91f549bcf0dd76eaf9a9a898106f","observation_id":"1e720e3b-7687-476f-82ec-35f808e7ee35","resolution":{"observed_at":"2026-08-10T20:01:26.307352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.289015Z","title":"Learn- ing large-scale automatic image colorization","venue":null,"work_id":"c97e7565-5760-486d-b515-030bfc2fdfae","year":2015},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.349063Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:3de6dc3c0d0d39efced3c1d2b97ec62fa41703ca6a100590edb1644d3a94b4a8","observation_id":"c29deb4b-d48e-4b96-af14-188eba18a429","resolution":{"observed_at":"2026-08-10T20:01:26.294037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.275034Z","title":"Learning diverse image colorization","venue":null,"work_id":"a0330151-52dc-4dc6-82ad-df45c5a1b501","year":2017},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.352987Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:5dc805d6cc4b05b407063af2a9a7fb632b747879c3e1e0ba3abf5f59aafc8c11","observation_id":"8911e4fc-1da8-4be8-890d-99ae3bbf452b","resolution":{"observed_at":"2026-08-10T20:01:26.279690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.261433Z","title":"A superpixel-based variational model for image colorization","venue":null,"work_id":"893873d2-2b38-47fe-9619-589610b0042f","year":2019},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.356740Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:16ade387b43682399bb1fb34b6097bca94d270189cfed8ad50ce06c5dcc366ed","observation_id":"bbeecf3a-4c02-4927-988f-ae2ea62b1705","resolution":{"observed_at":"2026-08-10T20:01:26.265713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.06576","last_updated":"2015-09-02T08:24:59Z","snapshot_observed_at":"2026-07-06T04:27:45.692332Z","submitted_at":"2015-08-26T17:14:42Z","title":"A Neural Algorithm of Artistic Style","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.06576","snapshot_observed_at":"2026-08-10T20:01:25.360322Z","title":"A neural algorithm of artistic style","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.360322Z"},"links":{"cited_paper":"/paper/1508.06576","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:c188dbc3326c111e62ddce8fd1acf72f320919e0d81f1f3d9350999022864a01","observation_id":"369c9030-57dd-4d76-93fe-dfcdd2eda53f","resolution":{"observed_at":"2026-08-10T20:01:25.360322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.248546Z","title":"Long video generation with time-agnostic vqgan and time- sensitive transformer","venue":null,"work_id":"f38cf6fc-e8cb-4e86-9a44-374923986f12","year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.364481Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:45a8080c84cc757973ded8490a2b6e2628c02b73c0e85a3931fca55dac23e27b","observation_id":"47427e31-075f-49fd-8aed-f88df2e8b1cc","resolution":{"observed_at":"2026-08-10T20:01:26.252578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.236779Z","title":"Measuring color- fulness in natural images","venue":null,"work_id":"85d11384-8424-4440-ac97-0a17f59f4aea","year":2003},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.368338Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:d8be06fc6de6762eeeb7eb5cd73b834b52f0e53c33f51af2879203d10ccc2a05","observation_id":"92159ea6-549c-4bd6-8b45-4bfa26f82aa3","resolution":{"observed_at":"2026-08-10T20:01:26.241362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T20:01:25.372325Z","title":"CLIPscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.372325Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:39f39c214ac9f8b6da271102f9fe577659fc746574ecc39333c61ed7e87cd6f8","observation_id":"f2ce9f71-bf9c-45eb-806e-117ed837ad2b","resolution":{"observed_at":"2026-08-10T20:01:25.372325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.223695Z","title":"Unicolor: A unified framework for multi-modal colorization with trans- former","venue":null,"work_id":"5d9c9f95-9e98-421a-a53e-34f92b3db7d9","year":2022},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.376480Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:4f157f5e3b2e23e2387830f4885340ae86422bb166dc9f221fcc7ef8a4c7cd83","observation_id":"7559ee70-5e3e-4a8c-affb-707247e5b3dc","resolution":{"observed_at":"2026-08-10T20:01:26.228621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.210514Z","title":"Deepremaster: tem- poral source-reference attention networks for comprehensive video enhancement","venue":null,"work_id":"077a4c08-5e9c-4f72-8a8e-ec7937a7271e","year":2019},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.380275Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:b014718a0767dc85cba597f9d256a441a073aa7a6bacfb864126d0894ed221ac","observation_id":"54c89dd9-0d91-4f4a-be86-d8802b8745db","resolution":{"observed_at":"2026-08-10T20:01:26.214775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.198631Z","title":"Colorformer: Image colorization via color memory assisted hybrid-attention transformer","venue":null,"work_id":"60537b31-10ab-49df-84b7-454506c0604f","year":2022},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.383941Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:5af5dbd990c091c8ff9e178cec15cd4c3fb2e3ac82f34342e0559c2a531c4d27","observation_id":"76630b9a-6b05-4d63-9e48-99a20d7b6894","resolution":{"observed_at":"2026-08-10T20:01:26.202687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.186927Z","title":"DDColor: Towards photo- realistic image colorization via dual decoders","venue":null,"work_id":"4863948e-dbff-46fd-9c47-944ae8350e01","year":2023},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.387649Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:681c9ec4457b5a6db31921eeb61ef98fc0d2618e9b1e35f7907ff317f91f7d50","observation_id":"fc6597ea-dcce-49c8-a37d-52a8ae97aca2","resolution":{"observed_at":"2026-08-10T20:01:26.190891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07635","last_updated":"2024-10-01T13:15:53Z","snapshot_observed_at":"2026-08-12T07:30:15.518631Z","submitted_at":"2023-07-14T21:13:04Z","title":"CoTracker: It is Better to Track Together","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07635","snapshot_observed_at":"2026-08-10T20:01:25.391228Z","title":"Co- tracker: It is better to track together","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.391228Z"},"links":{"cited_paper":"/paper/2307.07635","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:648d4c8473d97fd54733981ef932a22850b20f6cd6d5d2ceb3d151c64764ae3d","observation_id":"5c5223c8-8578-42ff-bac8-e377d3e45e38","resolution":{"observed_at":"2026-08-10T20:01:25.391228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.175775Z","title":"Neural preset for color style transfer","venue":null,"work_id":"abec5c1c-bc14-471f-a7f1-38ae14a4f7e4","year":2023},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.395266Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:9d9710cb5095b6d287fae65815719d245c5776ea81b97357cafa5cddfc18f9eb","observation_id":"53f4ef50-a638-480a-8f16-efdc4f9daf86","resolution":{"observed_at":"2026-08-10T20:01:26.179665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.163918Z","title":"Slic: Self-supervised learning with iterative clus- tering for human action videos","venue":null,"work_id":"c868bd32-016c-423e-a48a-1ef8b90fa2e2","year":2022},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.399115Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:e0a208b8cf53313f2ab9c9846c0277a3765a493a60eb4a6bf9f574f15dcfee63","observation_id":"f7aeaa9e-ecc1-4d36-8542-936274d4425a","resolution":{"observed_at":"2026-08-10T20:01:26.168146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-10T20:01:25.403000Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.403000Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:5015985a42be1f0f94b53d27b06930c1e8ad8c565c0073b03a25a608ca4f0fe7","observation_id":"a57226e8-7698-4397-822c-9fa0550c09d4","resolution":{"observed_at":"2026-08-10T20:01:25.403000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.152531Z","title":"Learning representations for automatic colorization","venue":null,"work_id":"fcdd642a-3201-4e3a-aeac-d639ddc5af49","year":2016},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.406792Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:4fbebb9dda8887dc3c740d6ccf717402439e9692aa2683f38de477a5527fde70","observation_id":"d4cb9daa-83b7-4e20-b2c2-4d735cb79bf0","resolution":{"observed_at":"2026-08-10T20:01:26.156797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.140789Z","title":"Fully automatic video colorization with self-regularization and diversity","venue":null,"work_id":"84cf16e3-b351-4cdc-8a3b-f6f5e0cd5034","year":2019},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.410571Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:e6a665d7f9edf5989ce0deeb9f785107e1ac2c9aff99db742c612ec1263740d2","observation_id":"c255e9e9-5f9d-4d46-b25b-0602a2b07f17","resolution":{"observed_at":"2026-08-10T20:01:26.144862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.129592Z","title":"Deep video prior for video consistency and propagation","venue":null,"work_id":"d2c59957-749b-451d-9241-765442a48738","year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.414237Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:2ad836a5172cf810091b4e954b95b12bbd373276f94503cc0dc9bd4aed081fd3","observation_id":"cd77d1e5-8fe3-4363-8db5-17e7495a1943","resolution":{"observed_at":"2026-08-10T20:01:26.133504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.118039Z","title":"Automatic example-based image colorization using location- aware cross-scale matching","venue":null,"work_id":"0a564feb-804d-4b48-9495-2371e1e463ba","year":2019},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.418209Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:48672e3b0cb0aa4730908a93efc5667fdeb294287a2ecc7bf7480c2414538bd2","observation_id":"61b6fc24-2450-48df-abb9-2877b5246150","resolution":{"observed_at":"2026-08-10T20:01:26.122301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.105521Z","title":"Towards Photorealistic Video Colorization via Gated Color- Guided Image Diffusion Models","venue":null,"work_id":"ae5392be-bc6a-4987-bcfc-ba68e0708a79","year":2024},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.422118Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:ff76cc401ff6a724ac911c9ff6dc90cab2c4d823039ccb17165f67be59c57d91","observation_id":"97d45809-bee5-461f-91d4-fbff11b68fc0","resolution":{"observed_at":"2026-08-10T20:01:26.110244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00398","last_updated":"2023-09-07T08:11:01Z","snapshot_observed_at":"2026-08-10T11:29:57.558641Z","submitted_at":"2023-09-01T11:14:43Z","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00398","snapshot_observed_at":"2026-08-10T20:01:25.425868Z","title":"Videogen: A reference-guided latent diffusion approach for high definition text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.425868Z"},"links":{"cited_paper":"/paper/2309.00398","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:77c72ac8f64982355937207a8ab84bced101b71dbe31d4e21d8df3cac6eb0deb","observation_id":"114490dc-56e7-4775-8248-8b2104fff21b","resolution":{"observed_at":"2026-08-10T20:01:25.425868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10855","last_updated":"2024-02-16T17:51:13Z","snapshot_observed_at":"2026-08-11T13:12:08.343254Z","submitted_at":"2024-02-16T17:51:13Z","title":"Control Color: Multimodal Diffusion-based Interactive Image Colorization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10855","snapshot_observed_at":"2026-08-10T20:01:25.430224Z","title":"Control Color: Multimodal Diffusion-based Interactive Image Colorization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.430224Z"},"links":{"cited_paper":"/paper/2402.10855","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:bb7415703064444c5dca21bab27f64dbf086381dd909e1495abdbe9f07396355","observation_id":"25c0c84d-69b8-453f-9071-5e9499f68d6e","resolution":{"observed_at":"2026-08-10T20:01:25.430224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01732","last_updated":"2023-06-02T17:58:00Z","snapshot_observed_at":"2026-08-10T03:02:45.631331Z","submitted_at":"2023-06-02T17:58:00Z","title":"Video Colorization with Pre-trained Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01732","snapshot_observed_at":"2026-08-10T20:01:25.434190Z","title":"Video colorization with pre-trained text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.434190Z"},"links":{"cited_paper":"/paper/2306.01732","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:da9cb202063fa05e7f8f21deb7010723f7b6173b17dd8e7c551f32f83e8a4428","observation_id":"3991614a-0534-48a2-854d-a06095f6f7e9","resolution":{"observed_at":"2026-08-10T20:01:25.434190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16124","last_updated":"2024-07-23T02:10:50Z","snapshot_observed_at":"2026-08-07T22:23:37.324306Z","submitted_at":"2024-07-23T02:10:50Z","title":"Fr\\'echet Video Motion Distance: A Metric for Evaluating Motion Consistency in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16124","snapshot_observed_at":"2026-08-10T20:01:25.438600Z","title":"Fr ´echet Video Motion Distance: A Metric for Evaluating Motion Consistency in Videos.arXiv preprint arXiv:2407.16124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.438600Z"},"links":{"cited_paper":"/paper/2407.16124","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:c79d85c55d191220b2fe3dbe69c0618ce86c4cd76e71c18015fee609bc313d47","observation_id":"737a304f-2cb7-441f-ba72-2f1e6b7eaccf","resolution":{"observed_at":"2026-08-10T20:01:25.438600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.092506Z","title":"Switch- able temporal propagation network","venue":null,"work_id":"8dcf3ced-38eb-4e6b-abe7-a4170c82c6ba","year":2018},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.442389Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:82709f262829e5bbf9cae8afc5e09b924acd85b3c32772434b52f953696be31b","observation_id":"1403326e-c205-4173-9225-e646984ce772","resolution":{"observed_at":"2026-08-10T20:01:26.096879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T20:01:25.446011Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.446011Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:4e47e5eb845221bc337a8e9a422e1693ae579ec701f546b64911eb33a9f5398d","observation_id":"d783abc3-2f47-40ce-b067-00e78b21c75f","resolution":{"observed_at":"2026-08-10T20:01:25.446011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.079969Z","title":"Unpaired cartoon image synthesis via gated cycle mapping","venue":null,"work_id":"ad611d07-8686-4155-a90b-d4f73e3629c4","year":2022},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.449520Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:4c82051a6ff736b123bca3c74243587e4fc1d0abfa1af51fbc4e30e32e4ff731","observation_id":"31337d8c-0c10-41b7-93fa-40a76ef6951b","resolution":{"observed_at":"2026-08-10T20:01:26.084046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-10T20:01:25.452931Z","title":"OpenVid-1M: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.452931Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:5794e08652fb498eca1f583f12d1908808d7884cb915a1f82c13a61554890e4b","observation_id":"f5d91190-eed0-4bdf-b4d4-6540428b7c6b","resolution":{"observed_at":"2026-08-10T20:01:25.452931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.068164Z","title":"Perazzi, J","venue":null,"work_id":"b2b116c1-f42c-4298-8f74-a8695db4d769","year":2016},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.457096Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:0fd50f17eb8999160bc4f8a9c5cb6f8b648fcab78336426fe49fb31ad3d2f5dd","observation_id":"0cbdf23f-8792-44e5-93de-166f76cd1c7a","resolution":{"observed_at":"2026-08-10T20:01:26.072099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.055702Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"c04f41e3-f364-4217-8470-8aff8ad05089","year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.460738Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:f6b8abe3dc8ec8fed268f144fc9f123cf6195aae2cf3eb61345883a9967334bb","observation_id":"d6c1de74-f70e-4371-9ed4-0928fd953e82","resolution":{"observed_at":"2026-08-10T20:01:26.059842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.042256Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"f457036a-812f-4845-ac5c-33ae0e341d67","year":2022},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.464952Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:85d6126129d35cb9a0db94c48004978d2e5db7912bf560ace6096029e594692e","observation_id":"55b54c06-5b82-429f-b0ec-989fd1db683b","resolution":{"observed_at":"2026-08-10T20:01:26.047020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.030005Z","title":"Instance- aware image colorization","venue":null,"work_id":"96b5f75c-9a33-496e-b06d-af0eb4e387e1","year":2020},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.468663Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:c2ee8bca9040c0bb842282fe700ab8116741f4264d7895f8c9fb69774fe2a6db","observation_id":"13290b23-9792-4281-b8f2-7c765cee721a","resolution":{"observed_at":"2026-08-10T20:01:26.034202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.472126Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.472126Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:ca80c4618ee3a1b8a40a9c75d34aa12a6bd596325da960d0bf19995fdea19743","observation_id":"ddce61d5-7d3b-4259-89d6-cd8f025ba7a3","resolution":{"observed_at":"2026-08-10T20:01:25.472126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-10T20:01:25.475947Z","title":"Towards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.475947Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:e8ab84367210ce39996ee3448b9be41673f41515c8afc853ed4eb08e76c02c48","observation_id":"fe3a301a-5b98-4d6a-8cee-1647e491f147","resolution":{"observed_at":"2026-08-10T20:01:25.475947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:26.010046Z","title":"Tracking emerges by colorizing videos","venue":null,"work_id":"afa40b97-016f-4c42-a63d-777cdec05898","year":2018},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.480116Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:397aeb20466899a474a22ee7c6f71e757b777053e03810c83bb2214319aa6ee0","observation_id":"9aebdcde-6545-4267-b1ee-dbd48902a3ba","resolution":{"observed_at":"2026-08-10T20:01:26.014261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.997967Z","title":"Unsupervised deep exemplar colorization via pyramid dual non-local attention","venue":null,"work_id":"06a472a5-579f-44fa-bfb5-a4221067d617","year":2023},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.483699Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:2fd530dd2f7925de524a6fd93eb4926e771c9a9d18301727d0e293d185ebf815","observation_id":"f80168d4-0842-4ab2-a99e-52ef8de6a2fb","resolution":{"observed_at":"2026-08-10T20:01:26.002287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.986662Z","title":"CT 2: Colorization transformer via color tokens","venue":null,"work_id":"0473e478-d0d8-4588-a04d-8be2d0708ea0","year":2022},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.487512Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:bbc17609182881ace036e4b124a7ca0810bcdd16d5aa5e071d054501f3c0ae20","observation_id":"c2875ce4-f248-4705-a0e3-c3be5cf0a4df","resolution":{"observed_at":"2026-08-10T20:01:25.990705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.974295Z","title":"L-CAD: Language-based colorization with any-level descriptions using diffusion priors","venue":null,"work_id":"3216fcf6-fd40-4ffa-8a0b-282f3be6e1fa","year":2024},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.491193Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:a9412d37d2fff460cdfd26ac3a4a597c883aecd5a9ba6d90311d03553baca0fa","observation_id":"24f8cfd8-890e-46cb-9cf3-eaad0c4ebe02","resolution":{"observed_at":"2026-08-10T20:01:25.978652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.962018Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"20c39470-4c5e-455f-aa3b-b03288efb3dd","year":2025},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.494932Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:bfcf7fdd1a46617d2782ed8b02cfa1f85f06cf82ed55b612e75293bd22525fa7","observation_id":"1063e8bb-059f-430f-9a94-bb378e3087f2","resolution":{"observed_at":"2026-08-10T20:01:25.965993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.949445Z","title":"GMFlow: Learning optical flow via global matching","venue":null,"work_id":"4be64289-b8af-409d-b419-4f293905d087","year":2022},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.498445Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:ee1eb3b8516d64c43dcadd7315702663ddee6b77e89453619cf1671eb1d385cd","observation_id":"48335aa9-11e0-48c5-8870-4b7fc4731521","resolution":{"observed_at":"2026-08-10T20:01:25.954378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.936211Z","title":"Stylization-based architecture for fast deep exemplar colorization","venue":null,"work_id":"e0a88480-9491-4333-912c-efbc404ed91b","year":2020},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.502299Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:b10f53929584d755c3136e5723380130bbe0972901723edc5f86c0650c349c9c","observation_id":"f534be7a-0a08-44de-9d0b-2324dc2f58ef","resolution":{"observed_at":"2026-08-10T20:01:25.941558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-10T20:01:25.505980Z","title":"Depth Anything V2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.505980Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:bb7a71e8bd48837a757be256fbfb645132b42690a73c80d0cfcf692307c15137","observation_id":"c8851c77-f7bc-4dea-9dc6-30d28e4442e8","resolution":{"observed_at":"2026-08-10T20:01:25.505980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.923149Z","title":"Bistnet: Semantic image prior guided bidirectional temporal feature fusion for deep exemplar-based video colorization","venue":null,"work_id":"90ba2ddc-3cb2-4dff-b67c-8171400f8cd2","year":2024},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.509980Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:88940324fdb7b2b99c690493f6bdd629a67cbe293f8491c22c2659e3ebea166b","observation_id":"fb5de070-c5a8-4e26-8870-22def420f921","resolution":{"observed_at":"2026-08-10T20:01:25.927343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.910381Z","title":"ColorMNet: A Memory-based Deep Spatial-Temporal Fea- ture Propagation Network for Video Colorization","venue":null,"work_id":"0197876d-3c0d-41bb-841b-3430df47c16a","year":2025},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.513458Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:f5309a810a4aa3909d7749e49d8433ca8cd59f7141d70da07ddb847636975614","observation_id":"ff4fed0d-6403-4bc9-bf6c-74b13df051bf","resolution":{"observed_at":"2026-08-10T20:01:25.914472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.898662Z","title":"Photorealistic style transfer via wavelet transforms","venue":null,"work_id":"f805b084-f06b-4361-9e5a-1bc78ccfdcb5","year":2019},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.517297Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:4820086dd9727129629de37c86066058a07db0dbc7c725ae8535b2e1febc0707","observation_id":"c1331a13-adac-412d-b4ad-8dd4d95aad7b","resolution":{"observed_at":"2026-08-10T20:01:25.902709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.886199Z","title":"iColoriT: Towards propagating local hints to the right region in interactive colorization by leveraging vision transformer","venue":null,"work_id":"488f698d-4420-464f-beed-3767e2130e50","year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.520884Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:1d43384aae58393e7e14f046533d84b4ee38fb24cb4821eab4b715b7c57ddaec","observation_id":"5a3aadf5-b088-40ee-8208-5a93f9f3bf4f","resolution":{"observed_at":"2026-08-10T20:01:25.890878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.874319Z","title":"Diffusing Colors: Image Colorization with Text Guided Diffusion","venue":null,"work_id":"212c6d92-71e9-4b85-931e-e6980c552b0c","year":2023},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.524500Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:013bdc3886d9b2faecbbd59357c27dd3e6bd491212b830bb392286f1c3eace6e","observation_id":"47e8cfc4-a4d5-47a4-9c69-8058860f4a77","resolution":{"observed_at":"2026-08-10T20:01:25.878739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.862458Z","title":"Deep exemplar- based video colorization","venue":null,"work_id":"aa24b02e-6f78-4c12-87ca-d35f9ac43cff","year":2019},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.528364Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:8f964216845b375aae78c98790e47b9c6ce457cf98299e073e449a4096ecd123","observation_id":"3185ac72-34a7-4303-8bf4-ee26b712a7bb","resolution":{"observed_at":"2026-08-10T20:01:25.866550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.851144Z","title":"A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence","venue":null,"work_id":"8a4efdd2-a95c-4adf-a5d6-45d6605b46e0","year":2024},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.532316Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:eb95329fd7b5fa1dccfad3cd0a0e12f37edfadaf2cdf5ac58a5d51f1cf6c86f9","observation_id":"6ed7009e-f098-45dc-b3f9-807c7b7f848d","resolution":{"observed_at":"2026-08-10T20:01:25.855327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.839840Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"983368d3-83fc-42dd-b085-8294c5bb2f64","year":2023},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.535749Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:5c38922e5427f7ee45d4d59e0d4e68f87512698a934cecec9bd1c4d22222c5da","observation_id":"1e4cd868-329b-4576-9fee-7cec81a5724d","resolution":{"observed_at":"2026-08-10T20:01:25.843920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.828150Z","title":"Colorful image colorization","venue":null,"work_id":"4e50239d-7dd3-4c8e-a335-9c76a101ef01","year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.539312Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:47388371e7182fbbdd0151d650a25ee01587f20788bfe447f57083ddc0227bd1","observation_id":"060ce9f1-b07c-4578-afbe-78d49257c12e","resolution":{"observed_at":"2026-08-10T20:01:25.832275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20279","last_updated":"2024-10-23T02:38:44Z","snapshot_observed_at":"2026-08-10T22:15:13.854749Z","submitted_at":"2024-05-30T17:33:10Z","title":"CV-VAE: A Compatible Video VAE for Latent Generative Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20279","snapshot_observed_at":"2026-08-10T20:01:25.543114Z","title":"CV- V AE: A Compatible Video V AE for Latent Generative Video Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.543114Z"},"links":{"cited_paper":"/paper/2405.20279","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:a6845071a0b53fc088fd3c0e6f4c9357015a0d5a3be8f8f58887fe8222eb13d2","observation_id":"89f9657c-725a-40ae-ac93-747eaa4f2af2","resolution":{"observed_at":"2026-08-10T20:01:25.543114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.815232Z","title":"VC- GAN: Video colorization with hybrid generative adversarial network","venue":null,"work_id":"28a84891-0b7e-4bde-b201-e085ca5fcf4a","year":2022},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.547005Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:07a2e69a3f81bec42303fce47e6756c4e1e042d8f7a98d4456c63c5212d52afb","observation_id":"49b53f7d-be82-4956-ad40-62a57be8f08f","resolution":{"observed_at":"2026-08-10T20:01:25.819249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.803037Z","title":"SVCNet: Scribble-based video colorization network with temporal aggregation","venue":null,"work_id":"deac4e28-bd2d-4ca3-933f-aef8568e494a","year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.550664Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:6689d7147bf35b0452c8c77713168ab394f6e5a0efbe9b964a9aab1c2fcdfe81","observation_id":"5f41c89a-a5d7-4277-a0c2-68663515f21f","resolution":{"observed_at":"2026-08-10T20:01:25.807116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.777658Z","title":null,"venue":null,"work_id":"d0f3d936-891c-41c0-b98e-a6d4d53a5e1a","year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.558212Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:8bcc186d369a35a3dc5cb70e7fdd3feaf0cb80029647771f7e4dd3b0cb10549f","observation_id":"773da9c5-1166-422c-a53b-2ef4115014f9","resolution":{"observed_at":"2026-08-10T20:01:25.781763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.764618Z","title":"Negative values indicate green, and positive values indicate red","venue":null,"work_id":"eaa4c4ba-395a-4a8d-9d55-53029e1176cf","year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.562051Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:b0d33e16b315c468f6b4535aaf30adb0854c3810a3e132d00b8738b721998591","observation_id":"fcd39e48-89a7-450e-95d8-6c9fd724b124","resolution":{"observed_at":"2026-08-10T20:01:25.769655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.750732Z","title":"Red ducks","venue":null,"work_id":"2ee80c34-8154-4d69-8555-6cabdc89caa8","year":1990},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.565723Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:ff645c188246f59fb687d570b5e888f814f0f2aacc5be8492e405b1f8ff9f24e","observation_id":"c490a63c-23cf-46e7-b0eb-f2869b98b324","resolution":{"observed_at":"2026-08-10T20:01:25.756254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:01:25.790011Z","title":"A, including the parameter settings of the network during training and the analysis of luma channel replacement","venue":null,"work_id":"73361f8a-30aa-4a4b-ab82-64a8b249c036","year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.554501Z"},"links":{"citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:a3147b21d1992a7fbabc7f8cc26b81162d68520917099f36896ff527be3ce8b4","observation_id":"292f0c44-6ce5-48ee-a291-ea92f228c75a","resolution":{"observed_at":"2026-08-10T20:01:25.794282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T00:17:55.515997Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2501.09499."}