{"as_of":"2026-08-13T21:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37640192b894980b0e3a1874595079bf86a5d76aa1258d8d3c78f9879d1ea57a","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:14:34.525958Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:59:34.754260Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:31:03.169272Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"cited_work":{"arxiv_id":"2506.08529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08529","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liftvsr: Lifting image diffusion to video super-resolution via hybrid temporal modeling with only 4×rtx 4090s","venue":null,"work_id":"d3780d81-b8aa-43ab-90bd-0f79c347dc3b","year":2025},"citing_paper":{"arxiv_id":"2604.10551","last_updated":"2026-04-12T09:43:13Z","snapshot_observed_at":"2026-07-31T13:48:07.780101Z","submitted_at":"2026-04-12T09:43:13Z","title":"NTIRE 2026 Challenge on Short-form UGC Video Restoration in the Wild with Generative Models: Datasets, Methods and Results","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T15:59:34.754260Z"},"links":{"cited_paper":"/paper/2506.08529","citing_paper":"/paper/2604.10551"},"observation_digest":"sha256:4df33fd37f26347ca59094ce4f8b5ba2428ae54dd6232158e5698c45a3f86864","observation_id":"9713a6bc-b414-4d03-a6d6-007a2a6dbbe7","resolution":{"observed_at":"2026-05-11T09:31:03.174967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"cited_work":{"arxiv_id":"2506.08529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08529","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liftvsr: Lifting image diffusion to video super-resolution via hybrid temporal modeling with only 4×rtx 4090s","venue":null,"work_id":"d3780d81-b8aa-43ab-90bd-0f79c347dc3b","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-08-11T06:56:48.614928Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2506.08529","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:d79c33145106a699985a82918ad0bd9839c47ed2d09320bb8a911fa672960f37","observation_id":"454a408e-0199-4c18-ba13-ae1c39c62372","resolution":{"observed_at":"2026-05-10T09:03:25.623144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08529/citation-record","integrity":"/paper/2506.08529/integrity","json":"/paper/2506.08529/citation-record.json","paper":"/paper/2506.08529"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T05:14:34.244361Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.244361Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:2889e5c095785bc8691045558abad1db8a436e913488695e0da3ee03334b0f93","observation_id":"c76ed59d-4ca7-4c08-94e4-21e50292ba13","resolution":{"observed_at":"2026-08-07T05:14:34.244361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06847","last_updated":"2023-07-04T15:30:58Z","snapshot_observed_at":"2026-08-13T19:04:44.046813Z","submitted_at":"2021-06-12T20:00:32Z","title":"Video Super-Resolution Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06847","snapshot_observed_at":"2026-08-07T05:14:34.249123Z","title":"Video super-resolution transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.249123Z"},"links":{"cited_paper":"/paper/2106.06847","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:cd4a3ddff21d9de666b2ecd8be50603b9780dad15032bedde67ec33933a0f1e2","observation_id":"4b789f84-6495-496a-ba69-ea7a934f7bd0","resolution":{"observed_at":"2026-08-07T05:14:34.249123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.340635Z","title":"Basicvsr: The search for essential components in video super-resolution and beyond","venue":null,"work_id":"7becfb49-202f-439a-bd1e-0b0462be3bae","year":2021},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.254370Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:b4ea62091d51c1d88814429fe658fcf7368943f22c39ec9543e456f505473452","observation_id":"8c95482c-fc2f-48ef-be1f-61c02689399b","resolution":{"observed_at":"2026-08-07T05:14:35.344606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.328784Z","title":"Basicvsr++: Improv- ing video super-resolution with enhanced propagation and alignment","venue":null,"work_id":"fc88d78a-300b-499f-9303-916a6443385b","year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.258261Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:1ff8901159649e4d4da01713ba387240bc66260325fddbf7cdd5cd6858de9863","observation_id":"804337dc-0e2c-4147-8d75-9cd22c0b28f5","resolution":{"observed_at":"2026-08-07T05:14:35.332558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.318328Z","title":"Investigating tradeoffs in real-world video super-resolution","venue":null,"work_id":"58a0cd7b-3ab3-4ff9-87f1-6213b7c6c9ad","year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.262754Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:1d01866c1217354bbc724257dee885ef7728fe5fdb98edd50fc9cf68c60b04ba","observation_id":"799dfc8e-41ba-4b79-8614-fbf183f98de0","resolution":{"observed_at":"2026-08-07T05:14:35.322084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.266889Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion.Advances in Neural Information Processing Systems, 37:24081–24125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.266889Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:faed6e3819a44e56138c2469249adb3a5f53a161ded7141713c603a80079b10c","observation_id":"9e4a3ce7-5754-41c4-82a7-c6d273d83471","resolution":{"observed_at":"2026-08-07T05:14:34.266889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-08-13T04:45:10.488145Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-08-07T05:14:34.271509Z","title":"Pixart- δ: Fast and controllable image generation with latent consistency models.arXiv preprint arXiv:2401.05252, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.271509Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:1a33fffde159198167b565476fa9174fe54dff7af85c1494b9a265b1318ee837","observation_id":"5b5d6997-33e8-4582-9c22-d54a6034dc19","resolution":{"observed_at":"2026-08-07T05:14:34.271509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T05:14:34.275537Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.275537Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:ce4ada240409c439bd67f44bafe111d23999958dfa41c3873eebb19128100460","observation_id":"9868468e-6fe0-42f7-9126-e1e766ca8e77","resolution":{"observed_at":"2026-08-07T05:14:34.275537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05922","last_updated":"2024-02-29T21:06:58Z","snapshot_observed_at":"2026-08-13T05:53:39.537622Z","submitted_at":"2023-10-09T17:59:53Z","title":"FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05922","snapshot_observed_at":"2026-08-07T05:14:34.279736Z","title":"Flatten: optical flow-guided attention for consistent text-to-video editing.arXiv preprint arXiv:2310.05922, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.279736Z"},"links":{"cited_paper":"/paper/2310.05922","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:90c694c25c7b3b91cdb7e290d229f0db40e7207a617408bcbeb715e79ed98ee4","observation_id":"a5a06b3d-4e3a-4fd6-ae6d-5f3294dad8c4","resolution":{"observed_at":"2026-08-07T05:14:34.279736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.283519Z","title":"Deformable convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.283519Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:191972c203bdfaeeb4a9a8155f283893d2cf7f533904043d317def3d8a369701","observation_id":"6ded8fce-5149-4939-815e-f27e5a586714","resolution":{"observed_at":"2026-08-07T05:14:34.283519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T05:14:34.287017Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.287017Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:ec8c9a0755c7c12de81303b8fe17d0d6c9a2881fdea50719c415f68c3022498a","observation_id":"53c0e1c3-0820-4e92-b4a5-9139fe07311f","resolution":{"observed_at":"2026-08-07T05:14:34.287017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07667","last_updated":"2024-07-10T13:46:08Z","snapshot_observed_at":"2026-08-12T23:25:00.691492Z","submitted_at":"2024-07-10T13:46:08Z","title":"VEnhancer: Generative Space-Time Enhancement for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07667","snapshot_observed_at":"2026-08-07T05:14:34.291389Z","title":"Venhancer: Generative space-time enhancement for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.291389Z"},"links":{"cited_paper":"/paper/2407.07667","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:3900b598e43511f1f04b1b6f241673394546b99ceda84d673a07a7664a41cc1f","observation_id":"382341be-928a-49ef-8c2e-c78819859806","resolution":{"observed_at":"2026-08-07T05:14:34.291389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-07T05:14:34.295772Z","title":"Prompt-to-prompt image editing with cross attention control.arXiv preprint arXiv:2208.01626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.295772Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:b3fe423c4b8444d6e44121d28692eef339d1ed2385c3e67461ba04f00b0b8183","observation_id":"10dfdbe4-914e-4e83-bdfa-66ee0c1d1ef9","resolution":{"observed_at":"2026-08-07T05:14:34.295772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.300472Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.300472Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:8323bb8a8af60fb44448ad933cc00e1625fb5338bba17e4177c000de41a49ede","observation_id":"2eb57c28-37b9-423b-a8b8-98ac69f18f88","resolution":{"observed_at":"2026-08-07T05:14:34.300472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.304183Z","title":"Video diffusion models.Advances in Neural Information Processing Systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.304183Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:5df027abfd391ee1a11c4a6f67e03b8d2de10fbfcf5d78a9062b7779e1c7d0b3","observation_id":"5756e8d8-336b-4dd9-8513-23772704fd55","resolution":{"observed_at":"2026-08-07T05:14:34.304183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.282909Z","title":"Video super-resolution via bidirectional recurrent convolutional networks.IEEE transactions on pattern analysis and machine intelligence, 40(4):1015–1028, 2017","venue":null,"work_id":"6ccd5ece-285c-4e72-ab8f-fe55a78e78af","year":2017},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.309012Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:7e46d71ea65a539e6e5886567646f611c43ff118263edffbd77327c8612c57f3","observation_id":"fae20e88-139c-4d5e-b6c6-cfec856fef5f","resolution":{"observed_at":"2026-08-07T05:14:35.286916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.271549Z","title":"Video super- resolution with recurrent structure-detail network","venue":null,"work_id":"db0f5491-9196-41d6-8d12-4e00f66b6d40","year":2020},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.313488Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:d9fe629a212f597610c67ad179e64b093f11f33ba101b06ce945e03cc7191810","observation_id":"2093db6e-655d-4ebc-a7df-a4bb0e4deee7","resolution":{"observed_at":"2026-08-07T05:14:35.275330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.260329Z","title":"Deep video super-resolution network using dynamic upsampling filters without explicit motion compensation","venue":null,"work_id":"f95d6907-b327-42a0-8bdf-56467fa15f6c","year":2018},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.316868Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:6852598746ddf2d5eaf0870b45f6d334a27228c66743b0565737efed41fd3ef2","observation_id":"e78d8ce5-7349-4ee2-8ce2-37f332e66c19","resolution":{"observed_at":"2026-08-07T05:14:35.264523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.320650Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.320650Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:a94439a05a7d75dcc953c049dbb2cc6e637bcd3f834c71319ff7cf1925bca067","observation_id":"de0bf5f4-bc12-47f1-97e2-b6c809f586a7","resolution":{"observed_at":"2026-08-07T05:14:34.320650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.324620Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.324620Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:af01a911be3c9d0aac49341ff68a5f200c2a7453e4f1c12e2b7486bd4280a9c1","observation_id":"82e40795-7f73-4e93-9a02-dd8e95604632","resolution":{"observed_at":"2026-08-07T05:14:34.324620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.328458Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.328458Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:7d22e0b94d696591408d1dd9678243180e4607afb236f467461af72424632ec7","observation_id":"91e51ae7-42a4-4d33-ab00-5b6a8f799de5","resolution":{"observed_at":"2026-08-07T05:14:34.328458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.230503Z","title":"Mucan: Multi-correspondence aggregation network for video super-resolution","venue":null,"work_id":"eca1b5b9-da26-4eda-bcbf-1e924dc70cd3","year":2020},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.331830Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:9bdb117ab79ac5a313474ae33e4ff23999a4d45d465c1c502c393fcd4a2a6b43","observation_id":"8dac9286-8ebd-45b3-92a4-10a51b942ccd","resolution":{"observed_at":"2026-08-07T05:14:35.234619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10110","last_updated":"2025-03-08T08:15:43Z","snapshot_observed_at":"2026-08-10T22:27:39.225386Z","submitted_at":"2025-01-17T10:53:03Z","title":"DiffVSR: Revealing an Effective Recipe for Taming Robust Video Super-Resolution Against Complex Degradations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10110","snapshot_observed_at":"2026-08-07T05:14:34.335250Z","title":"Diffvsr: Enhancing real-world video super-resolution with diffusion models for advanced visual quality and temporal consistency.arXiv preprint arXiv:2501.10110, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.335250Z"},"links":{"cited_paper":"/paper/2501.10110","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:a3c1c0368de6f6cf44dc9f64345a57f56a43b9206ddffcf1d15c61ed58455a43","observation_id":"df1b1c42-9b8b-42c2-b6b6-04fc4fcd5c65","resolution":{"observed_at":"2026-08-07T05:14:34.335250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.339139Z","title":"Lsdir: A large scale dataset for image restoration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.339139Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:2d3b8660f778e5d721056d0faf513af16e720860a0c3d28c277123627f1a0e2a","observation_id":"bc9caeaa-f1e0-4125-8d50-c5bcfd47b2a7","resolution":{"observed_at":"2026-08-07T05:14:34.339139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.213245Z","title":"Vrt: A video restoration transformer.IEEE Transactions on Image Processing, 2024","venue":null,"work_id":"ebf83047-771d-460e-b55f-3d555ae7c3c1","year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.343476Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:a0ee79000f1ce8fe80edeb5079941db8df6c8800631ace77d59ddebc1161079f","observation_id":"fb9724d2-1ac1-4eeb-8aab-9c74218e3147","resolution":{"observed_at":"2026-08-07T05:14:35.217089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.201308Z","title":"Recurrent video restoration transformer with guided deformable attention.Advances in Neural Information Processing Systems, 35:378–393, 2022","venue":null,"work_id":"73126e6c-0b14-474c-ad20-c8f8ad68b5a4","year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.346812Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:18acd998efcd702ac2f81667eae739c7210f160fef53b54a40a529b1f22efc13","observation_id":"da59c639-71d2-421a-b2e7-cd1b37b03231","resolution":{"observed_at":"2026-08-07T05:14:35.205218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.351185Z","title":"Enhanced deep residual networks for single image super-resolution","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.351185Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:7964d9c13122ed0dc65b15fb37f76cf9d0a84036c8b253a9b54a04d0751c07d5","observation_id":"565ee97e-c92a-401f-b3d1-48d9bb6094ec","resolution":{"observed_at":"2026-08-07T05:14:34.351185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.354493Z","title":"Diffbir: Toward blind image restoration with generative diffusion prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.354493Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:9498e608b297617a6baacfbf6aa9e132f7363795311f0d1722dd2ef0726bc912","observation_id":"4a664250-3e2e-47de-9f2b-0715b7d23974","resolution":{"observed_at":"2026-08-07T05:14:34.354493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.177832Z","title":"Learning trajectory-aware trans- former for video super-resolution","venue":null,"work_id":"b9343c27-46a8-4925-8d2a-87db92969aa5","year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.358493Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:7be3175b9ecec552a46917c5300776f081f9ab8a4c4fdde17060a4cbc505369d","observation_id":"3e8af4c4-b5de-45b2-acfc-b125f3857a79","resolution":{"observed_at":"2026-08-07T05:14:35.181706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.362080Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.362080Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:32e7039fa8aa9796a38c28010fc7945a44738470e691b62ca27e2f5cf01c702f","observation_id":"914ca01e-15d3-4a11-9c66-4e53c29c46cc","resolution":{"observed_at":"2026-08-07T05:14:34.362080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.365334Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.365334Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:c6bafc467a091d7a0792915d0b8b359ecbf099ff30f075654ebd5267afaec8c5","observation_id":"63adb5fa-a844-40ef-8c03-f06533a2e996","resolution":{"observed_at":"2026-08-07T05:14:34.365334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.369644Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps.Advances in Neural Information Processing Systems, 35:5775–5787, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.369644Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:27326e24f774c2b2a674b992ae45e619a41b2d4c2a792b8154e09cea81fe6b16","observation_id":"41342b3f-8813-476b-b273-718352b73270","resolution":{"observed_at":"2026-08-07T05:14:34.369644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-07T05:14:34.373824Z","title":"Latte: Latent diffusion transformer for video generation.arXiv preprint arXiv:2401.03048, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.373824Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:8c41111320f7b9a0f00f32e42d8974f498c15a38c4673f22df3605f1c0ee35c2","observation_id":"ee6ea7ef-32eb-4116-86f7-d130725692c3","resolution":{"observed_at":"2026-08-07T05:14:34.373824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.149206Z","title":"Ntire 2019 challenge on video deblurring and super-resolution: Dataset and study","venue":null,"work_id":"f11fbfe1-2aa6-489b-8b72-1f9fdeb182b3","year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.378094Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:608aaebfa0354e845d8490156bad8c7c2e52462862def2c74fae06d8d6e34b05","observation_id":"fd35daac-9868-4cdf-af26-bab68133503b","resolution":{"observed_at":"2026-08-07T05:14:35.152991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-07T05:14:34.381705Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.381705Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:7a4f64ab3285b20d048b56ea2accbcd324b4e55af6660730b53823912936dce6","observation_id":"3e16e134-656c-432e-bda3-539eba90c7d5","resolution":{"observed_at":"2026-08-07T05:14:34.381705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.385740Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.385740Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:c0b883460f173eadbcbbfb120ba74767fa4cab677f9d114d94151386c7c53c95","observation_id":"719aff2d-39a8-4622-9457-939439580efe","resolution":{"observed_at":"2026-08-07T05:14:34.385740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.389674Z","title":"Fatezero: Fusing attentions for zero-shot text-based video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.389674Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:9ed00c7b6dc495fabc14440d0f5a1bf28d097e49dddb347b9f2adbeedb200214","observation_id":"d77ebd67-cb59-4c52-9bf5-82dfeb0e93d8","resolution":{"observed_at":"2026-08-07T05:14:34.389674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.393207Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.393207Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:3f6148bf48fd09f099aadfe5e898fb472c96dabcfaa69b2223691f202068d70a","observation_id":"885da697-5666-45e0-bc15-e26172ce5c7d","resolution":{"observed_at":"2026-08-07T05:14:34.393207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.117876Z","title":"Frame-recurrent video super- resolution","venue":null,"work_id":"9fbc8c02-0a2f-467b-b800-951287387213","year":2018},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.397393Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:586552ce124c1db0b5e6225599c6d95c6f9aacf6a09dd4475da4fcbe7e5acb71","observation_id":"61376603-961d-476b-814e-082895cef0c6","resolution":{"observed_at":"2026-08-07T05:14:35.122310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T05:14:34.401516Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.401516Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:3026a475e0dd56ba0f5f0259161515350aca6c93b494e7a2af50bd06f0f9aa1c","observation_id":"7a65a4ff-1df3-4ed1-bcd3-2e5b5d276809","resolution":{"observed_at":"2026-08-07T05:14:34.401516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.405534Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.405534Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:fa4234c22c37da19debc5ccdb3a3f30c1d4644ec0eceb1e3838289ef6fb1873a","observation_id":"bbba172e-7e5b-457b-84cc-394ebf6a2d43","resolution":{"observed_at":"2026-08-07T05:14:34.405534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.099127Z","title":"Detail-revealing deep video super-resolution","venue":null,"work_id":"9b255b52-ff8d-4b23-bf2c-9d086b74313f","year":2017},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.409902Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:63beab6243fe5b052c9b699f5d85471a602372dadf5156092c065d9709513362","observation_id":"98c59845-36e7-448f-994c-c7ef6cbaa8a8","resolution":{"observed_at":"2026-08-07T05:14:35.103685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.087391Z","title":"Tdan: Temporally-deformable alignment network for video super-resolution","venue":null,"work_id":"3a1c776c-072c-4a52-b278-6350c0806619","year":2020},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.413955Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:a500f6c2c76b78d8e41cb010b5ff54bd5efe765253cb7f949ca01f4f8be933eb","observation_id":"16070d1c-b154-43d7-9783-06896cae23f1","resolution":{"observed_at":"2026-08-07T05:14:35.091233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.417751Z","title":"Ntire 2017 challenge on single image super-resolution: Methods and results","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.417751Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:32f7652ccb24f53b7936f9a4f98e4ed4a13523ccc4fa8aae2653438f8e86dc69","observation_id":"aebf7027-e6f0-400e-9327-79fdc8ac8280","resolution":{"observed_at":"2026-08-07T05:14:34.417751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.067912Z","title":"Deformable non-local network for video super-resolution.IEEE Access, 7:177734–177744, 2019","venue":null,"work_id":"58b0cec2-c778-4e4e-9896-9c7068f36c3c","year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.422328Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:296aef99ee03e29bc63c1bb2eabda0187f3ce655038f80795b1adfa807739241","observation_id":"8b81ab2a-3e5d-40f6-8a1c-1dfc32601a09","resolution":{"observed_at":"2026-08-07T05:14:35.072693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.426245Z","title":"Exploring clip for assessing the look and feel of images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.426245Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:e43b1839586d6f87742e72b8735403bc869a1d9d4436e02c72e1322e83ef21c7","observation_id":"34240715-ac62-48f9-a9da-f908de70d521","resolution":{"observed_at":"2026-08-07T05:14:34.426245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01320","last_updated":"2025-03-22T07:44:02Z","snapshot_observed_at":"2026-08-11T01:08:02.605430Z","submitted_at":"2025-01-02T16:19:48Z","title":"SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01320","snapshot_observed_at":"2026-08-07T05:14:34.430493Z","title":"Seedvr: Seeding infinity in diffusion transformer towards generic video restoration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.430493Z"},"links":{"cited_paper":"/paper/2501.01320","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:285cd74fd9466f0edd395bb7e298ed4c150824cf60f68421e7b88011f3571a0d","observation_id":"75eb13e1-e828-4652-8794-2ee5303f3f75","resolution":{"observed_at":"2026-08-07T05:14:34.430493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.434921Z","title":"Exploiting diffusion prior for real-world image super-resolution.International Journal of Computer Vision, 132(12):5929–5949, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.434921Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:2653d58ae22f51e3eaf2536d7d07dacb657531890da633a0d6e8cbec3d3a48a5","observation_id":"3f35847c-4f91-4691-a373-dc76af9b4120","resolution":{"observed_at":"2026-08-07T05:14:34.434921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.439340Z","title":"Edvr: Video restoration with enhanced deformable convolutional networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.439340Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:971049396ab319586c1ef2b6473f6036ae01da0fbecca9fcd19db73caa445895","observation_id":"30305726-bf7f-47da-8dd3-10c069bc9d17","resolution":{"observed_at":"2026-08-07T05:14:34.439340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.443341Z","title":"Real-esrgan: Training real-world blind super-resolution with pure synthetic data","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.443341Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:6c6fe773dd51fa2f41bdecfbead6658ce9bb5fc74630207ed62836e8d419008f","observation_id":"379338ea-fdca-4d57-9896-6a499c3f6b30","resolution":{"observed_at":"2026-08-07T05:14:34.443341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.447814Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.447814Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:d12abc27201f42c925f777d10b4a349fc3a021fb0119d1667e1b7192def47e40","observation_id":"97904ae3-6ba1-4064-ac93-4eeaa036d09e","resolution":{"observed_at":"2026-08-07T05:14:34.447814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.025411Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"b6657d3c-5d96-4444-8922-fad734d592f1","year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.451910Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:45167a040da5177bbc93a921b45c15d0fbf3e67d2cf09ecf389ed2cd6ddd74bf","observation_id":"6b9d2e34-1655-4e09-ab85-730707ef5d52","resolution":{"observed_at":"2026-08-07T05:14:35.028989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.014209Z","title":"One-step effective diffusion network for real-world image super-resolution.Advances in Neural Information Processing Systems, 37:92529–92553, 2024","venue":null,"work_id":"dc4fb838-143d-4f99-ac23-d5687aaf5696","year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.456528Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:a525682e81620ced5f886042afd3171e06cbae91cb59cb0fdf2f56652043ca2f","observation_id":"81f99a4d-23d4-4305-93e9-60ef314c29f8","resolution":{"observed_at":"2026-08-07T05:14:35.018151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:35.002700Z","title":"Animesr: Learning real-world super- resolution models for animation videos.Advances in Neural Information Processing Systems, 35:11241–11252, 2022","venue":null,"work_id":"02d8b350-435c-4e63-a3c5-550aa62da4a3","year":2022},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.461000Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:8a5be0e23c2f388a977137fe1595de17e3b0898a02d5be0b8739a2e6f0b1b8ff","observation_id":"d7904011-d320-47d4-917f-17094510024e","resolution":{"observed_at":"2026-08-07T05:14:35.007343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.990804Z","title":"Diffir: Efficient diffusion model for image restoration","venue":null,"work_id":"6164a62a-0384-43d2-85d9-f4d089aa22a1","year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.465435Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:818b48e676754d304370f701604951b2218072eda77ffd4bb094b74801659723","observation_id":"0cfed318-eeba-4040-9bfd-e3265328673a","resolution":{"observed_at":"2026-08-07T05:14:34.995322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02976","last_updated":"2025-01-06T12:36:21Z","snapshot_observed_at":"2026-08-12T15:49:11.902685Z","submitted_at":"2025-01-06T12:36:21Z","title":"STAR: Spatial-Temporal Augmentation with Text-to-Video Models for Real-World Video Super-Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02976","snapshot_observed_at":"2026-08-07T05:14:34.469795Z","title":"Star: Spatial-temporal augmentation with text-to-video models for real-world video super-resolution.arXiv preprint arXiv:2501.02976, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.469795Z"},"links":{"cited_paper":"/paper/2501.02976","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:367307d051fd75b3a03e4b8d2be95146268e4905ee7b0edcbb815f1a9771ca0e","observation_id":"8ae9a46f-81e3-4b1a-9ef3-e620afd1251a","resolution":{"observed_at":"2026-08-07T05:14:34.469795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.474576Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture.arXiv preprint arXiv:2405.18991, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.474576Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:d2f57c4535a38e65ac8f543602ed695b2ed74aa603fe5cc153b078885758b8e5","observation_id":"6340dd44-c98f-475b-946c-b10c7a0198d9","resolution":{"observed_at":"2026-08-07T05:14:34.474576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.979975Z","title":"Video enhancement with task-oriented flow.International Journal of Computer Vision, 127:1106–1125, 2019","venue":null,"work_id":"9cd92cc9-2ec7-457d-bfd4-c70826ee2683","year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.479115Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:29b3c5a9919be3238f61c392919e610710a89d41ed8517105eed076d3a3e9156","observation_id":"ad0fe9b3-eb28-4481-8801-ca1c23dbec34","resolution":{"observed_at":"2026-08-07T05:14:34.983828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.484538Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.484538Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:ab91f1b5ac6b3f75d84d099496988484b875c4a9bf5a006925fd50aaf129dc46","observation_id":"947f9ff3-08c7-47b5-b5f8-3ff2d7f8fee7","resolution":{"observed_at":"2026-08-07T05:14:34.484538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.961345Z","title":"Motion-guided latent diffusion for temporally consistent real-world video super-resolution","venue":null,"work_id":"598118d7-6ed9-4dd2-b285-b9ef616ac596","year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.488794Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:0053e30bba29c3d4ec8104ef65c26ee143e68a7ab08a6ccc89ea8c7bbe9cd42a","observation_id":"eee86b28-8378-407b-9700-76c5cd6a6fac","resolution":{"observed_at":"2026-08-07T05:14:34.965606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T05:14:34.493215Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.493215Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:214574a1bf5e3eb18cb734eb38a1cfca09ce60550a03588911e680c5e55a54b7","observation_id":"c71a0c62-3945-4d7a-ae0f-353f56984755","resolution":{"observed_at":"2026-08-07T05:14:34.493215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.948932Z","title":"Progressive fusion video super-resolution network via exploiting non-local spatio-temporal correlations","venue":null,"work_id":"ca854bfc-cc3d-41ca-b084-fbf7dc54f49a","year":2019},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.498183Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:26951ce0ab4726954e53448f9c83d63b38de596a837a2ce5317b5ca7f3566fc1","observation_id":"c2b05cf7-0b8e-4c8d-b715-44a78c224fc4","resolution":{"observed_at":"2026-08-07T05:14:34.953597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.935932Z","title":"A feature-enriched completely blind image quality evaluator.IEEE Transactions on Image Processing, 24(8):2579–2591, 2015","venue":null,"work_id":"a60e3724-8892-4213-adab-c0163beb96be","year":2015},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.502843Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:151b62b09fc93e360003ef4f7d8f152a722fde3710c0082baa3f5582981d9d17","observation_id":"613710f8-2784-4f20-934c-6f27193c8315","resolution":{"observed_at":"2026-08-07T05:14:34.940622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.507372Z","title":"The unrea- sonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.507372Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:6e8700a903534075c17aa0e81aaf85b4906187f73159062bedcebb9a2b373058","observation_id":"b9b54d82-a0a0-47c1-af32-6ff45a3a5c9d","resolution":{"observed_at":"2026-08-07T05:14:34.507372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.918194Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":"e277ca80-73d3-4583-b3ef-8b543d49cee0","year":null},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.511849Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:e18684ef87c2b5b821764741c7e3f3d14726a86f52c19d08c32a75218ed413b1","observation_id":"7b12eaa6-c816-467d-b5b6-fc971eb143f8","resolution":{"observed_at":"2026-08-07T05:14:34.922215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.906693Z","title":"Realviformer: Investigating attention for real-world video super-resolution","venue":null,"work_id":"f8798eb3-c9ea-43c1-a113-2054f2fb85c5","year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.516682Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:e9da0408a8f6bfdf0f1a1badd297ebaab54ac041ff4d7942e8d133cf64e39ff7","observation_id":"20aa31d7-4751-42be-8f9e-6b44a38f1ffb","resolution":{"observed_at":"2026-08-07T05:14:34.910598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:34.893517Z","title":"Upscale- a-video: Temporal-consistent diffusion model for real-world video super-resolution","venue":null,"work_id":"b0acf46a-43c6-412d-b19b-7fdf728fa3ac","year":2024},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.521194Z"},"links":{"citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:4d900dec671c32cf7197242e3ac99d51aac3036458d52b9c385322d159ab90e3","observation_id":"ac740761-24b5-49e1-b7a9-b174762e11c6","resolution":{"observed_at":"2026-08-07T05:14:34.898930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-07T05:14:34.525958Z","title":"Deformable detr: Deformable transformers for end-to-end object detection.arXiv preprint arXiv:2010.04159, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:34.525958Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2506.08529"},"observation_digest":"sha256:2491ef0c76169fed8280f65d282ea53eb7a35e2dcb7cf06af95045337128d596","observation_id":"8253209a-f15b-4109-8aa9-f62985b08e33","resolution":{"observed_at":"2026-08-07T05:14:34.525958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08529","last_updated":"2025-06-10T07:49:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T18:37:34.572853Z","submitted_at":"2025-06-10T07:49:33Z","title":"LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\\times$RTX 4090s"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 2 inbound Pith citation observations for arXiv:2506.08529."}