{"as_of":"2026-08-04T23:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c08b89f8786d06dd8b299d0d0ff5d0e6fa2d4e3669b67c0d53f59804aa750b6d","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T18:16:14.985693Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:30:25.729920Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-21T07:59:50.595450Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"cited_work":{"arxiv_id":"2605.04461","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.04461","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","venue":"cs.CV","work_id":"8c9ab80d-63f9-4ce4-91f1-28248723d012","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2605.04461","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:a017f3c6f16dad08ebf00caf4e24614d53c6b97bcda4f7200514ec7e42c6bf69","observation_id":"57015be4-cfba-4881-a9db-a6971606329b","resolution":{"observed_at":"2026-05-20T11:48:14.790869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"cited_work":{"arxiv_id":"2605.04461","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.04461","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","venue":"cs.CV","work_id":"8c9ab80d-63f9-4ce4-91f1-28248723d012","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2605.04461","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:e4985d3a7c750928c6edc9d7236b61eea9d2fa08fd9cae2a1612db730f85dde4","observation_id":"7b56ca82-b68f-4341-bcee-62a0d9a38c9b","resolution":{"observed_at":"2026-05-21T07:59:50.598285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.04461","snapshot_observed_at":"2026-08-01T03:30:25.729920Z","title":"Stream-t1: Test-time scaling for streaming video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23159","last_updated":"2026-07-30T17:05:25Z","snapshot_observed_at":"2026-08-03T00:00:18.111734Z","submitted_at":"2026-07-25T11:30:59Z","title":"CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T03:30:25.729920Z"},"links":{"cited_paper":"/paper/2605.04461","citing_paper":"/paper/2607.23159"},"observation_digest":"sha256:3cbc011080a7be16ebce2ff3dacc0d43b3f199af6d7280f02ff57907c7f98127","observation_id":"94b9d04a-88fc-45ed-a1c9-918dae59bee0","resolution":{"observed_at":"2026-08-01T03:30:25.729920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.04461/citation-record","integrity":"/paper/2605.04461/integrity","json":"/paper/2605.04461/citation-record.json","paper":"/paper/2605.04461"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02076","last_updated":"2025-07-02T18:27:42Z","snapshot_observed_at":"2026-07-06T21:51:24.566962Z","submitted_at":"2025-07-02T18:27:42Z","title":"Reasoning on a Budget: A Survey of Adaptive and Controllable Test-Time Compute in LLMs","version":1},"cited_work":{"arxiv_id":"2507.02076","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02076","snapshot_observed_at":"2026-07-04T10:39:45.816513Z","title":"Reasoning on a budget: A survey of adaptive and controllable test-time compute in llms","venue":null,"work_id":"ce2ea139-eaf6-4e82-a16d-cfa8657ac65c","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2507.02076","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:066dde731f5f39cc943200fb3a644c25ba85c5fe7f74b75ec4dcc53a55a7290e","observation_id":"4f7159f5-d5ca-4da8-a1fe-9bbd642afe20","resolution":{"observed_at":"2026-05-09T06:40:39.447330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-11T02:27:48.842637Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:de0defcc166d9f6187e9bf4aeeb0670f51ddf0f1d1ed9a0b2919f35b520b355f","observation_id":"3c6afa20-1390-48d2-8661-cd799312933a","resolution":{"observed_at":"2026-05-10T22:58:52.491420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":"2504.13074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-07-10T01:46:41.058772Z","title":"SkyReels-V2: Infinite-length Film Generative Model","venue":"cs.CV","work_id":"2ce11350-273e-4f0d-ae78-292aa3151060","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:be272f4d95ad9b29d3dee3eb4acc5380ee666e0a182bbd1646228c3344fb52fd","observation_id":"3dc4a080-ea58-4fce-b65a-3d07585834ef","resolution":{"observed_at":"2026-05-14T20:23:04.486750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:4a80c08ba045d5f026ec4ac5bd6ee9da7147aabea37db83c65b366a6b904aef8","observation_id":"ad65406b-a55c-40de-8ae7-716a00eba102","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16375","last_updated":"2025-05-21T10:38:01Z","snapshot_observed_at":"2026-07-06T19:56:30.344759Z","submitted_at":"2024-11-25T13:33:41Z","title":"Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing","version":2},"cited_work":{"arxiv_id":"2411.16375","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16375","snapshot_observed_at":"2026-07-07T14:03:48.589989Z","title":"Ca2-vdm: Efficient autore- gressive video diffusion model with causal generation and cache sharing","venue":"cs.CV","work_id":"64a14619-a1b0-45bc-acdb-eda16e69490c","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2411.16375","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:d0bb3582decb12f4a8ffd543b45e122a79596edb4fe3e96dba617d956b4da9e3","observation_id":"62b5c462-02c7-4d39-970d-8885c0eaeed1","resolution":{"observed_at":"2026-05-09T06:40:39.381562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":"2503.19325","doi":"10.48550/arxiv.2503.19325","metadata_source":"pith","pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","venue":"cs.CV","work_id":"9700bbdc-df42-461a-81fa-b29ffe683326","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:7aeaee67e7ae960ab4683d44abe43eb8ae1c71db37b691757beb6770e0acbbb9","observation_id":"3d9dc62f-0c40-47ca-8fa6-dfd6c9c18e24","resolution":{"observed_at":"2026-05-16T23:05:17.562899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081): 633–638","venue":null,"work_id":"a23a80ab-08ed-4291-b5c6-a2cd4d9c6d8d","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:9a22e770811090d8a6ce7c9a883014bfea10f5d3654195cc964fcd3ba111fff6","observation_id":"909a02e4-251c-41e5-bcee-7595e15f8751","resolution":{"observed_at":"2026-05-26T05:26:45.821157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:fb302f505426cb72a3995666607785a2d4e0f98fdce808222bc3d253a7a2dffa","observation_id":"65c0da35-7216-4f86-8628-4d5a715e1344","resolution":{"observed_at":"2026-05-10T22:52:19.777506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17618","last_updated":"2025-05-23T08:25:46Z","snapshot_observed_at":"2026-08-02T14:26:12.032919Z","submitted_at":"2025-05-23T08:25:46Z","title":"Scaling Image and Video Generation via Test-Time Evolutionary Search","version":1},"cited_work":{"arxiv_id":"2505.17618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17618","snapshot_observed_at":"2026-07-04T13:09:50.730002Z","title":"arXiv preprint arXiv:2505.17618 , year =","venue":null,"work_id":"57c6e091-57ae-40da-abcb-41b78bd60702","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2505.17618","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:5a1216aad4a34a882d601e3059c5df299f8ff4c885be86370b22151cc3aea06d","observation_id":"6715b68a-f580-4a69-8dd2-338dbb1ddbc4","resolution":{"observed_at":"2026-05-09T06:40:39.266097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-07-11T01:07:45.231019Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:4015463e45cecb92488eed582094e5b992b5f80e88db0090bec2472619d82cea","observation_id":"e0127b0a-35f7-4e7e-9a01-0c0503386fb4","resolution":{"observed_at":"2026-05-11T01:36:53.812910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T23:44:22.326016Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"9f23bd16-4e15-463f-941a-93528f3b5926","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:8bc495e68c7cee1de92d17fc55fe70c72ad6a5ca2e2e43a50950396f76234a89","observation_id":"8f711057-a0b5-44d5-a349-bbccdb4eb557","resolution":{"observed_at":"2026-05-26T05:26:45.870560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models","venue":null,"work_id":"47e62b38-0a5b-4686-9de0-6e2d4fb1c105","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:8aa7c9a628b3e9612a446df7035966bdca9ac7ed8a89572fb2be02001364f006","observation_id":"7bb3c82a-7a6f-4a27-836f-096ee7152f90","resolution":{"observed_at":"2026-05-26T05:26:45.879025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:f8e632606cadf608df55c8c8cea1a0f948da85cf8abde6262e3b61b7bf7c2a39","observation_id":"3b8763fd-e4ac-4670-a9d0-0fb45e4269f8","resolution":{"observed_at":"2026-05-09T06:40:39.115011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:27:24.381988Z","title":"Videoar: Autoregressive video generation via next-frame & scale prediction","venue":null,"work_id":"165c8814-8d81-43db-9424-2b70e8538c65","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:eef62c103310772ba65e9b74c659e43cd1d1e31d454264203422c21f92b641c4","observation_id":"7d99f900-7788-4e94-b41d-4aebef16200e","resolution":{"observed_at":"2026-05-09T06:40:39.339531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compositional image synthesis with inference-time scaling","venue":null,"work_id":"1e63dab2-01f8-42ef-8c91-70f9687b9cd9","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:d6bfbb4187bc4e3d7cc65743350ad9725be5acfb6435484a5533488281daac5d","observation_id":"f6947854-683c-41f2-b89e-56e9b32ff3c8","resolution":{"observed_at":"2026-05-26T05:26:45.865958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:6fb3dd647754054d5026b5735b0b142af18af283e54116503621d85ee83563ca","observation_id":"df1188a5-0226-4137-af9c-92abd584f8ca","resolution":{"observed_at":"2026-05-15T17:51:05.830483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-11T01:07:45.135143Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:a5ee175a459f32d9b814d0ecc95d0f2aa6af18376e69a967aa790852b07f72c8","observation_id":"4fd06467-db47-4681-a9cc-fd471207dcea","resolution":{"observed_at":"2026-05-09T06:40:39.218180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-07-30T09:22:37.641917Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"cited_work":{"arxiv_id":"2602.07775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07775","snapshot_observed_at":"2026-07-10T01:46:41.027454Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"ee9b6bbe-6f3e-4344-b631-395401ca5b33","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2602.07775","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:a09c2e6380f9780057ac38a16ead56f8e7f632711bcfde3a66b00fe4788613b2","observation_id":"74d05e05-d655-41fe-88a3-0d0485ec1a98","resolution":{"observed_at":"2026-05-09T06:40:39.314786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reflect-dit: Inference-time scaling for text-to-image diffusion transformers via in-context reflection","venue":null,"work_id":"9c7a2753-8d14-4cab-b7f1-851a438a62ff","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:3af63a03e577b6f5d67504b62da61f8337cb1565d594822efa6bb74bbd1b1bdf","observation_id":"61cae0a0-9cd7-4099-8f74-0cd8adccd9f8","resolution":{"observed_at":"2026-05-26T05:26:45.874861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20502","last_updated":"2025-04-15T14:06:28Z","snapshot_observed_at":"2026-07-06T19:40:25.975196Z","submitted_at":"2024-10-27T16:28:28Z","title":"ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation","version":3},"cited_work":{"arxiv_id":"2410.20502","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20502","snapshot_observed_at":"2026-07-02T20:37:22.496220Z","title":"Arlon: Boosting diffusion transformers with autoregressive models for long video generation","venue":null,"work_id":"722a2b1e-c829-4cef-864f-4bbdb1eb0031","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2410.20502","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:156010693be106c1c2dacbc4a1ac4772a11a84fcd84154029d47b00901fd8e31","observation_id":"04239bbe-1acd-41a1-9541-253eaec0a5d3","resolution":{"observed_at":"2026-05-09T06:40:39.477796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-t1: Test-time scaling for video generation","venue":null,"work_id":"f3e954bb-b996-45f0-b1ed-08f270999112","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:19818d7494927d6cad7e63b4d5dca364ce484b50acb054224aa19797840aa92e","observation_id":"dc1b731f-471c-45cd-8ce4-7847e798e7fd","resolution":{"observed_at":"2026-05-26T05:26:45.882705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":"2501.13918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-07-04T13:19:51.115512Z","title":"Improving Video Generation with Human Feedback","venue":"cs.CV","work_id":"cfe4c01d-1cf7-4a00-ba86-06d583ca2cff","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:a90b7e4e92c8e1c83bc9d298fff2aaf3500664cea87f825068fa18f4d7da3bec","observation_id":"66880af5-85db-4903-b231-7690dabf1a4f","resolution":{"observed_at":"2026-05-13T15:30:03.116566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":"2509.25161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-07-08T10:54:49.169100Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","venue":"cs.CV","work_id":"e44fcf99-6683-4319-a07d-0db4c89ff93c","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:befa523bb0737f0844de1bbe9e120d2defed8dc4d8aa25f589f972aa94929121","observation_id":"f7354b2f-6c8c-453c-9065-8fa80bd029e2","resolution":{"observed_at":"2026-05-16T11:15:29.350628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-07-06T20:34:06.899427Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:7b1605216a0e1ae5c9fa07b53b1390d8773d68ff5e18ed44e1330363635cb2e2","observation_id":"11ce872f-0adc-4370-8d30-fe73dc63e331","resolution":{"observed_at":"2026-05-09T06:40:39.485808Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"cited_work":{"arxiv_id":"2512.04678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04678","snapshot_observed_at":"2026-07-03T23:59:07.563782Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","venue":"cs.CV","work_id":"74f20348-bdc0-4c09-a8d2-999657fb3fea","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2512.04678","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:b06084ffe1d60b247ccdbeec28864b73c9d7a360f583e4f5e2584a4a0a441ce0","observation_id":"3c65e886-ca8e-42a6-8e6b-7a87b8ed35e0","resolution":{"observed_at":"2026-05-16T18:17:55.281442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T23:44:22.308181Z","title":"Hpsv3: Towards wide-spectrum human preference score","venue":null,"work_id":"ecd364a9-9512-4fa0-ba0d-557b6be69e84","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:77184ef042b8c6ca0367fa58a36eb20d1a357ab8469c5430659c1b046f0da7b5","observation_id":"2dd9ee08-7cf5-4c0b-8a38-eb59955c3898","resolution":{"observed_at":"2026-05-26T05:26:45.861770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:43:39.521871Z","title":"s1: Simple test-time scaling","venue":null,"work_id":"a3e7b62a-fe52-4fbc-9830-9d6adb0d60c3","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:66976ddc78863efacc21d1f0534d3d386096a151937b2f6277f1ae2c93c0b9a1","observation_id":"ade03136-71a8-4912-9f04-a07fb80f24da","resolution":{"observed_at":"2026-05-26T05:26:45.903273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.19252","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:09:29.395958Z","title":"Inference-time text-to-video alignment with diffusion latent beam search","venue":null,"work_id":"6c267bb1-9572-43f0-8ca8-35ff147d07c4","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:27aff317f93a3ba362cf24f445f6b01a65b966604137548ae1a00b690b276649","observation_id":"0cf6b9c5-b46f-4135-bd5e-660e33622907","resolution":{"observed_at":"2026-05-09T06:40:39.103311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-07-10T13:47:05.847810Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:cc40115e2f79b0fb771b5a9af38be664ee111e8c7f95169683433bf507e5cae9","observation_id":"bc704297-30ac-4fb3-ad8b-50ac6474299e","resolution":{"observed_at":"2026-05-11T14:16:26.778393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical spatio-temporal decoupling for text-to-video generation","venue":null,"work_id":"ef8ed9e6-dbaa-45ee-ace9-b3c477f35e39","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:87db065f5c795539383afc212e6e4a0e2425ed7ea8370e41b156ab523979afed","observation_id":"107a2c90-1a1a-4181-8dcb-4d79596b5c4d","resolution":{"observed_at":"2026-05-26T05:26:45.910413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03164","last_updated":"2025-09-06T17:12:52Z","snapshot_observed_at":"2026-08-04T13:19:08.533134Z","submitted_at":"2025-05-24T19:13:29Z","title":"Test-Time Scaling of Diffusion Models via Noise Trajectory Search","version":2},"cited_work":{"arxiv_id":"2506.03164","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03164","snapshot_observed_at":"2026-07-03T20:18:57.227694Z","title":"Test-time scaling of diffusion models via noise trajectory search","venue":null,"work_id":"5fdaa472-1e01-4aa1-878b-27196cabe6b4","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2506.03164","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:7b9a117ce3ab4f6c644fae79d0fdfce6a43455be82d38f79f7b23d327606bbfa","observation_id":"39d4d151-904e-4457-97ad-d7ef043020d3","resolution":{"observed_at":"2026-05-09T06:40:39.091834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07737","last_updated":"2025-02-12T14:50:50Z","snapshot_observed_at":"2026-07-06T20:34:53.567141Z","submitted_at":"2025-02-11T17:57:53Z","title":"Next Block Prediction: Video Generation via Semi-Autoregressive Modeling","version":2},"cited_work":{"arxiv_id":"2502.07737","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07737","snapshot_observed_at":"2026-07-04T16:29:57.325994Z","title":"arXiv preprint arXiv:2502.07737 (2025) 30","venue":null,"work_id":"4696bd68-488d-48f9-ac0b-2fa808160ea2","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2502.07737","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:4b1c2c273f6ad439a4a09a0698d8555e9ade4cfccdbef8038b7dd0727b0642cc","observation_id":"acbfbd2e-cde1-4a99-ba18-0f24fb52ba72","resolution":{"observed_at":"2026-05-09T06:40:39.120481Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:394d31f616c9fe87b3b5f61268dd5cb225a1c28ef10d828a920d19edcfde8a03","observation_id":"d305d8ff-05a2-4c3e-bbac-521b50e38849","resolution":{"observed_at":"2026-05-11T01:13:03.403852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06848","last_updated":"2025-07-18T17:52:45Z","snapshot_observed_at":"2026-07-06T20:19:55.486841Z","submitted_at":"2025-01-12T15:34:24Z","title":"A General Framework for Inference-time Scaling and Steering of Diffusion Models","version":5},"cited_work":{"arxiv_id":"2501.06848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06848","snapshot_observed_at":"2026-07-04T13:09:50.123415Z","title":"A general framework for inference-time scaling and steering of diffusion models","venue":null,"work_id":"9ff11c8a-d659-4c6c-9262-d48f515ace17","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2501.06848","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:b2051f242bdde5baa66cc4e87e59d4444df5672228d6214991ffe9009026e9e2","observation_id":"2cb6755b-5e14-44d8-aacd-392a6db0ebd6","resolution":{"observed_at":"2026-05-09T06:40:39.324015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling llm test-time compute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":"f105068e-1f05-4abc-a876-56ca08649a7e","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:8d911c65b325ad44c85d9297b3e2367c6697adbb8976c773891fe239cba4f8f1","observation_id":"70ecedaf-ca48-4702-9e34-27e454f1bfb5","resolution":{"observed_at":"2026-05-26T05:26:45.848682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":"2505.13211","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-07-10T01:46:41.063877Z","title":"MAGI-1: Autoregressive Video Generation at Scale","venue":"cs.CV","work_id":"25e8bd3d-e51c-43ae-8126-4ea6ecdb3321","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:03404aa3d753c1d4dca9589382d3f3597f1e95a8d29b0544dfe764d3ff442e0b","observation_id":"5c3ef276-96e2-4404-99cc-22d40cdeb3c9","resolution":{"observed_at":"2026-05-13T20:31:15.871842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:8797e9e07101ae672fb6ff61c064567d4f249ea7978db675735b8cf75922fc0c","observation_id":"35c4deb3-a411-475e-9f6d-1c20d6826baf","resolution":{"observed_at":"2026-05-09T06:40:39.207640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-07-06T16:05:35.645037Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":"2308.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-07-11T01:57:50.025885Z","title":"ModelScope Text-to-Video Technical Report","venue":"cs.CV","work_id":"1b1baf78-58ec-44d0-b700-84dff57b2f1f","year":2023},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:70d87f8dd2174273148313a16bc618e8502fd98982ec28ed54eceb48cd4d72f1","observation_id":"dd8db599-1797-480b-9f2c-971706144eba","resolution":{"observed_at":"2026-05-12T19:47:29.701736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:738dee43929743afe9f48d2b36e82bacd2624fef5c8a4fe8fde92644e0ce644b","observation_id":"c829bd25-08ae-432f-8423-98522d6f6920","resolution":{"observed_at":"2026-05-09T06:40:39.142753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Art-v: Auto-regressive text-to-video generation with diffusion models","venue":null,"work_id":"06b577a8-a264-4484-a95f-fda2276946f4","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:43ede1813bdea15fb38777685e06502e2acf5b88e0282e12df3415949525dadf","observation_id":"9f0ec689-0be9-4d5c-9a38-6012b7a46624","resolution":{"observed_at":"2026-05-26T05:26:45.857511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagerysearch: Adaptive test-time search for video generation beyond semantic dependency constraints","venue":null,"work_id":"78a0bb27-ef3e-4295-9b0e-3a89352f75ac","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:e3a43af48ea772dc37012edccc7935f951fa6854a1c16e58fd41cae1cf45dc41","observation_id":"7bf32e41-c4eb-4ce7-b45f-dfac6686e222","resolution":{"observed_at":"2026-05-26T05:26:45.808027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:34:01.618368Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":"5c5c3eee-061e-4af7-b5f2-2e03489973ae","year":2023},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:0eee4df3da4456221ab7c20bd5209689e03436bbfa8522364a82364eb1d6fa70","observation_id":"c8397314-d288-40d6-bf01-a5fb63cfef56","resolution":{"observed_at":"2026-05-26T05:26:45.816117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation","venue":null,"work_id":"41c6be61-6834-47b8-bd60-d35042dd6f1f","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:b365ef77945d2caf2658f791e0d9ee01bf842214912ae0bb8df6e7f51e771300","observation_id":"6bf7f549-062f-4b36-bfcd-988b7d0e379f","resolution":{"observed_at":"2026-05-26T05:26:45.812066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":"2104.10157","doi":"10.48550/arxiv.2104.10157","metadata_source":"pith","pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","venue":"cs.CV","work_id":"703c74c3-fa5e-455c-8c00-697c83511fcf","year":2021},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:d6062122688223b08bf16f77a0fccc6eb767270dae2c7921144e8b64ca7bd4a4","observation_id":"7ad2f95b-98e4-4565-82e2-eed46028c0c8","resolution":{"observed_at":"2026-05-13T17:24:33.857072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":"2509.22622","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-07-09T07:56:04.670863Z","title":"LongLive: Real-time Interactive Long Video Generation","venue":"cs.CV","work_id":"29ec6550-6ac1-4cc6-8aae-b4206f1d5b38","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:d6ebd8933dccd10c495a76bfb0ba12508207278805cf06a3a43442149abe15b1","observation_id":"06318ebc-7ac9-44b7-a820-312cb886c746","resolution":{"observed_at":"2026-05-15T03:52:59.837830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-11T00:07:42.878250Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:caa1b68a020f5374752e95338ebe91a51add0d3779aa8ef7d2309d995943ccf3","observation_id":"0c5b2909-fc77-4327-a299-c52a0c577301","resolution":{"observed_at":"2026-05-10T18:26:22.534732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From slow bidirectional to fast autoregressive video diffusion models","venue":null,"work_id":"670d460b-3b8f-4a28-9014-064842e32bbc","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:40fc7c0e7907b3fc269477939413f87c9fda83190284fb6d75a03de56b320a06","observation_id":"99ae0156-79f0-4524-a1f9-2415b49af3a4","resolution":{"observed_at":"2026-05-26T05:26:45.853255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14168","last_updated":"2025-06-18T09:44:09Z","snapshot_observed_at":"2026-07-06T21:43:22.202859Z","submitted_at":"2025-06-17T04:08:18Z","title":"VideoMAR: Autoregressive Video Generatio with Continuous Tokens","version":2},"cited_work":{"arxiv_id":"2506.14168","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14168","snapshot_observed_at":"2026-07-02T02:36:27.674391Z","title":"Videomar: Autoregressive video generatio with continuous tokens","venue":null,"work_id":"1b66fda8-50f3-4849-a2da-fe8282d5b0ef","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2506.14168","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:92e728db195127b3975d7db8c251d941060bc3c7264a3220bc42075665f93903","observation_id":"43281fb9-6d34-4319-a0fe-f0ba1e9f1583","resolution":{"observed_at":"2026-05-09T06:40:39.187032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lumos-1: On autoregressive video generation with discrete diffusion from a unified model perspective","venue":null,"work_id":"b4586eab-2879-4ea9-bcb4-a166e49554f6","year":null},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:913c50a841289b7b77448bb8caec9fee73f3ddb98419ac0ddbdd36f0c76823e6","observation_id":"eac90085-e369-41b6-a08b-70ad1001f64d","resolution":{"observed_at":"2026-05-26T05:26:45.826129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":"2501.13106","doi":"10.48550/arxiv.2501.13106","metadata_source":"pith","pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":"cs.CV","work_id":"38f52461-37fd-4266-bc46-9dea31be2824","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:ad636482467fce9c8d9b18963f978b4a68e58bfa26c58432b4cfd355b35cb213","observation_id":"2091afb9-3c76-45d6-89e7-6f5d9847b3ae","resolution":{"observed_at":"2026-05-11T01:20:00.737157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation.International Journal of Computer Vision, 133(4):1879–1893","venue":null,"work_id":"ac989087-7e78-437f-96f4-d1c18b88f7f2","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:06faedbacb4b5aa3141b1b9e1115b2fe1e034b8ba45b5bca21506da0fbc72666","observation_id":"5c7dba27-deb6-45e2-8e89-72a35e1fda04","resolution":{"observed_at":"2026-05-26T05:26:45.844510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-03T03:32:58.169782Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":"2503.24235","doi":"10.48550/arxiv.2503.24235","metadata_source":"pith","pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","venue":"cs.CL","work_id":"d4eaadf8-a3c6-4eee-98fb-1b337dd42e2d","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:f071a485b2ef74e55410d423aa63378a7c0241057d34a46de810c6e3f19dd583","observation_id":"cf2b85a0-724e-4107-90b1-9350996c6eb3","resolution":{"observed_at":"2026-05-13T18:07:52.994249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning multi-dimensional human preference for text-to-image generation","venue":null,"work_id":"67b28cef-ffb3-4afe-a1ce-9ae56fe9eda4","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:b3b4e4c5c4e720398af5f889f9d44302f3bf9ee001c5a9a7e08129f701c062c9","observation_id":"a71c6540-4dd1-4ff4-8c21-eb12c53c9052","resolution":{"observed_at":"2026-05-26T05:26:45.839643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14526","last_updated":"2026-06-28T22:57:12Z","snapshot_observed_at":"2026-08-02T01:05:20.949344Z","submitted_at":"2026-03-15T18:07:29Z","title":"LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion","version":2},"cited_work":{"arxiv_id":"2603.14526","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.14526","snapshot_observed_at":"2026-06-30T02:17:18.172894Z","title":"Latsearch: Latent reward-guided search for faster inference-time scaling in video diffusion","venue":null,"work_id":"6eff1c2b-cf66-43c1-95c9-53fdbfaef133","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2603.14526","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:453b11f28793bfa975bf8f2ad371b6426e0dddbdcfe0124dc7d97f2b2e322145","observation_id":"92812db4-1efa-4262-92c6-c7c569e5754f","resolution":{"observed_at":"2026-06-30T02:17:18.172894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2211.11018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-07-11T01:57:50.042360Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","venue":"cs.CV","work_id":"aad71b40-2721-438d-8e8c-97f84063ed39","year":2022},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:eb37a58ee609a6ca1469cce537ffaf318ca761725141060114dcbfb9ca597024","observation_id":"e2ca6090-c584-4851-a333-cadcca0038f2","resolution":{"observed_at":"2026-05-15T18:47:57.649874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Golden noise for diffusion models: A learning framework","venue":null,"work_id":"14d984ae-3705-4e57-b0dd-185194844705","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:00ed6abedb6a5a50752cf79bb342dd5b25c3a13d976e56a4ab6ae865afa433ae","observation_id":"a8101fbc-fa68-41d4-afa1-88924aeb5ad3","resolution":{"observed_at":"2026-05-26T05:26:45.830495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From reflection to perfection: Scaling inference-time optimization for text-to-image diffusion models via reflection tuning","venue":null,"work_id":"98b594a4-5148-4679-9737-1651b84e3626","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:ef3894538e4cd8a17ea3a0d07fa7a4838496c6fc592e7d9e56a9d8aad525c384","observation_id":"7998b363-a012-4fea-9d78-3db92aa0dc4a","resolution":{"observed_at":"2026-05-26T05:26:45.834970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":35,"verified_fuzzy":20},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 3 inbound Pith citation observations for arXiv:2605.04461."}