{"as_of":"2026-08-10T02:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a7fe4fc914d430075b4e68e7a315de0acaef78dcf55d62ff9ab4d7e50752d59","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T10:46:29.637028Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:21:44.482775Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T14:44:59.784059Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2502.04363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04363","snapshot_observed_at":"2026-07-08T14:44:59.784059Z","title":"On-device sora: Enabling training-free diffusion-based text-to-video generation for mobile devices","venue":"cs.CV","work_id":"b4d89586-4691-406d-b32b-13bd03282605","year":2025},"citing_paper":{"arxiv_id":"2603.28489","last_updated":"2026-07-04T13:25:12Z","snapshot_observed_at":"2026-08-05T11:17:52.410204Z","submitted_at":"2026-03-30T14:23:45Z","title":"Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms","version":2},"reference_index":155,"source":"pdf_text","source_observed_at":"2026-05-14T01:35:14.878069Z"},"links":{"cited_paper":"/paper/2502.04363","citing_paper":"/paper/2603.28489"},"observation_digest":"sha256:bd26c05ea5be4e93c7164b08e8d594dcbf4df74ff639834e86552d66ccefac61","observation_id":"47c6b7c4-9155-4791-8fcb-745aa841879f","resolution":{"observed_at":"2026-05-14T01:38:36.426016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2502.04363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04363","snapshot_observed_at":"2026-07-08T14:44:59.784059Z","title":"On-device sora: Enabling training-free diffusion-based text-to-video generation for mobile devices","venue":"cs.CV","work_id":"b4d89586-4691-406d-b32b-13bd03282605","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2502.04363","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:5f13647235569e8e6350d116dad287a34389b303227ee42e1419dd22209bf24c","observation_id":"2f294d63-0116-4b9e-bba8-7afd5bf3364b","resolution":{"observed_at":"2026-05-10T09:03:26.202726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2502.04363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04363","snapshot_observed_at":"2026-07-08T14:44:59.784059Z","title":"On-device sora: Enabling training-free diffusion-based text-to-video generation for mobile devices","venue":"cs.CV","work_id":"b4d89586-4691-406d-b32b-13bd03282605","year":2025},"citing_paper":{"arxiv_id":"2607.06173","last_updated":"2026-07-26T20:43:47Z","snapshot_observed_at":"2026-08-03T04:45:08.357712Z","submitted_at":"2026-07-07T11:52:46Z","title":"MobileWan: Closing the Quality Gap for Mobile Video Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T14:37:46.957265Z"},"links":{"cited_paper":"/paper/2502.04363","citing_paper":"/paper/2607.06173"},"observation_digest":"sha256:d5fc3677efb09b5bf5f73f9c968405e7787a6a03115607a01f23f3da5b982319","observation_id":"d90978ab-05e8-4c89-aa73-051ddd806df8","resolution":{"observed_at":"2026-07-08T14:44:59.785369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04363","snapshot_observed_at":"2026-08-02T08:21:44.482775Z","title":"On-device sora: Enabling training-free diffusion-based text-to-video generation for mobile devices.arXiv preprint arXiv:2502.04363, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06173","last_updated":"2026-07-26T20:43:47Z","snapshot_observed_at":"2026-08-03T04:45:08.357712Z","submitted_at":"2026-07-07T11:52:46Z","title":"MobileWan: Closing the Quality Gap for Mobile Video Diffusion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:44.482775Z"},"links":{"cited_paper":"/paper/2502.04363","citing_paper":"/paper/2607.06173"},"observation_digest":"sha256:2480eaaed70abd0a51635be29445e47ef8503a994f6f29a94f52bcc2a25932ee","observation_id":"28edac6e-cc20-40fd-9a52-b3ee690f6fbd","resolution":{"observed_at":"2026-08-02T08:21:44.482775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04363/citation-record","integrity":"/paper/2502.04363/integrity","json":"/paper/2502.04363/citation-record.json","paper":"/paper/2502.04363"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.365358Z","title":"iphone 15 pro—technical specifications, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.365358Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:097226462037463215537ec133ba874d8ef20661b413cbcb7ecb4241a8e36894","observation_id":"5da9d11d-6aab-484b-847c-515295b1fcb9","resolution":{"observed_at":"2026-08-09T10:46:29.365358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.369925Z","title":"Swift, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.369925Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:af0cce42aba2de59449dfb183f86a0087893c6b7649e2af5e18f579afcf2bb35","observation_id":"5b08b0ec-586f-4a16-bce6-156c0db86aa4","resolution":{"observed_at":"2026-08-09T10:46:29.369925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.373458Z","title":"A discussion on euler method: A review","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.373458Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:5047a178bafe04060b14b772369d3ecfa3c94d32e868482fadb9f141ece9e67d","observation_id":"65e576f8-e1ce-4dbe-876d-ff6a956d5a1a","resolution":{"observed_at":"2026-08-09T10:46:29.373458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-09T10:46:29.376984Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.376984Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:c97f152cff055fc1c4efcc06f22d80b26f41604cae4c2884a4b9a953b392b6e7","observation_id":"e888b8db-7500-4ae4-a049-d8c98beee61e","resolution":{"observed_at":"2026-08-09T10:46:29.376984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.381180Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.381180Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:20033258e346249d95fa89177e80a8ccdc6c08ce020c94ddee2ad34d16cc1042","observation_id":"c049aab2-8e65-474c-8cdc-4634c85792e7","resolution":{"observed_at":"2026-08-09T10:46:29.381180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-09T10:46:29.384729Z","title":"To- ken merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.384729Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:52267df568022d5ab9ec4546cd652a8b55a8e65eb3a9b233962dcc7aebecbf3e","observation_id":"a3d877ef-dded-4ebd-b451-eb989955aa70","resolution":{"observed_at":"2026-08-09T10:46:29.384729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.389029Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.389029Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:71bdf3a0fc4e7fd46adaea7042b46b4627e512ad03bd43db201f271d757c5d43","observation_id":"d5265d9a-2cf8-42fd-acb9-d7572fc2fb97","resolution":{"observed_at":"2026-08-09T10:46:29.389029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11925","last_updated":"2024-04-18T06:02:54Z","snapshot_observed_at":"2026-08-03T05:29:00.285922Z","submitted_at":"2024-04-18T06:02:54Z","title":"EdgeFusion: On-Device Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11925","snapshot_observed_at":"2026-08-09T10:46:29.392456Z","title":"Edgefusion: On-device text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.392456Z"},"links":{"cited_paper":"/paper/2404.11925","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:1165a9d0a931451cba9b0611fe2056bd2414100151934afbe0a0982bd4ada355","observation_id":"da626f79-ee59-4c72-ba06-fd2c0ccfb6d5","resolution":{"observed_at":"2026-08-09T10:46:29.392456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.396621Z","title":"Tempme: Towards the explain- ability of temporal graph neural networks via motif discov- ery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.396621Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:707514957f3b266cfcb3d677f7e696a729ea86c46aca29654efa0b5f4a9836da","observation_id":"b4405442-c3de-4264-b25e-9f6c9170d8b0","resolution":{"observed_at":"2026-08-09T10:46:29.396621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.617802Z","title":"Neural ordinary differential equa- tions","venue":null,"work_id":"d64eea6f-e4b0-4d95-8d21-085ef2fde356","year":2018},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.401233Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:6b6ccacbabd928f7afc2fd33a5a94451f2961eb5907c9dc9556fde93278237cb","observation_id":"206bfa80-3ccf-4ac1-9169-6c60e56dfd6e","resolution":{"observed_at":"2026-08-09T10:46:30.621189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19479","last_updated":"2024-02-29T18:59:50Z","snapshot_observed_at":"2026-08-08T15:16:15.308854Z","submitted_at":"2024-02-29T18:59:50Z","title":"Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19479","snapshot_observed_at":"2026-08-09T10:46:29.404444Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.404444Z"},"links":{"cited_paper":"/paper/2402.19479","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:376eec2a2d876c2f1bfc2ec52c9821883b5569141970eb8c9be5e9eae7879f0a","observation_id":"8bac707c-32be-4615-8705-715a5b0d3b89","resolution":{"observed_at":"2026-08-09T10:46:29.404444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.607925Z","title":"Speed is all you need: On-device acceleration of large diffu- sion models via gpu-aware optimizations","venue":null,"work_id":"0c8ce213-5b08-40f2-af9d-7c06da35a30b","year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.407840Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:1c08fa44c44cb4f2e3509a12e8c88bfb0e51cb2ecfebf91dd9a7457514c0f20d","observation_id":"d05b8f2a-ff8b-428f-938b-c4e34653b043","resolution":{"observed_at":"2026-08-09T10:46:30.611589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01193","last_updated":"2023-07-03T17:54:40Z","snapshot_observed_at":"2026-07-06T15:49:47.586513Z","submitted_at":"2023-07-03T17:54:40Z","title":"Squeezing Large-Scale Diffusion Models for Mobile","version":1},"cited_work":{"arxiv_id":"2307.01193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.01193","snapshot_observed_at":"2026-08-09T10:46:30.190259Z","title":"Squeezing Large-Scale Diffusion Models for Mobile","venue":"cs.LG","work_id":"21358114-1f3e-4ce3-a0c7-efebf2064a55","year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.411129Z"},"links":{"cited_paper":"/paper/2307.01193","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:38db434516b89a42c80bf4092a3b2c2cb65bf314f2f55cf55a6facf41610d6e4","observation_id":"b2fbcf9f-e4d9-4d0c-b419-632d18016632","resolution":{"observed_at":"2026-08-09T10:46:30.194008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.414863Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.414863Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:afa9dab4c650ceebb75f2cba6ae0c6550380761f4529592d6597bb90dd37ce3b","observation_id":"e98c8e93-0e81-4338-8830-f5418dc0e2d1","resolution":{"observed_at":"2026-08-09T10:46:29.414863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05908","last_updated":"2021-01-03T16:56:46Z","snapshot_observed_at":"2026-08-04T06:56:29.565877Z","submitted_at":"2016-06-19T21:02:30Z","title":"Tutorial on Variational Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05908","snapshot_observed_at":"2026-08-09T10:46:29.418025Z","title":"Tutorial on variational autoencoders","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.418025Z"},"links":{"cited_paper":"/paper/1606.05908","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:0e4ab8904e2b86f6308bb0ecfe6cd280933b23890d46b70d5872fb21ba061a9a","observation_id":"082b9bcf-43e1-467e-b6f1-980fc64182da","resolution":{"observed_at":"2026-08-09T10:46:29.418025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.421885Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.421885Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:588a01b4029727d12382a571eae5df3c2128320f2a3cb2bdddb3b7d95bbc5947","observation_id":"09da7e6f-0232-475c-bc7f-9b0d6f4241ac","resolution":{"observed_at":"2026-08-09T10:46:29.421885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.588684Z","title":"Efficient vision trans- former via token merger","venue":null,"work_id":"954dbeb4-cbb4-4b81-8e5a-6525d1e1d13c","year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.425244Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:703cfa416c434d23e45e198628235ce279ab6a60e4c6922052e322c64984f3bf","observation_id":"3ee9dc0f-dd24-4f34-b040-c1ed32ef953f","resolution":{"observed_at":"2026-08-09T10:46:30.591324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17951","last_updated":"2025-08-05T08:39:31Z","snapshot_observed_at":"2026-07-06T18:21:09.808086Z","submitted_at":"2024-05-28T08:28:18Z","title":"Efficient Time Series Processing for Transformers and State-Space Models through Token Merging","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17951","snapshot_observed_at":"2026-08-09T10:46:29.428727Z","title":"Efficient time series processing for transform- ers and state-space models through token merging","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.428727Z"},"links":{"cited_paper":"/paper/2405.17951","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:7cb6c93d295450eb7d81ba063fe77a8f584abf7453a61060ab38f5d4b2a8b403","observation_id":"a1df505b-b859-420f-929f-e541a7540628","resolution":{"observed_at":"2026-08-09T10:46:29.428727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.580742Z","title":"Knowledge distillation: A survey","venue":null,"work_id":"2ee278a4-3d6c-45be-acfb-3b7f45b980ee","year":2021},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.431950Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:7f84983d44b2d472d3e13c81d3e0e74616d7134808a8f0660047abfed717b3b1","observation_id":"78da2a77-51d5-448e-a97a-564a67492963","resolution":{"observed_at":"2026-08-09T10:46:30.583382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.573177Z","title":"Gray and David L","venue":null,"work_id":"78c732cd-ea75-47d2-aee5-02745fbd7315","year":1998},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.434964Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:1f186eb58231a80766173c1e93a6a5bd0b234729df677e38de012a4a002d743d","observation_id":"a48c0b2f-fd1d-43fe-9243-333fa2e2c433","resolution":{"observed_at":"2026-08-09T10:46:30.575665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.565021Z","title":"Flexible diffusion modeling of long videos","venue":null,"work_id":"d3007abf-922a-449d-85cd-ea536ffcb3c4","year":2022},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.438121Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:eca4bae8dc1fdec827c242e681d11631f494547e3c355d13fe38eb1a33e7cf4d","observation_id":"ff597029-a652-4459-be09-7b3730f90384","resolution":{"observed_at":"2026-08-09T10:46:30.568339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-09T10:46:29.440873Z","title":"Distilling the knowledge in a neural net- work","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.440873Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:ef34f7d48ce9593aef535cf6d492de62a1a2c3d0b6147fe1f7bb56ff3b5a48e4","observation_id":"fc0e1528-0f4f-4dfa-8a90-f3494fdd3f40","resolution":{"observed_at":"2026-08-09T10:46:29.440873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.444744Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.444744Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:24c9c0d22a696bc77240937b6320e15f3ba8906d1c14cc2e2732e43ac1039294","observation_id":"8764cf74-0058-4d4f-8b1f-286b5eeb4633","resolution":{"observed_at":"2026-08-09T10:46:29.444744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-09T10:46:29.447958Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.447958Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:961d84a2b53f8ae072f3af4f22001aa3d8078fae9aaeec164e56099a1c530328","observation_id":"2e2f7bd8-f1e1-4dfc-9fd9-06eed829b9b7","resolution":{"observed_at":"2026-08-09T10:46:29.447958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.550740Z","title":"Cascaded diffu- sion models for high fidelity image generation","venue":null,"work_id":"2912d1c2-9b05-410c-b607-23e8953ab79e","year":2022},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.451148Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:263534264611ea46869d6228252d29e83cff0c9b6e516b6e6f764fd6ee705525","observation_id":"1233f79a-4018-4e93-831b-e5ef2d1e072a","resolution":{"observed_at":"2026-08-09T10:46:30.554150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.454778Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.454778Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:13c76be285ae5dc1cbf640d8ea47f1b336567131b40ec0903ca5d9fa83fbec28","observation_id":"21cd6704-090f-419d-913f-c7584f4e3d58","resolution":{"observed_at":"2026-08-09T10:46:29.454778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.535794Z","title":"Toward controlled generation of text","venue":null,"work_id":"439bc663-c209-49fd-8ce8-b942f9be6eda","year":2017},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.458128Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:af5e88882fb9f96255fec6f36a2ea2c9d8e93960234a4ceefbde852f746ea75d","observation_id":"bb64e608-68c8-4f73-8a1e-8552655ca4cb","resolution":{"observed_at":"2026-08-09T10:46:30.539287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.526856Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"5aea6341-31e5-4c0d-8ab0-54fecace1015","year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.460899Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:8ef80308b2a20c62d66cd4d47d0523abe93a2a30f4130b396f4a162819ef43a1","observation_id":"26e2f92f-9178-4318-b5ee-54de7701daad","resolution":{"observed_at":"2026-08-09T10:46:30.530247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.463824Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.463824Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:7cbd407636fe9581c654d1143b08fee800ed9655ce731602ee445dbe8e078a81","observation_id":"2e21fd85-4f33-494d-8fa3-236bda7c6376","resolution":{"observed_at":"2026-08-09T10:46:29.463824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.467231Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.467231Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:80bc356d36ddb93a19e62bed857b8b0df7dbc4982adfe685ac49112ddf2cc951","observation_id":"bed72ca8-75b0-4ad6-a0c1-8dbc7d2dde3d","resolution":{"observed_at":"2026-08-09T10:46:29.467231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.511545Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"64f0f7fd-e3c6-4550-ba4e-6269e0cbaf26","year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.470388Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:e0e5cdf075878ace64f3621c6a768e464a9c80ffeb22625a8dbdc8c809371764","observation_id":"bd918bd0-689b-47fd-9b43-b6cd1ef0a494","resolution":{"observed_at":"2026-08-09T10:46:30.515093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.502231Z","title":null,"venue":null,"work_id":"e7df20e2-2ebe-4e27-ad70-917179660e47","year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.473312Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:d42bba4e677934f925f4b54cc80c0b762f4b274838f2d1afd81e0c0845225398","observation_id":"3771e4df-b0c1-476c-9726-0a91c3d84054","resolution":{"observed_at":"2026-08-09T10:46:30.505452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.476228Z","title":"xformers: A modular and hackable trans- former modelling library","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.476228Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:b5746ab5cf2ee5245d40508eba732eeb8d55a6fca8d1ca244ae51bcb765a14e8","observation_id":"3ba24b8c-a1c6-4dee-8573-c2c4688b98f9","resolution":{"observed_at":"2026-08-09T10:46:29.476228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.486634Z","title":"Vidtome: Video token merging for zero-shot video editing","venue":null,"work_id":"209aaf58-ad0e-4b78-8d19-dbcad068140e","year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.479554Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:5ebdea8003ccf7e2bd83f6095a2a7717e863c261d93a4612c8b272788505b5ed","observation_id":"696a61ec-b843-4404-ace7-91a6a286ff04","resolution":{"observed_at":"2026-08-09T10:46:30.490227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.476827Z","title":"Snap- fusion: Text-to-image diffusion model on mobile devices within two seconds","venue":null,"work_id":"5f9174b8-3797-4a80-900d-8c9e0b3ed05e","year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.482337Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:2e638c049fe4d5edc1238d1f6d9c4ccef072297b4725392fef860e8dd3071992","observation_id":"fd85b3f3-3459-495d-8fe5-69f607bb5947","resolution":{"observed_at":"2026-08-09T10:46:30.480295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12706","last_updated":"2024-03-19T13:08:54Z","snapshot_observed_at":"2026-07-06T17:46:58.758589Z","submitted_at":"2024-03-19T13:08:54Z","title":"AnimateDiff-Lightning: Cross-Model Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12706","snapshot_observed_at":"2026-08-09T10:46:29.485547Z","title":"Animatediff-lightning: Cross-model diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.485547Z"},"links":{"cited_paper":"/paper/2403.12706","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:9e2e9d314b195120314986d37699fc54218d2394d8906513393cc538992ee922","observation_id":"4e656760-e6ab-46ee-b9ad-1163943b6ca1","resolution":{"observed_at":"2026-08-09T10:46:29.485547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.466614Z","title":"Generative adversarial networks for image and video synthesis: Algorithms and applications","venue":null,"work_id":"0d9f2005-56a1-49b6-af23-c9cd0d570a13","year":2021},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.488642Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:79f8e1908d42fa43aa24748d55cf8042660b6c42d366975cabc0263aae3f8ad8","observation_id":"8e9088e1-93ae-4668-bcc5-07bec1ac74ee","resolution":{"observed_at":"2026-08-09T10:46:30.470396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-09T10:46:29.491631Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.491631Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:9f0b7f7acc24f5c9c91e3e70905489d4b880ad01e0769ccddd7ff0874a4011bd","observation_id":"586056c2-deff-44d2-8da3-fa18a7d3801e","resolution":{"observed_at":"2026-08-09T10:46:29.491631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-09T10:46:29.494514Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.494514Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:3f76a765a49dc5df20339bc62f060e09b9ddaf4e4e21f35ba689009dcc81099c","observation_id":"1ef678db-8144-48e5-a6f3-f87dfa795533","resolution":{"observed_at":"2026-08-09T10:46:29.494514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-07-29T20:17:21.488997Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-09T10:46:29.497660Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.497660Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:987abc506ceb4054923731280471cc2ac7bb7ab1ee9e95be64a76b72604dcf8d","observation_id":"d32a0d21-28df-417a-ab70-bd08cd9ad0cf","resolution":{"observed_at":"2026-08-09T10:46:29.497660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.457178Z","title":"Snap video: Scaled spatiotemporal transformers for text-to-video synthesis","venue":null,"work_id":"84c83dea-47a9-46ea-bc67-69db34ea37b8","year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.501071Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:5442f95f0d2995f8d76c41b50ec6794dc22ac098c5f58fee6b9e85218c6e8bcb","observation_id":"39e8164d-8b45-4f5a-89ed-9685c831a4cb","resolution":{"observed_at":"2026-08-09T10:46:30.460738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01329","last_updated":"2023-02-02T18:58:58Z","snapshot_observed_at":"2026-07-06T14:47:48.494911Z","submitted_at":"2023-02-02T18:58:58Z","title":"Dreamix: Video Diffusion Models are General Video Editors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01329","snapshot_observed_at":"2026-08-09T10:46:29.504193Z","title":"Dreamix: Video diffusion models are general video editors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.504193Z"},"links":{"cited_paper":"/paper/2302.01329","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:85e80b6154be7b180ef0f55384697591bc3d92c81b02f72fade3229c742abfa1","observation_id":"2602ef1d-0efb-4b3f-b0d7-7e312d1c4747","resolution":{"observed_at":"2026-08-09T10:46:29.504193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.447831Z","title":"A review on the attention mechanism of deep learning","venue":null,"work_id":"70c15672-a863-489d-ac0d-6f188624c726","year":2021},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.507341Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:ee24448340ea10aa83efd0ffab9060a679b782416c9656810056659e72a23d87","observation_id":"07263c9f-0af4-4d22-96eb-3b29230b11ce","resolution":{"observed_at":"2026-08-09T10:46:30.451211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.438380Z","title":"Generative models for video analysis and 3D range data applications","venue":null,"work_id":"fd37b513-164e-409b-81d1-b5cf2dc70e12","year":2004},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.510095Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:ddbc07b5ad54f97cb3170a2adf68b73a0052881ba7887296dab6185a66d0df94","observation_id":"ef2d38b3-4c91-455e-96cb-e45467715c29","resolution":{"observed_at":"2026-08-09T10:46:30.441817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.512914Z","title":"Pytorch: An im- perative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.512914Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:566262d716ace905c10bf639b536381a430866e4f640a0617e7e83030644017d","observation_id":"44b0ef8b-c9a2-4588-9887-dacc24c32669","resolution":{"observed_at":"2026-08-09T10:46:29.512914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.515489Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.515489Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:2a0fad6b3086afd6255d3e608d319f39e1bb448c1eabb15711d4afc2e161958c","observation_id":"c8932e36-323f-4ccd-880b-5dc008f09e21","resolution":{"observed_at":"2026-08-09T10:46:29.515489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-09T10:46:29.518458Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.518458Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:8b0bb38aa3bafdd67d9daefc0661d9cde028f9ea2998cdef42796c6f4bc87b2e","observation_id":"9db81d19-5ed9-4496-b2ab-bcc34e9519d0","resolution":{"observed_at":"2026-08-09T10:46:29.518458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.420129Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"bf499233-07b9-4006-9cb6-d0ef1bff7e46","year":2020},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.521518Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:bdcaba53023640b58948842d9813ae329657a7a49a4db8ebd06bac2b974d12f1","observation_id":"c85b33ee-5cda-4f47-8d0f-312674fd8187","resolution":{"observed_at":"2026-08-09T10:46:30.422866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.412271Z","title":"Pruning algorithms-a survey","venue":null,"work_id":"6383158e-8496-4ef9-a7bf-5ad105436a3d","year":1993},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.524299Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:fc3c055df580a97585fd734fc575443b89d6f3bbadec8fd3e5a6cc424ffa8684","observation_id":"3039f780-abeb-461e-94ba-7d4d0770f774","resolution":{"observed_at":"2026-08-09T10:46:30.414999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.527356Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.527356Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:2408a3930f3b38fc8cdf2fd3fb280e7b08a23b6dd5cd081cfdf7a0372a266255","observation_id":"270a6090-4cf2-4f80-bab7-08636b7ae85b","resolution":{"observed_at":"2026-08-09T10:46:29.527356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.399637Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"47f524da-cc73-44f3-84a6-8fc502b42f17","year":2015},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.530078Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:44cebfb4b528f2fbabb69f84d5a2f75e1e733809f4c35bacbc6cc596b318b597","observation_id":"0b270534-f790-4bbf-8cfa-2ab72efd0f3d","resolution":{"observed_at":"2026-08-09T10:46:30.402361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.391330Z","title":"¨Uber die numerische aufl¨osung von differential- gleichungen","venue":null,"work_id":"52cd1178-291e-434e-9cae-3cc570e7dd8e","year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.532752Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:1d0755a17efa6725cc8c49bdeb997d80aa03215dc972e6fab2ba52e5346d5343","observation_id":"ead3ae0b-4280-4114-a803-5351e5bf52f4","resolution":{"observed_at":"2026-08-09T10:46:30.394529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.535718Z","title":"Palette: Image-to-image diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.535718Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:2dfc16d80ca427694d86fabcd5b62042af5a791927ea0cbbbabb7e80f8631d04","observation_id":"ce006bea-9d8d-4f78-9619-3e29b5e88b1c","resolution":{"observed_at":"2026-08-09T10:46:29.535718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.376932Z","title":"Introduction to apple ml tools","venue":null,"work_id":"0c665f5a-95f9-4630-863d-bfff56404a72","year":2021},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.538372Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:7cff2294b83666b9baa2268727b3247960b0ad4bde1cdb6ea67c1abe98a6e9a0","observation_id":"10783bd1-71cd-420a-a34f-ab04eb992168","resolution":{"observed_at":"2026-08-09T10:46:30.380252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.367626Z","title":"Sin- gan: Learning a generative model from a single natural im- age","venue":null,"work_id":"0b182c51-21e7-41a2-8fb3-27928dfd8461","year":2019},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.541123Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:401106ec7bb0037ea1ab2cbfce86924881d1a90d90216eb66a8eb44bce481fac","observation_id":"93457ce0-f9d8-44ca-be70-9ee14336f7f0","resolution":{"observed_at":"2026-08-09T10:46:30.371044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-09T10:46:29.544214Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.544214Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:ea5078621f00d0dca06bc401e2967c495a97e24cc2ce19c1687d3c69e445fd96","observation_id":"04f5b16c-d2f1-4cb1-8064-e7250f50cd06","resolution":{"observed_at":"2026-08-09T10:46:29.544214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.357967Z","title":"Video edit- ing via factorized diffusion distillation","venue":null,"work_id":"0a1cffa9-aa76-4779-a4f8-c0ae0845bfc8","year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.547315Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:247278dabdff3a0de0f4591d9967415cb363c2ab0619faa5e1ef1a884ea8448b","observation_id":"feeebf05-e61a-42bf-a061-22ca690883e4","resolution":{"observed_at":"2026-08-09T10:46:30.361436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-09T10:46:29.550642Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.550642Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:b4344781b001fbcf39d562bccea7c90e419d817844a4fc7e0a974db2063c6826","observation_id":"9b8fe24f-ce86-4ddb-bc7c-ca3ac3a8181a","resolution":{"observed_at":"2026-08-09T10:46:29.550642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.553654Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.553654Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:47dc52ed9c001ab0b3b73a6c7f0eee9d618595068ee8a8d926e85ef29053e39a","observation_id":"f2162860-5301-493d-b63d-ae706d0add3d","resolution":{"observed_at":"2026-08-09T10:46:29.553654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.343940Z","title":"A survey of multi- modal deep generative models","venue":null,"work_id":"a5b98d23-64ef-4dcf-90ab-bb766aae2023","year":2022},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.556817Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:f18f95611b0c4286e1fe1eb1c9b1c3a26742003658be06167e74ca357f6ff6c6","observation_id":"df0ca600-10e6-44fd-a97f-c0206f804237","resolution":{"observed_at":"2026-08-09T10:46:30.347655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-06T06:21:45.459224Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-08-09T10:46:29.559618Z","title":"Vidgen-1m: A large-scale dataset for text-to-video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.559618Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:2524c4d71fd2f54264f28087471ee994d722c1e9fa814713e30d50b2c4281ea3","observation_id":"67f6d166-4f8b-4b80-aed4-917be129f93e","resolution":{"observed_at":"2026-08-09T10:46:29.559618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.335046Z","title":"Qvd: Post-training quantization for video diffusion models","venue":null,"work_id":"1330e779-b53c-4419-b34a-97aef89eece9","year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.562630Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:7f0b71d4b22391240373a3296f25f7af22fc04b5555d2e096844f0442ade7793","observation_id":"61403ab1-9933-43aa-8083-c041c56facff","resolution":{"observed_at":"2026-08-09T10:46:30.338317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-09T10:46:29.565679Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.565679Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:a4c766ca29f37ef845410d1cb34c0c15e3524f3f618dc1d791587efbe8d98287","observation_id":"f615afc3-0795-42a7-a66b-9d8d0080fe72","resolution":{"observed_at":"2026-08-09T10:46:29.565679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.325948Z","title":"Mobileone: An im- proved one millisecond mobile backbone","venue":null,"work_id":"82a06697-9d6d-4df9-81b0-bdadb43ed8de","year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.569420Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:f93c5c592037d60d76ebc0ad80a6631c0a0ee4648c3f75ef615968434a7f7a10","observation_id":"67196b35-7a68-4182-a219-44d2f8e63072","resolution":{"observed_at":"2026-08-09T10:46:30.329357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.572440Z","title":"Mcvd-masked conditional video diffusion for prediction, generation, and interpolation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.572440Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:a49dccd948d62310ae23cc20fca9871c0543f40a5bfe50f4b3ab25b31d2d939d","observation_id":"b43bfd82-e448-4158-b1c2-76e8f47eafba","resolution":{"observed_at":"2026-08-09T10:46:29.572440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.311272Z","title":"Animatelcm: Computation-efficient personalized style video generation without personalized video data","venue":null,"work_id":"1aafa3b8-770d-4338-a540-fa7ebc48754e","year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.575531Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:ddf08ad4a8c6b9566d14e166bb3623bc541dff2a559bde3e1b00ca227d031b07","observation_id":"e6309612-bcbf-4f10-ba22-3aa9b716c1ad","resolution":{"observed_at":"2026-08-09T10:46:30.314893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.295532Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":"bce36a3c-eec9-4e4e-bf14-509799a8d75d","year":2020},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.581493Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:b252de3b9991abaf395c03346ce3f764a4b0aef7eb55825260f4f636f52517ae","observation_id":"df7b0ce5-2024-4fdb-a622-8d598d2fde69","resolution":{"observed_at":"2026-08-09T10:46:30.299223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.584244Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.584244Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:bb9c5e5d74025784692c8850e8c10288851a79f15187c95ee8b5570b750b1710","observation_id":"6423c304-6464-4871-8a85-ddd87977ee88","resolution":{"observed_at":"2026-08-09T10:46:29.584244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18375","last_updated":"2025-08-05T13:33:54Z","snapshot_observed_at":"2026-08-02T05:20:13.881812Z","submitted_at":"2024-11-27T14:22:13Z","title":"Individual Content and Motion Dynamics Preserved Pruning for Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18375","snapshot_observed_at":"2026-08-09T10:46:29.587315Z","title":"In- dividual content and motion dynamics preserved pruning for video diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.587315Z"},"links":{"cited_paper":"/paper/2411.18375","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:4bd2de80fa71b6b6af1d78d8b2318991c8cbdaf324df6086064e2c8c5948627f","observation_id":"1b161b5f-bf0a-4b58-be06-fd4762d0e4f2","resolution":{"observed_at":"2026-08-09T10:46:29.587315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10494","last_updated":"2025-06-09T22:48:33Z","snapshot_observed_at":"2026-08-03T22:09:26.323075Z","submitted_at":"2024-12-13T18:59:56Z","title":"SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile Device","version":2},"cited_work":{"arxiv_id":"2412.10494","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10494","snapshot_observed_at":"2026-08-09T10:46:29.894485Z","title":"SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile Device","venue":"cs.CV","work_id":"38e3d1c0-65c7-459e-ab29-8ba4e6f05b64","year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.590722Z"},"links":{"cited_paper":"/paper/2412.10494","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:eaaea428425f0f65fced6b15f5d7db7c7f55773c28e02920d5936c5af055ab2a","observation_id":"aaa0229f-04b8-48cb-804a-699ef936120f","resolution":{"observed_at":"2026-08-09T10:46:29.899800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07583","last_updated":"2024-12-10T15:19:10Z","snapshot_observed_at":"2026-07-06T20:04:43.926718Z","submitted_at":"2024-12-10T15:19:10Z","title":"Mobile Video Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07583","snapshot_observed_at":"2026-08-09T10:46:29.593427Z","title":"Mobile video diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.593427Z"},"links":{"cited_paper":"/paper/2412.07583","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:950bcf901ced0e5f252e949630daa32ef8a4a838ddc7d8a435ed4d3a00583e54","observation_id":"2557feb2-562d-42f1-9143-2911dd6c48d5","resolution":{"observed_at":"2026-08-09T10:46:29.593427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.281427Z","title":"Stat: Spatial-temporal attention mechanism for video cap- tioning","venue":null,"work_id":"07bb6d9e-ca3f-45f1-9bbe-bf8e87760eee","year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.596470Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:77d7b6c54f8c2f21a858a54e7c5d3c15bacf96ed2bc60a861ed60b319c580b01","observation_id":"ffc90300-e8d1-4b71-a906-a569e90c518f","resolution":{"observed_at":"2026-08-09T10:46:30.284615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.273388Z","title":"Diffusion models: A comprehensive survey of methods and applications","venue":null,"work_id":"890b444c-bfe8-48a6-94bf-875429b88e6f","year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.599249Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:64f4ffdd5e110482773ace8db4b39c7dc0cf2520669d322b00b7d934e71449ee","observation_id":"d234fb92-3657-4860-b74a-e40336f19908","resolution":{"observed_at":"2026-08-09T10:46:30.276159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-09T10:46:29.602176Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.602176Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:7705e0f42bd3e5ac1cadf984164449381a8452a259076c093a0d4ace3eeb5e73","observation_id":"05eeb88a-777c-48c2-9c35-3bd3b4e96fcf","resolution":{"observed_at":"2026-08-09T10:46:29.602176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01243","last_updated":"2025-03-05T11:17:18Z","snapshot_observed_at":"2026-08-09T15:28:58.948037Z","submitted_at":"2024-12-02T08:05:26Z","title":"Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01243","snapshot_observed_at":"2026-08-09T10:46:29.605280Z","title":"Schedule on the fly: Diffusion time prediction for faster and better image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.605280Z"},"links":{"cited_paper":"/paper/2412.01243","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:1bb542a7d31c1a8923396020c1fbca9a4d25ae9272304388628557a5fd4cce6e","observation_id":"3a406da9-43db-4b6b-b7f1-9cb8a42e4270","resolution":{"observed_at":"2026-08-09T10:46:29.605280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-09T10:46:29.608228Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.608228Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:1f438c8319a38fbb66480fa5d777503c7700a76dc1d18d564eb22123c2e3f124","observation_id":"ebd32267-17fe-4703-b90e-a0b28354014c","resolution":{"observed_at":"2026-08-09T10:46:29.608228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07909","last_updated":"2024-11-08T06:19:33Z","snapshot_observed_at":"2026-08-09T15:37:28.200871Z","submitted_at":"2023-03-14T13:49:54Z","title":"Text-to-image Diffusion Models in Generative AI: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07909","snapshot_observed_at":"2026-08-09T10:46:29.611120Z","title":"Text-to-image diffusion models in gener- ative ai: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.611120Z"},"links":{"cited_paper":"/paper/2303.07909","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:692573df367729642c6096b4c3d40871fa3993f488112df1e2fc63da208a3451","observation_id":"72439b63-bdc9-42bb-bf5d-ac11f153215b","resolution":{"observed_at":"2026-08-09T10:46:29.611120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.614652Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.614652Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:0041eb79c69b7c3124565c2a004e7b6b994b7491d29291564849a54924ca84de","observation_id":"450f723c-a591-439f-95a7-4a682fd8655c","resolution":{"observed_at":"2026-08-09T10:46:29.614652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.617436Z","title":"A survey on personalized content synthesis with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.617436Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:e36f6abbec19115f600d1b4b588ad3307e29dfc5b92dce769572671f9a79f949","observation_id":"65158356-8f47-4256-b959-f77e707502df","resolution":{"observed_at":"2026-08-09T10:46:29.617436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02540","last_updated":"2025-02-22T16:29:03Z","snapshot_observed_at":"2026-08-09T01:39:40.569339Z","submitted_at":"2024-06-04T17:57:10Z","title":"ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02540","snapshot_observed_at":"2026-08-09T10:46:29.620727Z","title":"Vidit-q: Efficient and accurate quantization of diffusion transformers for im- age and video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.620727Z"},"links":{"cited_paper":"/paper/2406.02540","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:16f40f2d07e65f2115f091b05c0b652b17a4f36ee31659f6d2f5e86d22fb9ff5","observation_id":"7cdbc0f6-9940-4f43-a386-28a5475f1d57","resolution":{"observed_at":"2026-08-09T10:46:29.620727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16567","last_updated":"2024-06-12T07:16:21Z","snapshot_observed_at":"2026-07-06T16:53:39.713988Z","submitted_at":"2023-11-28T07:14:41Z","title":"MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16567","snapshot_observed_at":"2026-08-09T10:46:29.624096Z","title":"Mobilediffusion: Subsecond text-to-image generation on mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.624096Z"},"links":{"cited_paper":"/paper/2311.16567","citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:7995f15c3757af94b31165e4e04982727187116d2168286ab3476b483f13851c","observation_id":"05ce1640-800c-4717-97f1-40bc758d01ea","resolution":{"observed_at":"2026-08-09T10:46:29.624096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.259814Z","title":"Dpm- solver-v3: Improved diffusion ode solver with empirical model statistics","venue":null,"work_id":"7e4a6af3-6f88-4ce4-ab60-e295c753b1de","year":2023},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.627415Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:4be7de0f6d5a075753e82b8d4024a7b2d2d561882c444b59f7d50c806c12c684","observation_id":"cf07997b-b53d-4c9a-8985-0f8c7fabc346","resolution":{"observed_at":"2026-08-09T10:46:30.262870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.250391Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"59f6340e-49e6-4d59-8141-25c354eca8ce","year":2024},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.630373Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:61f3da568667caa1a0a28fdbe1369accecc440a78ca1abe0a294250a8ccb5044","observation_id":"3b8a40ab-2be7-4bfd-9aca-9995e0813d28","resolution":{"observed_at":"2026-08-09T10:46:30.253872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.239821Z","title":"Slimflow: Training smaller one-step diffusion models with rectified flow","venue":null,"work_id":"a2e60ea4-b81c-483c-97f5-dd4a9e108ee8","year":2025},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.633290Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:02dd80b6eaeeecdbc7deaec6da953969e9e9ce844757cd678b59c75a68465b29","observation_id":"c2c03a01-b1e0-4aca-aa7c-47f814db441b","resolution":{"observed_at":"2026-08-09T10:46:30.244253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:30.230163Z","title":null,"venue":null,"work_id":"5278e674-5168-42e0-a374-bed8955804fd","year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.637028Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:7e89518c8b329bf03e777774d1a8ef25b2c107039af7202ad2329c08ac0197e2","observation_id":"54e43f0d-4266-4184-85f0-f8e662045ba0","resolution":{"observed_at":"2026-08-09T10:46:30.233552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:46:29.578325Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T10:46:29.578325Z"},"links":{"citing_paper":"/paper/2502.04363"},"observation_digest":"sha256:7b64f959c38a82712fd9a8898b207b44a1ff27d497df64d1b32da97efc4bbafe","observation_id":"3c6a34cc-29a6-495e-80a3-9366d3de6440","resolution":{"observed_at":"2026-08-09T10:46:29.578325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04363","last_updated":"2025-03-31T07:22:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T15:29:40.182272Z","submitted_at":"2025-02-05T05:42:29Z","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 4 inbound Pith citation observations for arXiv:2502.04363."}