{"as_of":"2026-08-13T17:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66858fe3b301217f1997f1fc9a09bb13917148a78daaf8fcd3afb63510d9fe18","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T01:04:35.416676Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18966/citation-record","integrity":"/paper/2412.18966/integrity","json":"/paper/2412.18966/citation-record.json","paper":"/paper/2412.18966"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:34.891030Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.891030Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:0b8e42dd00712cc05b182f472cfe3de66c84c7f7d843a07912e89de677d196a0","observation_id":"4f93188e-2dfe-400a-946b-8444a5f851d3","resolution":{"observed_at":"2026-08-11T01:04:34.891030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.412254Z","title":"Lumiere: A space-time dif- fusion model for video generation","venue":null,"work_id":"68201319-31c6-4f01-ab05-5e3910ab06ee","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.899673Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:17caf6c6fb16b89d09316e0fafb8f44be3baca730cfbe3532a5672fbf0605140","observation_id":"2d506507-06d0-4fd2-8408-ee526a2c4173","resolution":{"observed_at":"2026-08-11T01:04:37.424442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.374380Z","title":"Improving image generation with better captions","venue":null,"work_id":"ad10c3a8-1159-4bb3-9102-aa9047109416","year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.909158Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:6f6f005ef9c9f7fe8725c87f2ddf5420a1a17064f16c51c69422dff1216212a4","observation_id":"65264e48-4f78-415f-93cf-24f23abd78c0","resolution":{"observed_at":"2026-08-11T01:04:37.391062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:34.916707Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.916707Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:9982ae960ed2f85e26706c15504be089bdef1a10d33bb86139c33c38c1085aec","observation_id":"7acdce46-e9ff-4954-84f5-bb8420c2d8ac","resolution":{"observed_at":"2026-08-11T01:04:34.916707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:34.924557Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.924557Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:d94cd9756685daaa0798e23a9c91f9162c051bf63afa20fdebdda7c0364124a3","observation_id":"1071c5b4-43d3-4666-ab46-58dc859088b2","resolution":{"observed_at":"2026-08-11T01:04:34.924557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:34.934310Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.934310Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:275240f3aee1c555bc3ee236ea9165710d73ee6effdedfcabd26bf6ccd9618e5","observation_id":"7f99b4b2-d725-4e7b-bdcc-969ce323ba1b","resolution":{"observed_at":"2026-08-11T01:04:34.934310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-13T01:39:12.659510Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-11T01:04:34.943735Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.943735Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:9a0a8da7d5c40c809a2f780473b1a43ac356370413e2e4cfddd247323c6e63cc","observation_id":"86ddf32c-274e-4583-bff1-365c83fb2e51","resolution":{"observed_at":"2026-08-11T01:04:34.943735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:34.954429Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.954429Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:e35ee6b80f7ded01e198ee0a2cd5ee58551e02877381477e83819f5f43686b15","observation_id":"9afefb62-49e9-4ccb-be21-a32ee5563526","resolution":{"observed_at":"2026-08-11T01:04:34.954429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.218909Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image syn- thesis","venue":null,"work_id":"3df283ca-9091-4b0b-a6d0-603ab7c63390","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.961354Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:fbc6eb03a5feeb2bd2739bda333960ec7e35c93ff21017aa12626c59de6dac15","observation_id":"cf650a6b-a6d3-4881-a51a-48b5312e9fff","resolution":{"observed_at":"2026-08-11T01:04:37.226592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.189901Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"b4c96e18-223b-4217-b58a-2ad8dfdc4e40","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.968168Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:83570dc9d724ecf20c784695e2862d95fd95e14f1cf67c11ece38a81556b0b2f","observation_id":"5e5f47e3-c7d1-43b0-a32b-271cabe9a253","resolution":{"observed_at":"2026-08-11T01:04:37.198557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.127403Z","title":"Contin- ual pre-training mitigates forgetting in language and vision","venue":null,"work_id":"6a069873-4551-41e8-81f9-fbad00f5ed79","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.977168Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:880f95bb2612398eec463aaab7d3c59f5ac2d27ca4a47731e63dc5b35432cdeb","observation_id":"1857c1e7-f202-4dc7-b3bc-572ceb3da728","resolution":{"observed_at":"2026-08-11T01:04:37.141649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.082639Z","title":"A continual learning survey: Defying for- getting in classification tasks","venue":null,"work_id":"71442884-86a6-45e1-b0fb-cb2d10b969ef","year":2021},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.986248Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:abf86883af034d7dfd93a2f72b680eaf91fdccaa86c4fa2f4a85db0587e8fabb","observation_id":"d5edb5ab-538e-4b8e-ae38-07867dbf59e8","resolution":{"observed_at":"2026-08-11T01:04:37.090386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.041450Z","title":"Irc- gan: Introspective recurrent convolutional gan for text-to- video generation","venue":null,"work_id":"0fc332bd-a81c-4046-a549-4b3b2527bfae","year":2019},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.999548Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:b400a5792b383a9652d5466708c0be1beeba427347727eba4b808d6c330fd605","observation_id":"6115f435-d074-4e1d-a2e9-6d24a305a36d","resolution":{"observed_at":"2026-08-11T01:04:37.054938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.005077Z","title":"Catastrophic forgetting in connectionist networks","venue":null,"work_id":"eece2c18-1af3-43c7-9e94-7d77eb356f6e","year":1999},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.009018Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:37bea58df1550e955520e32b86d87cad9ebe07573fc307a75a920d53230ced23","observation_id":"8b915457-2b3e-463a-8ebf-507109f939a3","resolution":{"observed_at":"2026-08-11T01:04:37.020898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.971428Z","title":"Videostu- dio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"b28e8fbe-ac7c-4411-81dc-7db86467ff31","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.020241Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:f7b5844a4bbafdc54c564bba16ef4c16dbe1071e1ec7e3189e66f75f741d30a5","observation_id":"eb0f6510-8aa8-4672-9a72-3c07a375f1bb","resolution":{"observed_at":"2026-08-11T01:04:36.979001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-13T00:10:49.002216Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T01:04:35.030224Z","title":"Lumina-t2x: Trans- forming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.030224Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:cbaeb817f8a0ebbf7941d4717f8edafbe9c883ae7dbba1003a97c7f57612dbfb","observation_id":"c5a220a6-cc78-4066-bc0d-e24c36358e57","resolution":{"observed_at":"2026-08-11T01:04:35.030224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.943409Z","title":"Preserve your own correlation: A noise prior for video diffusion models","venue":null,"work_id":"ebd653b9-d92d-4313-b0a3-9c21c5244ebc","year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.038115Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:f6b6d61e4c9d67e080fc9549dd31d2059c5e66175b6587db4e31a961010079d6","observation_id":"9b0f21a0-c469-4180-8caf-89b54035d244","resolution":{"observed_at":"2026-08-11T01:04:36.951409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-11T01:04:35.050124Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.050124Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:cf6c5a1cad1a33d80b2fdad8db9bf65c32ef040dd006454c840084a4c439583d","observation_id":"dbf4ee18-95f0-4d83-9c83-80c374b26fb5","resolution":{"observed_at":"2026-08-11T01:04:35.050124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.056511Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.056511Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:deb33aff0846ce87dabbf4e6c65fdecc40a2ff92ec71f025b09542fb1b108694","observation_id":"6ae13927-af9e-4072-9a43-94d2677e0788","resolution":{"observed_at":"2026-08-11T01:04:35.056511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.877824Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"fa318155-22e6-49e0-9c24-97e2ba08dd37","year":2025},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.068618Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:461d02a96a9e5ea78193fce71a117d30e83733e26a3be5c1a4243af19f94909f","observation_id":"e2eb497d-0d51-4551-bac0-1f4449f9b56d","resolution":{"observed_at":"2026-08-11T01:04:36.901018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-11T01:04:35.077390Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.077390Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:c644da314638dc74fa9058511c5e5089304cd200ff85c178f18bb56fdbc875a5","observation_id":"54c4ca97-239e-448c-8ed0-cd1d32be011a","resolution":{"observed_at":"2026-08-11T01:04:35.077390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06940","last_updated":"2023-07-13T17:57:13Z","snapshot_observed_at":"2026-08-13T10:55:57.187521Z","submitted_at":"2023-07-13T17:57:13Z","title":"Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06940","snapshot_observed_at":"2026-08-11T01:04:35.082441Z","title":"Animate-a-story: Storytelling with retrieval-augmented video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.082441Z"},"links":{"cited_paper":"/paper/2307.06940","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:ab9bfd99cd57b65c885a3f5104395b9f0c9acb43bbe0943bdfdcf479cb8a3f40","observation_id":"65b639a6-8f91-43ad-8743-471ad106b4f3","resolution":{"observed_at":"2026-08-11T01:04:35.082441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19334","last_updated":"2024-06-09T11:34:12Z","snapshot_observed_at":"2026-08-12T23:54:55.050912Z","submitted_at":"2024-05-29T17:59:20Z","title":"LLMs Meet Multimodal Generation and Editing: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19334","snapshot_observed_at":"2026-08-11T01:04:35.095299Z","title":"Llms meet multimodal genera- tion and editing: A survey.arXiv preprint arXiv:2405.19334,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.095299Z"},"links":{"cited_paper":"/paper/2405.19334","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:080da1bc4b35219bc22dd732115168399b16b62082dee5439d68a04b1759d80b","observation_id":"4c28b58e-12cf-4e74-b374-64c44e730325","resolution":{"observed_at":"2026-08-11T01:04:35.095299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T01:04:35.105992Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.105992Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:b6b88a37575d26dd00dc330c2ffa0dbf562bc46539fee068eefdf9e16aa002cf","observation_id":"0ef79add-b938-4221-b8c6-13b346135884","resolution":{"observed_at":"2026-08-11T01:04:35.105992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.115211Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.115211Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:d3e21400fda3556990ca9f9e49893fcb09e1b71859b1c30ecf0931dc83f3198f","observation_id":"6502a7d2-95b9-479f-87be-87b053ff6552","resolution":{"observed_at":"2026-08-11T01:04:35.115211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14330","last_updated":"2024-02-06T18:44:30Z","snapshot_observed_at":"2026-08-13T11:35:17.248136Z","submitted_at":"2023-05-23T17:57:09Z","title":"DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14330","snapshot_observed_at":"2026-08-11T01:04:35.123565Z","title":"Direct2v: Large language mod- els are frame-level directors for zero-shot text-to-video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.123565Z"},"links":{"cited_paper":"/paper/2305.14330","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:1d3d111aeb037fb4580715bce27568da8991e92a985e3acdde8beddb85e7dfc9","observation_id":"6b1d7871-dc3a-42d5-9900-de618ddb4c2c","resolution":{"observed_at":"2026-08-11T01:04:35.123565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.129333Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.129333Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:03555a0e55a942645b74a954a824b02ca871391f2f5bb3f0329d1bcd4ddc09b0","observation_id":"6df7b4bc-64e9-4b8c-ad73-677bb985d473","resolution":{"observed_at":"2026-08-11T01:04:35.129333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.797451Z","title":"Lora: Low- rank adaptation of large language models","venue":null,"work_id":"bd7b1056-cbca-4825-8340-6df552d46939","year":2021},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.136837Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:ea62dae68b267ba2b9429ea7c2110bcbadd7290e28d5461350ff3eab7f57338b","observation_id":"cfa864c4-37bc-4e12-8618-5eb4d23d8d6f","resolution":{"observed_at":"2026-08-11T01:04:36.814147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.754592Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"76c1085d-3b97-4915-b7ce-12b07d9376d9","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.142817Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:7523acf7bbb5082c5c8976510e9f5d229d670d6d126b999649d80f9d11f4c65e","observation_id":"e25e9399-74f3-4834-82c9-e216993040ef","resolution":{"observed_at":"2026-08-11T01:04:36.774461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-13T00:54:55.069129Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-11T01:04:35.150244Z","title":"Simple and scalable strategies to continually pre-train large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.150244Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:058a3571d3e883325d43318f5dc437a7345479b9eadc9bb6d71813c18993537f","observation_id":"a122b23e-ac11-46a5-a1ea-d759b41a5827","resolution":{"observed_at":"2026-08-11T01:04:35.150244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.731152Z","title":"Continual pre-training of language models","venue":null,"work_id":"a8906959-5854-49b6-9c5c-5347b78e7853","year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.170485Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:cbec5618287dfce66263e4b68764f5f502432f0d1ef64cd9417d3201d7732fd6","observation_id":"e0065cca-0473-4b6e-826a-66aa850c447e","resolution":{"observed_at":"2026-08-11T01:04:36.738658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.184878Z","title":"Open-sora-plan, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.184878Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:9461bd3d9676ea92ec7a7d623c7e39a49bf0e47a45d99cf63f333c169d7310de","observation_id":"17de3f09-e731-4c82-8bc1-b9407b894cb5","resolution":{"observed_at":"2026-08-11T01:04:35.184878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.197675Z","title":"Llava-next: Tack- ling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.197675Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:b8f636a7339f112605f9e9597ef6eee1de34c31bc361bcff795c17e8e77d632e","observation_id":"83037e88-3364-4874-9c81-06457a5e886b","resolution":{"observed_at":"2026-08-11T01:04:35.197675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.206474Z","title":"Video generation from text","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.206474Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:38488393a2e2f4adfb859779e27cc5f973425d556485ab5dca10b7b874cecb3b","observation_id":"99fc34b5-5ff3-4507-b61a-ceae3cb6d0ce","resolution":{"observed_at":"2026-08-11T01:04:35.206474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.618215Z","title":"Llm-grounded video diffusion models","venue":null,"work_id":"a1b42684-b002-41a2-bbb1-9c87935f8a51","year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.223224Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:1d82b95cee580025c03db00680e089653fee26259d3e6231f7073dfaef85dcf5","observation_id":"b1a42560-6736-442a-9285-dbd368053cf5","resolution":{"observed_at":"2026-08-11T01:04:36.630561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-11T01:04:35.230155Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.230155Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:4abd5ed14d564c78ccfdeb46a122b7c88be4787e636a9110a3d32f7773522cff","observation_id":"f69a88bc-708c-4782-a945-7b7a06fc6934","resolution":{"observed_at":"2026-08-11T01:04:35.230155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.240530Z","title":"Snap video: Scaled spatiotemporal transformers for text-to-video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.240530Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:5030a380664f8dbc2da6bebcb187c6aedc7c842cee381c7dc49b537f8e6eb1c0","observation_id":"e6ca6569-8f76-452c-8ac1-19b4e607729b","resolution":{"observed_at":"2026-08-11T01:04:35.240530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.563232Z","title":"Sync-draw: Automatic video generation using deep recurrent attentive architectures","venue":null,"work_id":"92d75f66-470f-458b-9859-a0b9a4734758","year":2017},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.256364Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:882e426306cc04e3768da4fcf1bf84521f278d07358d51f745ccdef7305195a5","observation_id":"b69fd12d-e3c1-4381-8baf-34053845f54d","resolution":{"observed_at":"2026-08-11T01:04:36.572032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.263136Z","title":"Jour- neydb: A benchmark for generative image understanding,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.263136Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:53ddfa2d2dc0d6065d552e4dac2a6dda46e30c6a902e659715ec6bfe0ee03ac6","observation_id":"5128715b-3fb4-45e2-a9ef-496d73edf303","resolution":{"observed_at":"2026-08-11T01:04:35.263136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.270449Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.270449Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:c52309936666b91819d1a45080a8904c54a464ff00173b2011a52b06364bd180","observation_id":"f19c022c-0c68-418c-b541-b8aee8e2c3c4","resolution":{"observed_at":"2026-08-11T01:04:35.270449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.278274Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.278274Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:10b56541dae833bbd7f29fce1275122fa59f4d47d35e9e34de28f81ab8d19be5","observation_id":"8a78e60a-17bf-43ac-8009-6d75cfc50cf4","resolution":{"observed_at":"2026-08-11T01:04:35.278274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.467437Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"558d47b2-cd77-4e16-a5f5-43c0857847c6","year":2020},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.282958Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:4be1e829311ee52593ab937cccbb4e69218626469bc917b0d3912555c80ed4bf","observation_id":"b467d429-bced-4f93-830d-1607b803caee","resolution":{"observed_at":"2026-08-11T01:04:36.483662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-12T23:18:27.584752Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-11T01:04:35.287887Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.287887Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:ad918144a170ce2cd5fb4eeb4db3ab7dac33368f4946f6b7fcf7210ff81220b8","observation_id":"3da6630f-6637-41ae-a223-0035c167fc5e","resolution":{"observed_at":"2026-08-11T01:04:35.287887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-11T01:04:35.295977Z","title":"Generative pretraining in multi- modality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.295977Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:22ed437b37cb321f0c3cba7cbed67b15bb2fd955a4a251b2a97734c0ca026e8a","observation_id":"19552679-5593-49c2-9c43-f928984dc853","resolution":{"observed_at":"2026-08-11T01:04:35.295977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.427735Z","title":"Generative multimodal mod- els are in-context learners","venue":null,"work_id":"92dab650-9d66-435e-abb2-e03582b14555","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.304811Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:9cbd2bd2ec47cf4408d63de22de72d5a23bcecf023e38d05ef2d0313e228bfaf","observation_id":"e4111d41-5972-45a6-9894-bab94533913a","resolution":{"observed_at":"2026-08-11T01:04:36.435782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.316897Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.316897Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:d61defd65726ff78303aa73856d3c84d9d8e2fa34aceb7af8fd4e0d6e772a9c9","observation_id":"c01c39a3-e640-4fb8-9888-02961b128f2f","resolution":{"observed_at":"2026-08-11T01:04:35.316897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.371846Z","title":"Magicvideo-v2: Multi-stage high-aesthetic video generation, 2024","venue":null,"work_id":"97954e2a-0e78-45c3-85ed-dfde6d85a245","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.323886Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:2ea23e579133b2deec907c2787c58ba8f7c9c7b87578108e2aaccea6ce7fa01c","observation_id":"c7c2b8c9-8e60-4fe8-81f9-03bfbb476481","resolution":{"observed_at":"2026-08-11T01:04:36.384581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06762","last_updated":"2023-10-10T16:38:49Z","snapshot_observed_at":"2026-08-13T05:52:51.911336Z","submitted_at":"2023-10-10T16:38:49Z","title":"TRACE: A Comprehensive Benchmark for Continual Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06762","snapshot_observed_at":"2026-08-11T01:04:35.334537Z","title":"Trace: A comprehensive benchmark for continual learning in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.334537Z"},"links":{"cited_paper":"/paper/2310.06762","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:bc194de8b6b83340f6af4fbb21d49d60e8696c7d2d6d13f453678c958ec883ff","observation_id":"31901252-b885-434a-9e13-e2a4b7f0fde7","resolution":{"observed_at":"2026-08-11T01:04:35.334537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T01:04:35.342459Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.342459Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:58dae00e2b5231aec59686d1141179ecffd7d1366632ecb3dbeff1164dad75a9","observation_id":"1c90472d-1505-4b1b-8dbc-f0ea85c79723","resolution":{"observed_at":"2026-08-11T01:04:35.342459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-13T10:04:30.993324Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-11T01:04:35.349663Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.349663Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:8cac0c571921660b44112e0457f4b40e68d3460562d12e99a24e4a192f14cfd6","observation_id":"ef30cbfb-6a67-4517-b548-ff8ac4c01afd","resolution":{"observed_at":"2026-08-11T01:04:35.349663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.319622Z","title":"LLaMA pro: Progressive LLaMA with block expansion","venue":null,"work_id":"a4df178f-2905-4a95-9308-5b2174345312","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.358531Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:5949a380c033da97c2a5c46bdb09de469519f074af3b873500dd42ac84a28974","observation_id":"1d6f23ce-6dc9-4cd2-a31e-5259de3f0449","resolution":{"observed_at":"2026-08-11T01:04:36.330890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.271813Z","title":"Vript: A video is worth thousands of words, 2024","venue":null,"work_id":"11c3f107-3e3b-4cac-aa7b-5616a34562e4","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.367105Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:be3a76f6b890feccf2740ba0036fc2c877f8c7546af755b75cbc5953de0c71a1","observation_id":"cf330d11-9aa7-4b63-85bd-0c51fcab8702","resolution":{"observed_at":"2026-08-11T01:04:36.288520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T01:04:35.377149Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.377149Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:0b52b8afb67ca5c435180bab6e62ca52db8d920353f6cab42648cef013806482","observation_id":"c755604e-2b24-4701-8e21-fe7597d3bb59","resolution":{"observed_at":"2026-08-11T01:04:35.377149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.240544Z","title":"Language model beats diffusion-tokenizer is key to visual generation","venue":null,"work_id":"b63ac600-08bf-48fe-9dfc-278b06e38571","year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.385041Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:6c933630f01a0605fab28eb2efe3ff1a32fa0ee8fe2c3393411df221e0f7e04a","observation_id":"5cc165ec-c1aa-4c8b-8db4-733edfaaf277","resolution":{"observed_at":"2026-08-11T01:04:36.250826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15818","last_updated":"2025-05-30T03:55:20Z","snapshot_observed_at":"2026-08-13T10:03:45.103373Z","submitted_at":"2023-09-27T17:44:18Z","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15818","snapshot_observed_at":"2026-08-11T01:04:35.396189Z","title":"Show-1: Marrying pixel and latent dif- fusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.396189Z"},"links":{"cited_paper":"/paper/2309.15818","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:051c4fa8ccee0b91068dc241ea84ca7f4af57c8d3413ce36c6a934a4861b46da","observation_id":"8f96385c-1f72-4902-8aac-1f7e543c5e7c","resolution":{"observed_at":"2026-08-11T01:04:35.396189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.204694Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"a2d09950-11a3-499c-a87d-1f215632316c","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.406134Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:0e8d1a5ce578fec4d33ca7b37d272ff36dfe4abca1b901898bb2280f87a5269d","observation_id":"cb8924cb-da26-4933-a0ca-c805c9a3a61e","resolution":{"observed_at":"2026-08-11T01:04:36.218328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-11T01:04:35.416676Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.416676Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:bcfcb767dc1156b080e944ee01f36cda1908f645c8e43e87acc0acc6240c32fd","observation_id":"e05f910e-1c09-4a7a-834a-311f74a36604","resolution":{"observed_at":"2026-08-11T01:04:35.416676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2412.18966."}