{"as_of":"2026-08-15T22:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:266dbb734c7cfb264e9a987fd8104da35a5816fe6fa80ca7928b970c0875129d","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:41:46.943342Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.07647/citation-record","integrity":"/paper/2501.07647/integrity","json":"/paper/2501.07647/citation-record.json","paper":"/paper/2501.07647"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T20:41:46.661593Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.661593Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:1dd3241a0d2fb2945d6543ac8f7ce442dc6429c1de9fd92aa2d2d9f55381d308","observation_id":"4b6e5f49-3636-464c-85e6-6c87130acc2b","resolution":{"observed_at":"2026-08-10T20:41:46.661593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.935876Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"ef6da9f6-fe91-46f0-a27e-e1be048fff3d","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.668067Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:effb1cb6746285cc9f96174567159f0ed38ed64e51e05a6a3ba1b4594f91a774","observation_id":"98b22be7-b64b-49b6-bb56-d74b7c0df6e8","resolution":{"observed_at":"2026-08-10T20:41:47.940970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-13T01:39:12.659510Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-10T20:41:46.673882Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.673882Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:4108c0e7e68efca914a55853dc391b1d4c24fbf4af84d1558ca077d644466816","observation_id":"631277c9-2b1b-4913-9743-51ef281ec728","resolution":{"observed_at":"2026-08-10T20:41:46.673882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.918012Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models","venue":null,"work_id":"1f87a111-7583-4741-9b18-0c7c7aba45cc","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.679977Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:3caca8ff67ddd4e4c01d56b3e073a07a0f763d6e592a64c0a860ab274f9dd9bd","observation_id":"982eb44b-35c5-4c2f-bacf-68319494733f","resolution":{"observed_at":"2026-08-10T20:41:47.924160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.685336Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.685336Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:0dc4de42eb724e68465cd09441d0b3af22b3d797bb32fee5a9411474fd47d249","observation_id":"1c833fd9-240e-4cdc-b39b-776bf5163bc5","resolution":{"observed_at":"2026-08-10T20:41:46.685336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.889091Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"97503374-d274-4277-b699-f23862abab79","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.690463Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:c76685d7e186b8214710da4030ee16f91f435645540227a3881b85b934d813f8","observation_id":"3db8ca74-d25a-4698-b9b4-01745dd7cbac","resolution":{"observed_at":"2026-08-10T20:41:47.894451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.695844Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.695844Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:c8d51bfbacb41940173a097e3d9ab3e202696d6187fe36496bded98741f02945","observation_id":"62167b68-ea64-405b-95cd-b3d5386b4fcd","resolution":{"observed_at":"2026-08-10T20:41:46.695844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-10T20:41:46.702000Z","title":"Tc-bench: Benchmark- ing temporal compositionality in text-to-video and image-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.702000Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:d7afa56df5b559cf9c989007b0d527c1ff0b5b2ea65a694fbe18c1df8d935b27","observation_id":"491fb305-9892-4bae-a1d2-045effcab649","resolution":{"observed_at":"2026-08-10T20:41:46.702000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.859771Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":"556745cb-1a57-4e00-8618-bef39a7b7d22","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.707689Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:8270afe704aec1f9c5d9287a220bd3a8360209b4496ef98bccf229bff7bc956c","observation_id":"aef14e19-ec4e-4cf6-a00e-429c19d20942","resolution":{"observed_at":"2026-08-10T20:41:47.865422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.841191Z","title":"On the content bias in fr ´echet video distance","venue":null,"work_id":"7233d1c2-d05b-43b4-9078-1dd8700ece79","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.712470Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:edf3e2b60173194e6665e8ba4a9593eec1ef57dbba402d30397481205f943cbb","observation_id":"6f1c1714-89cf-4df0-a3f1-5849036a0d2a","resolution":{"observed_at":"2026-08-10T20:41:47.847242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-10T20:41:46.717039Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.717039Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:7ead31fe9c21d038958f974156c41dd934d8b55a8d7ccc7f54b79fd8830dd95c","observation_id":"6e6a0b24-f824-4afb-b223-96d9176a029d","resolution":{"observed_at":"2026-08-10T20:41:46.717039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.722487Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.722487Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:aa29b7938d7779e6dbe87566bd913196544a90af2f79fd7ecf482845a041d732","observation_id":"f14832ef-e18d-4d32-a077-8c94087197b6","resolution":{"observed_at":"2026-08-10T20:41:46.722487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.812574Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":"b9c05fa3-98f4-4255-b136-9c43ce52d649","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.727435Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:55dcb6540d02e4245b26ef73493cc6f099fddf2dc2f7a5adba04db0af5695735","observation_id":"a509f378-ab9a-4a66-b701-430e417f8341","resolution":{"observed_at":"2026-08-10T20:41:47.818003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-10T20:41:46.732481Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.732481Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:7b20c1217657457d2b7a994807deeb0fd602245facb25b70f5599ddeaa64f053","observation_id":"b512f7f3-1b04-4d41-99d7-6e620314bd92","resolution":{"observed_at":"2026-08-10T20:41:46.732481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.796483Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"f592625d-a56a-49b1-94f1-610a03313755","year":2019},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.737703Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:343e52592e7af6b8c254402e1951768fca8b4e30c2f2b96346aa2f87b07cb710","observation_id":"c315cf22-2268-4589-8112-96615752f09f","resolution":{"observed_at":"2026-08-10T20:41:47.801856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.779751Z","title":"Open-sora-plan, 2024","venue":null,"work_id":"a5eb679c-f0dd-401b-857b-daa30ca62283","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.743338Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:ce90ea046e3918c4af6e37d6b806f193621055552a2da637708c60db6508229a","observation_id":"0ea4ed25-7e74-4691-ac5a-8e870a1ef29e","resolution":{"observed_at":"2026-08-10T20:41:47.785045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.763260Z","title":"Dense optical tracking: Connecting the dots","venue":null,"work_id":"f5e2d758-11c2-4f5e-9bee-2386dd87fc55","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.748409Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:a99de7b593c3c31c1c72d144641630fe2b3d4f67d5ed17f64b288c0892a021a7","observation_id":"f326661a-2d8c-4cec-935a-a19fc11da731","resolution":{"observed_at":"2026-08-10T20:41:47.768539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18750","last_updated":"2024-10-11T07:50:49Z","snapshot_observed_at":"2026-08-14T11:05:26.691265Z","submitted_at":"2024-05-29T04:26:17Z","title":"T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18750","snapshot_observed_at":"2026-08-10T20:41:46.753046Z","title":"T2v- turbo: Breaking the quality bottleneck of video consis- tency model with mixed reward feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.753046Z"},"links":{"cited_paper":"/paper/2405.18750","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:c1af7e194495c186378c27a3f38f91cb8073dcbfdd579f59b4c08c57dc577b8e","observation_id":"4f48b987-b94a-4382-80d7-4a9ce3047b56","resolution":{"observed_at":"2026-08-10T20:41:46.753046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00651","last_updated":"2024-03-20T17:28:02Z","snapshot_observed_at":"2026-08-13T05:12:22.810775Z","submitted_at":"2023-12-01T15:24:38Z","title":"TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00651","snapshot_observed_at":"2026-08-10T20:41:46.757694Z","title":"Trackd- iffusion: Multi-object tracking data generation via diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.757694Z"},"links":{"cited_paper":"/paper/2312.00651","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:fd817969cfa9a492bd89c4fbcc7c4ea063a4b5b23549c0853085888a1a813086","observation_id":"28659284-8aa8-4c06-ab70-20953d6fe2ce","resolution":{"observed_at":"2026-08-10T20:41:46.757694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.746462Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"067c72d9-8fed-40f9-a2a1-e6d9cf411168","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.763002Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:743a3c02e2314e8a4b645eb7211b8f8b8a5a4912de6301dc7e271f2f94cbacd2","observation_id":"2205b1eb-5f02-41b9-bafa-78dd3044cfba","resolution":{"observed_at":"2026-08-10T20:41:47.751990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.730571Z","title":"Llm- grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models","venue":null,"work_id":"71544636-3f7c-4a80-a062-c137ec64fcea","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.767551Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:ea42f1733d948fd90446bd1ba771c15dcb67af4f467a1d8293d616f3442aa17e","observation_id":"63ba12ee-8134-4f6c-821f-c4423f069a4f","resolution":{"observed_at":"2026-08-10T20:41:47.735277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.712184Z","title":"Llm-grounded video diffusion models","venue":null,"work_id":"fc9829df-2394-445b-89c4-b3bf418adb55","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.772368Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:37d8d9979b17273ee76d41a139954fcddf7a447793faa3ae061c49a33aae9678","observation_id":"98d54c78-f21b-462e-af0b-3d79843d08ec","resolution":{"observed_at":"2026-08-10T20:41:47.718723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15091","last_updated":"2024-07-12T18:03:29Z","snapshot_observed_at":"2026-08-15T10:22:29.321993Z","submitted_at":"2023-09-26T17:36:26Z","title":"VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15091","snapshot_observed_at":"2026-08-10T20:41:46.777075Z","title":"Videodirectorgpt: Consistent multi-scene video generation via llm-guided planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.777075Z"},"links":{"cited_paper":"/paper/2309.15091","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:5f3c7d44d5325dd0422bfbfc94a9ee9f377d977e1b4fd0792daa1085794cab8e","observation_id":"79d97a22-8d0e-4683-a42c-1cbf14c23562","resolution":{"observed_at":"2026-08-10T20:41:46.777075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05338","last_updated":"2024-10-22T04:22:16Z","snapshot_observed_at":"2026-08-12T23:47:28.499464Z","submitted_at":"2024-06-08T03:44:25Z","title":"MotionClone: Training-Free Motion Cloning for Controllable Video Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05338","snapshot_observed_at":"2026-08-10T20:41:46.782104Z","title":"Motionclone: Training-free motion cloning for controllable video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.782104Z"},"links":{"cited_paper":"/paper/2406.05338","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:d98c3beff3b9ac1e809b79734ace4e4c0186514edfcfc2ec5674e30f3d5168f2","observation_id":"1ca446ca-1ebd-4616-90ab-485c5903ad16","resolution":{"observed_at":"2026-08-10T20:41:46.782104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.692544Z","title":"9 Blobgen-3d: Compositional 3d-consistent freeview image generation with 3d blobs","venue":null,"work_id":"e4033475-317d-4a65-94eb-61f1daf89c97","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.786747Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:3c13cd6310249bd24eb4c15141bdaccfd254ab26b9886ec78e4e25ff9f13c073","observation_id":"9cd566d9-8960-433c-84e1-b57251091fef","resolution":{"observed_at":"2026-08-10T20:41:47.698845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.674745Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"1e9bfbec-fd6b-4a7f-b615-8fbc28a5ef7c","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.791106Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:5b29e49665eaf558c30222a71bd6b95a176d266a6eeacde59afa142547867a70","observation_id":"e8486c0f-a363-4208-a11c-460b454bed70","resolution":{"observed_at":"2026-08-10T20:41:47.679691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-10T20:41:46.795590Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.795590Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:71dbd0ab6f5690cc94f45f65a4b7f11bdab8a17f9034f14d29bac2c96f7a9e5a","observation_id":"0e5f15a6-bbf0-4b47-9d48-ff02b26a31f0","resolution":{"observed_at":"2026-08-10T20:41:46.795590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.657652Z","title":"Evalcrafter: Benchmarking and eval- uating large video generation models","venue":null,"work_id":"7bdc2576-3f51-4676-a277-681667ce28e8","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.801884Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:a7c0743fdea80fdb555b64cbb7b761607666acc7c076a6ecc6ab1a96d7f42dc0","observation_id":"725a678a-e2aa-42c1-bcc8-e348297e1adb","resolution":{"observed_at":"2026-08-10T20:41:47.662749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.640516Z","title":"Fetv: A bench- mark for fine-grained evaluation of open-domain text-to- video generation","venue":null,"work_id":"ce8fff09-b5ec-4045-8e16-1826d1c6dbe9","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.807182Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:35b0d90e2cb935056fe46dab029322674f14b91ecadf70554c1f6cbb098e340f","observation_id":"935fbd6d-8b40-454a-9c1a-3a63c044764a","resolution":{"observed_at":"2026-08-10T20:41:47.646108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-10T20:41:46.812519Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.812519Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:b4e21e1d004e9b8aac547fcf2db08ac362bc47f12929c915926b983db5205f6b","observation_id":"60011944-a7c1-480e-9db9-e76d8c7bf9bd","resolution":{"observed_at":"2026-08-10T20:41:46.812519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.623143Z","title":"Compositional text-to-image gen- eration with dense blob representations","venue":null,"work_id":"0c80b80b-d157-4964-bfa8-44208db75d46","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.817879Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:b8a127e48f266c72c6927399620d78eedd3cae1e9820256ab319ed91d15d037f","observation_id":"05fafea7-0cf5-4277-9f27-4771e99299a0","resolution":{"observed_at":"2026-08-10T20:41:47.628927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.822782Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.822782Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:85accf3ca6ced9849aa0922f35313d5f44d1285c6f2c26bbac6882f7db2b3cd7","observation_id":"2d717236-49e6-4c5e-ba08-857d2cbaa3eb","resolution":{"observed_at":"2026-08-10T20:41:46.822782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-10T20:41:46.827788Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.827788Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:60907a2aaa4a5eda1b09d49d10e15fdb3ca6ca49ba7f5bd6c2bb18b099d62e95","observation_id":"13761c41-a74a-434e-8e8f-72247be31bd4","resolution":{"observed_at":"2026-08-10T20:41:46.827788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.833115Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.833115Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:8915c692b0f9f603cd6511f123713502cbd2e89eebe8628146c13edfd918866e","observation_id":"6873bc93-5efe-403c-87a4-62149957d438","resolution":{"observed_at":"2026-08-10T20:41:46.833115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-14T09:31:46.610962Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-10T20:41:46.838351Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.838351Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:aa56ad92eba656eb3344f8ae48b17ade4ae4d623a5fd03e2cffd27d771ac73fe","observation_id":"62089b14-6a46-4765-b1c9-f1f6b602a0d2","resolution":{"observed_at":"2026-08-10T20:41:46.838351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-13T15:06:39.861200Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-08-10T20:41:46.844463Z","title":"Vidgen-1m: A large-scale dataset for text-to-video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.844463Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:19e8bcdf366bb969f6f8b3a5e445f698568f79bd241eab7bd3eac3fc0bfb1e52","observation_id":"5aa572ee-3d91-417c-9f34-4d0026793aa7","resolution":{"observed_at":"2026-08-10T20:41:46.844463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.850622Z","title":"Fourier features let networks learn high frequency functions in low dimen- sional domains","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.850622Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:2b7d2859e31ecdccfd67d240f817e5e401d94708e61d10b348b73642ee697dcb","observation_id":"14c488e3-40ff-4233-a5a9-a8794e84021b","resolution":{"observed_at":"2026-08-10T20:41:46.850622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04277","last_updated":"2024-10-14T07:20:01Z","snapshot_observed_at":"2026-08-13T06:05:51.161533Z","submitted_at":"2024-06-06T17:25:33Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04277","snapshot_observed_at":"2026-08-10T20:41:46.855840Z","title":"Videotetris: Towards compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.855840Z"},"links":{"cited_paper":"/paper/2406.04277","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:3d1e00e5a12b42620e8171153f3cc730c2e0dc09d73fbdaa3d0ea97eaca1a7f9","observation_id":"ac317e7e-1472-4e97-b502-6692c27daa47","resolution":{"observed_at":"2026-08-10T20:41:46.855840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-15T00:26:15.250313Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-10T20:41:46.861690Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.861690Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:c2f37e28addb26611f9bf417462cc0f7f71730b6d1a516caa7a5e56f080e8a04","observation_id":"6fa053de-4929-4f99-af7b-6c46cfe7c4d7","resolution":{"observed_at":"2026-08-10T20:41:46.861690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.573192Z","title":"Score-based generative modeling in latent space","venue":null,"work_id":"02e069c0-aca2-4e6b-9bb7-737c5a6af0f6","year":2021},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.867718Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:a9509c2d57fa81dc2481d2efb2cdda5bacc749d9f24fa1c259335ace4292cdeb","observation_id":"42f5a13b-4a3e-41a6-840e-c7eb99a4043d","resolution":{"observed_at":"2026-08-10T20:41:47.578327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-10T20:41:46.872600Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.872600Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:34e7829689036d45a558f4c005bb085b23e97afe9268c890d028c0d60f0b7470","observation_id":"8e568363-7a99-4ff4-88c9-4ab15332b295","resolution":{"observed_at":"2026-08-10T20:41:46.872600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.556967Z","title":"Boximator: Gener- ating rich and controllable motions for video synthesis","venue":null,"work_id":"29ae649a-5ae7-45b1-84a2-441d0991f212","year":null},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.877786Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:1a401ec8d75209aff71cc28ab8db6b7573837a8e61c0735c2b791649aa80893d","observation_id":"c1ce706c-3b10-4e44-bc29-965b62ff289c","resolution":{"observed_at":"2026-08-10T20:41:47.562145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-14T11:04:59.421484Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-10T20:41:46.883364Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.883364Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:bdda3366efbad9b135c6d1452902e32e5b18f5339f506f47be6552e9c1532857","observation_id":"237149c0-cfe4-4a60-b919-c6db8fe2eca8","resolution":{"observed_at":"2026-08-10T20:41:46.883364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.888799Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.888799Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:14c164f7bb197e78b95f46287cbe62e4711c12c7f41f276154cf43cc96321571","observation_id":"f9b1cfec-798c-4e18-b41d-b42376453dfd","resolution":{"observed_at":"2026-08-10T20:41:46.888799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.530938Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"b33da2dd-7bfa-487c-822a-3bec614fd804","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.893683Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:7d82e335a7c28aea3d85fe13a8c28147cff91039a680bb239b3124c540cb861a","observation_id":"a6d7aa9d-038b-4415-9fa3-c9886b3c3a7f","resolution":{"observed_at":"2026-08-10T20:41:47.535970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.514316Z","title":"Ad- vancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"94c69be7-5fa8-4041-990f-40d27e1039e1","year":2022},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.898852Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:48141b578976bdc31e2d279b6a853507a902bab0683ea50d06180643f2f59c62","observation_id":"29c53d94-d326-43b2-bc10-7c6520361e72","resolution":{"observed_at":"2026-08-10T20:41:47.519590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.497783Z","title":"The 3rd large-scale video object segmentation challenge - video in- stance segmentation track, 2021","venue":null,"work_id":"c281d6f3-7b00-409e-a35f-6bd2d0096537","year":2021},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.903448Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:42f43e57bcc53699acd4bb1050e891112b8b347a24d83826518915523f42555e","observation_id":"ff31b245-ad15-466e-ac4c-245d8d1ddc02","resolution":{"observed_at":"2026-08-10T20:41:47.503207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06182","last_updated":"2024-06-10T16:27:47Z","snapshot_observed_at":"2026-08-12T23:46:18.242813Z","submitted_at":"2024-06-10T16:27:47Z","title":"Compositional Video Generation as Flow Equalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06182","snapshot_observed_at":"2026-08-10T20:41:46.907745Z","title":"Compositional video generation as flow equalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.907745Z"},"links":{"cited_paper":"/paper/2407.06182","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:bdfbc1ed7fc5a5d098d1654a0955600549076504f87b5f0e6afb3db63c227d33","observation_id":"1c8caf67-ceb5-4d66-87b9-2a5e3a4fed17","resolution":{"observed_at":"2026-08-10T20:41:46.907745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-10T20:41:46.912771Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.912771Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:03cc3023c354bb6f0fb801040900f07e2faacc9cd62c2a3c7079e809718657ba","observation_id":"b362f654-ab1f-418b-a79a-7247e9727bb1","resolution":{"observed_at":"2026-08-10T20:41:46.912771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.480885Z","title":"Scannet++: A high-fidelity dataset of 3d in- door scenes","venue":null,"work_id":"5df2ae6b-4c9c-4d10-b879-cfbfc65cf7e8","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.917408Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:a78a259d405cb3622683d8a0e0d189c0173b67333d63e3f4d1103ee82a3f0810","observation_id":"d215340d-085f-45be-b3e4-e7d42fc77633","resolution":{"observed_at":"2026-08-10T20:41:47.486813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.921729Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.921729Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:a083d20091c5a3da9df540b1bed63f8a22f490f0bff56bf22e8e59bd46542340","observation_id":"6ae457b4-859d-4308-aebf-f18053923296","resolution":{"observed_at":"2026-08-10T20:41:46.921729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.453628Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"a275a16a-ef74-4946-95db-568db715de09","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.926761Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:a96243d98943d97686c9f1dd2232bd4dce6808dbf4b49be3d8af53df1762b754","observation_id":"127e9784-ed54-430e-b1b0-ff3e5fc55929","resolution":{"observed_at":"2026-08-10T20:41:47.458369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.436210Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":"d888c2a9-52ff-458a-bcb2-e2264027c1fd","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.931591Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:8df430b10d27fd707ee7a40884fe389f19ebe1b93f33c1c4e4904db1d860f799","observation_id":"51f1e579-ef71-4ae9-9ec9-8cbd61e9839d","resolution":{"observed_at":"2026-08-10T20:41:47.442037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1610.94662","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.052852Z","title":"both foreground and background","venue":null,"work_id":"1e33990c-c8ef-46ee-b188-715b1c063ff8","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.937177Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:cd011e18c8ea2da8971c8a6f5e98de4bb0a42ab473fdc2d5d9643876f49103fc","observation_id":"5c3d4a12-2050-450f-81be-34389c94427f","resolution":{"observed_at":"2026-08-10T20:41:47.062580Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.418597Z","title":"Frame0”: “Object2","venue":null,"work_id":"51cbac69-a686-4146-9450-1a2cd54bb6e4","year":null},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.943342Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:43668a9b52fda8ea2e0f59492991d7f6c55154464e5d3c7486e7b97ceb9fbaaf","observation_id":"87f0d80a-6b97-42d8-b5aa-e73017baeb4f","resolution":{"observed_at":"2026-08-10T20:41:47.424318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2501.07647."}