{"as_of":"2026-08-13T13:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92987f24385e6591936da2c72d611a090e0d695e21ce9741445c6d05f7e0e985","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:30:08.639585Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.04432/citation-record","integrity":"/paper/2412.04432/integrity","json":"/paper/2412.04432/citation-record.json","paper":"/paper/2412.04432"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.168681Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.168681Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:8f3fc06ee34e3292fa16fed1d4d96ff654d5188b56b92d99060affce1d517772","observation_id":"88694565-ba9c-483c-9310-62f1116ee105","resolution":{"observed_at":"2026-08-11T21:30:08.168681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.176057Z","title":"Frozen in time: A joint video and image encoder for end-to- end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.176057Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:566f90295d8fd65615ff31a130ebdf45ddc6f865fcccbbc71d13227a34380413","observation_id":"a66d8743-ee4c-4cf2-a342-e0680679f100","resolution":{"observed_at":"2026-08-11T21:30:08.176057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03126","last_updated":"2022-03-16T01:35:49Z","snapshot_observed_at":"2026-08-12T01:15:35.596933Z","submitted_at":"2021-12-06T15:55:30Z","title":"Label-Efficient Semantic Segmentation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03126","snapshot_observed_at":"2026-08-11T21:30:08.182315Z","title":"Label-efficient seman- tic segmentation with diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.182315Z"},"links":{"cited_paper":"/paper/2112.03126","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:77c564a06d5e0c3e89912cacfdbbe52499032d105c8a3e8e93f35ff2ed88081b","observation_id":"c3653f49-ce7b-4db9-bca3-17cfb9b98bfe","resolution":{"observed_at":"2026-08-11T21:30:08.182315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T21:30:08.188344Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.188344Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:13b3ee51bdeb1034b4b7b0d6620012c17b0407917b3ce1cf102634928284f346","observation_id":"1141abc7-39f4-4ee4-8990-e6794b58c03d","resolution":{"observed_at":"2026-08-11T21:30:08.188344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.194537Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.194537Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:7bef8186c8c08a1b1a898309c7ae4f5d99c9d58725efda7c0f153766c666c1a4","observation_id":"efe63e62-cdbc-402e-9126-83c9b5a1a303","resolution":{"observed_at":"2026-08-11T21:30:08.194537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.200580Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.200580Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:f45ff6ea272e44b05197febdb59ae0339450ae9f8dc724e6c547a7788bee776f","observation_id":"909f728c-c898-4638-8dcf-45839aabe643","resolution":{"observed_at":"2026-08-11T21:30:08.200580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.207912Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.207912Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c854d9e76227d81eda1d84630f0bfa75a148ac1f5de7c080d2d37959bd396cce","observation_id":"86c3547e-c80a-4fff-86e7-bd5e635aa5ee","resolution":{"observed_at":"2026-08-11T21:30:08.207912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-13T01:39:12.659510Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-11T21:30:08.215677Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.215677Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3bf47b9c9348d7511d2e75ab61d838463232874db2fc8b9a4395a7094ced71bd","observation_id":"2b16fd6b-064d-41c6-964e-870eaf58ba7a","resolution":{"observed_at":"2026-08-11T21:30:08.215677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.223266Z","title":"Panda-70m: Captioning 70m videos with multiple cross- modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.223266Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3b3bd87faa6e611bd432aa63e8e0b819e43ee4d0a2d435f730d8bdc66069d980","observation_id":"c0ce776a-30ba-417f-b86f-382fbed87148","resolution":{"observed_at":"2026-08-11T21:30:08.223266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T21:30:08.228320Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.228320Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c87c6936292fe0d4c4f963bae2ce1efc2664f552d3bfe4de786f1dbc314632cd","observation_id":"1b448b3a-e129-4e2f-ae98-5b15608bdc83","resolution":{"observed_at":"2026-08-11T21:30:08.228320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-11T21:30:08.233464Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.233464Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:89ed18539658ec7dd234c18b501e5f2dd825dcc2a52ee5e3f76147e29f5c218d","observation_id":"1e5ce52d-6fdd-4227-813f-db3e6673e0e7","resolution":{"observed_at":"2026-08-11T21:30:08.233464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-13T10:09:02.594270Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-11T21:30:08.238448Z","title":"Dreamllm: Synergistic multimodal com- prehension and creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.238448Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:eb85e6c2a71ef3ec59dc72b0acf29f479163262d0c24e0bbcac5c3f34d827fb2","observation_id":"ed797b34-139a-4a90-b8a4-5d1692e981bc","resolution":{"observed_at":"2026-08-11T21:30:08.238448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T21:30:08.243491Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.243491Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:5b7f40128fa3d74551435d9103ba06ac664471c52beb9a02e56f97ea74b2d9bf","observation_id":"13653f45-ea1f-44b6-84ae-2caaae821200","resolution":{"observed_at":"2026-08-11T21:30:08.243491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.248720Z","title":"Preserve your own correlation: A noise prior for video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.248720Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:df03fc5280efac251924e28cf6f937c1c09c8ba1e44f33565d1a51c278334aaa","observation_id":"6688d341-cf16-46d8-93cb-9d55b7306015","resolution":{"observed_at":"2026-08-11T21:30:08.248720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08041","last_updated":"2023-08-12T04:42:29Z","snapshot_observed_at":"2026-08-13T10:54:43.866365Z","submitted_at":"2023-07-16T13:41:39Z","title":"Planting a SEED of Vision in Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08041","snapshot_observed_at":"2026-08-11T21:30:08.253576Z","title":"Planting a seed of vision in large language model.arXiv preprint arXiv:2307.08041, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.253576Z"},"links":{"cited_paper":"/paper/2307.08041","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:79b97a83721a93de2e190a8e6f532ddcf053636ef58587522ae6b72204f39959","observation_id":"61e1d6ab-c3e5-4ca6-b4f9-94f8caa32e1e","resolution":{"observed_at":"2026-08-11T21:30:08.253576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-13T05:59:18.617832Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-11T21:30:08.258608Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.258608Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:bada0ea8e54d6f7485fe1314692da7f597c3d857b5049d1b2b2c56eaae41a413","observation_id":"340650dd-c441-4c0e-abe9-d8a31787b639","resolution":{"observed_at":"2026-08-11T21:30:08.258608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-11T21:30:08.264244Z","title":"Seed-x: Multi- modal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.264244Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:5d18f6b42d01d6c18c9f247e4fbaf0c07fc047972167b1972315c7c1212a1f82","observation_id":"becff120-b99a-4655-9fd4-f82b888aec5f","resolution":{"observed_at":"2026-08-11T21:30:08.264244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.270201Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.270201Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:db983d67bdd87e709f47bf652dce838749d7a4cfad691e932ed98902c0805f4a","observation_id":"e32baaa1-befe-4e5e-aea0-dd386d2109a2","resolution":{"observed_at":"2026-08-11T21:30:08.270201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.275037Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.275037Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:f4c717c1f161c96305b9e452e935ee14bc1c8d4df0cd5907a3b12aa9ea27fe58","observation_id":"3ba5d9ee-2ce3-4e7b-819b-55bf959b6088","resolution":{"observed_at":"2026-08-11T21:30:08.275037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.279158Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.279158Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:1ee5fb9bfe7065d56eef62b02ad1411718c4e6f624c69505e1cb15eb2ca84872","observation_id":"0a968b18-3a95-4fea-81de-f8fef9e5b59f","resolution":{"observed_at":"2026-08-11T21:30:08.279158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-11T21:30:08.283173Z","title":"Cogvideo: Large-scale pretraining for text-to-video gen- eration via transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.283173Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:a994ac30cbf543e8b49fdb64731941f6a3a6058a41aae714e930c99c613c0200","observation_id":"b755da2d-c28e-4cc4-9a73-49602892c054","resolution":{"observed_at":"2026-08-11T21:30:08.283173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T21:30:08.288095Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.288095Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:f1d63ea3ec87ba25181802b11fd23d446537b678a973a78d15ff71865201fa3f","observation_id":"22240207-50b5-41fd-8fcf-ec7b6705b946","resolution":{"observed_at":"2026-08-11T21:30:08.288095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.292734Z","title":"Soda: Bottle- 9 neck diffusion models for representation learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.292734Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:7f2b339bd1ebff84247f4c2ac01bcecac33f27c519f26ac726fde41e51dd9aae","observation_id":"5d5f184f-f8a5-4363-897c-e257a19ae903","resolution":{"observed_at":"2026-08-11T21:30:08.292734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T21:30:08.296984Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.296984Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:447c1a9c0dc8e2af194e60d066f91809b85a6cd47ab2ea7cd116a154015623ef","observation_id":"cb7702ea-a184-4ec5-bd09-88df05d65a5f","resolution":{"observed_at":"2026-08-11T21:30:08.296984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.301962Z","title":"Unified language-vision pretraining with dynamic discrete visual tokenization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.301962Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:5acfe18eaddf0e590cbe6f84a0474f427f899ddb536062ca9b2476770aef5f62","observation_id":"29319ca1-0dca-4645-828c-3294497c6842","resolution":{"observed_at":"2026-08-11T21:30:08.301962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.307015Z","title":"Video-lavit: Unified video-language pre-training with decoupled visual-motional tokenization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.307015Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:7b3265cc799774b9f2ab2322676da4192a5a7a4ba6e9603e36426d280873a1ad","observation_id":"75d80948-3a44-42e7-9357-0bdca8bf4644","resolution":{"observed_at":"2026-08-11T21:30:08.307015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T21:30:08.311855Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.311855Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:b89b9f4d17e507ace41d97adf7fec126144d6873c8b178ac0d89222ef56aa423","observation_id":"29bb5ce6-43a3-407e-b862-90e29103bc8e","resolution":{"observed_at":"2026-08-11T21:30:08.311855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T21:30:08.317096Z","title":"Auto-encoding vari- ational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.317096Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:4b88db9c0f2dc338c3b67cdf16fa8ed57948db76e73cc2b922776ad79a2c5e7d","observation_id":"85f4df18-8a6f-4929-89a7-9cd91a6c13e1","resolution":{"observed_at":"2026-08-11T21:30:08.317096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-11T21:30:08.321924Z","title":"Videopoet: A large language model for zero-shot video generation.arXiv preprint arXiv:2312.14125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.321924Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:2b2264bab214d90388b2dbf2a39446200a34b9aa1606f584f3171af784fc3c79","observation_id":"89b8fc7b-47c5-489e-8ce0-d763fdc692b5","resolution":{"observed_at":"2026-08-11T21:30:08.321924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T21:30:08.327003Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.327003Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:d0c90122786efcbfa00b73e96e68eec75d5fbe95d4816b58845501fc07fa09af","observation_id":"f919c1c9-babb-4d9a-a1db-0dd7a2363342","resolution":{"observed_at":"2026-08-11T21:30:08.327003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-11T21:30:08.333026Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.333026Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:cd031a3cd8164d89d5d824f3da899e9fc3abf0bcc54d35a4887624b0adff6821","observation_id":"ae669222-29c1-4638-a93e-276574568f4a","resolution":{"observed_at":"2026-08-11T21:30:08.333026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.338245Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.338245Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:2d559ccaeaec9aaeea9c4e51ee3dca5c90e856d4387b3678d187f6700c3df60d","observation_id":"9fa4197d-2cbb-4e51-ab97-6a21c561bf87","resolution":{"observed_at":"2026-08-11T21:30:08.338245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-12T23:40:46.718337Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-11T21:30:08.343535Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.343535Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:e5bc2335f856f795f028da9310ae1ca2f5b3094c075d85020b06a252fd6f1de4","observation_id":"1861889d-2ac4-4230-8f59-d8d84a041b02","resolution":{"observed_at":"2026-08-11T21:30:08.343535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.348486Z","title":"Tgif: A new dataset and benchmark on animated gif description","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.348486Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c5fc379c6041b25dfa64b0c522219f55f2450a5462ba7e92bfeb7444a889426f","observation_id":"b5e12df6-ef38-45fc-86af-f14c4ddeeb1c","resolution":{"observed_at":"2026-08-11T21:30:08.348486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-13T05:15:07.522678Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-11T21:30:08.353411Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.353411Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:72edd2c168a8022c94f182e78184c76df1f9138e9e39ca104dba68f05452ae29","observation_id":"af313e59-6bb0-49e6-8aba-a3778c0c5bbf","resolution":{"observed_at":"2026-08-11T21:30:08.353411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-11T21:30:08.358731Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.358731Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:d73622799fe32af9a537ac5c490f03005f47a5526f47c9821395427db8783008","observation_id":"634a98ee-5c43-499e-a08b-822ca1cf8a47","resolution":{"observed_at":"2026-08-11T21:30:08.358731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T21:30:08.364042Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.364042Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:da72f04856767e60f69e0cb0443553a1208459b0216620a96d0695f1337d9b92","observation_id":"cf0289fb-3bf5-4700-8762-b53642a822f8","resolution":{"observed_at":"2026-08-11T21:30:08.364042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.116498Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":"ce4c1918-2ff6-446f-8477-f478f9eed19c","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.369328Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:20255cda6fbb642a328a18787662204bc16cfe764c89ed74fedaedec39f0445e","observation_id":"2babac02-5914-4200-a41a-0875694d62ee","resolution":{"observed_at":"2026-08-11T21:30:10.121409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.374239Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.374239Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:b42d082691c3d767ed48dfa00bf0512fe82e3cfbadef4712f5a0e8a58c8aff0a","observation_id":"810fa34a-c5b2-484b-b674-741ba7105249","resolution":{"observed_at":"2026-08-11T21:30:08.374239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-11T03:45:32.889856Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-11T21:30:08.379980Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.379980Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:39a465f4e11b60c49f13a8e25fe570bed52594d3bc2a57387bc8d623b9d02bd9","observation_id":"2e1afc70-109d-4c54-9589-d9d3e2102445","resolution":{"observed_at":"2026-08-11T21:30:08.379980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-13T04:52:43.165678Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-11T21:30:08.385354Z","title":"Unified-io 2: Scaling autoregressive multi- modal models with vision, language, audio, and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.385354Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:0ca7c22f59dd662c345e9b3f53c3a66ec6465edbd3cbf00bc5602d321527f489","observation_id":"e8ef846f-071d-402c-b08e-c4830fcd9b60","resolution":{"observed_at":"2026-08-11T21:30:08.385354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-13T11:18:51.693524Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-11T21:30:08.390529Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.390529Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:601fa9ec0c116b6c36f317e4859b65e437bc08f5f825790b40a987b75729cda9","observation_id":"3bdb0bea-db6f-4b54-983f-14f23fce4394","resolution":{"observed_at":"2026-08-11T21:30:08.390529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T21:30:08.395867Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.395867Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:a52aab534bdf62fdf158d5783db5e590f07e3c42e1126b752c65cbebf15cf86c","observation_id":"9ac167ca-53c0-45e6-9f98-d13922eae03e","resolution":{"observed_at":"2026-08-11T21:30:08.395867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.087024Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"7553f58c-b3a2-49d7-8cd7-91da18def8c3","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.401277Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:99037ade16f0d9f90a9391ef2249836bf97b73efa20f3ce4b56d3c2cadcd9fb9","observation_id":"7982e3ec-573f-4b6d-b0f6-0bf9b7ce002e","resolution":{"observed_at":"2026-08-11T21:30:10.092270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.067820Z","title":"Snap video: Scaled spatiotemporal transformers for text-to-video synthe- sis","venue":null,"work_id":"012f0579-6b6d-4828-a8d1-b75c33871393","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.405298Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:5438686db9b6fd9dbf19f0d892645a33e146747db9675bca9740fe30a554ac1e","observation_id":"b83e4cab-1aff-4174-94e9-3686c3919300","resolution":{"observed_at":"2026-08-11T21:30:10.073428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.051605Z","title":"Gpt-4v(ision) system card, 2023","venue":null,"work_id":"bfcdba90-d143-4486-9361-6ab28682ea4e","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.409431Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:79369eff8755ffeafa1bdef031cbb1529b5888b719ae77ab7448ff7fbbf4222c","observation_id":"584aa6ec-297e-4804-bb3b-1efd5c2e749b","resolution":{"observed_at":"2026-08-11T21:30:10.056575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.035746Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":"daf7a5ee-97aa-4a70-be27-14564744da06","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.413406Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:5d8d9aabe2c58243789eca90673ae145036735e9c509221bf73ca93211e5beed","observation_id":"e460fd8c-2921-4eb6-aa4a-144f7c26046f","resolution":{"observed_at":"2026-08-11T21:30:10.040769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.020136Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"0fcb3261-b138-438f-b30f-43a23887d5fc","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.417513Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:1d804526fd7475e2192ba238edff95914d5446e580b30e526f09e62438fc8f13","observation_id":"2d65fc94-30e8-43fe-8193-24a3d17670ff","resolution":{"observed_at":"2026-08-11T21:30:10.025216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.003289Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"39a4333f-71c8-4a44-9adc-d6b73335fe85","year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.421944Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:89b343d47686982a6ce1317b579e3b30646ad7ab02d7bb46054f97d04e9af689","observation_id":"8b5e5b8c-d601-4d6d-81e5-48b7e6a3ac27","resolution":{"observed_at":"2026-08-11T21:30:10.008927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.426561Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.426561Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:9bdd55829819692eabfc6ab3c06499c95fad33c03d05b35a9c869a0b14119cd1","observation_id":"627e1c39-512d-46b5-aead-988b3954a783","resolution":{"observed_at":"2026-08-11T21:30:08.426561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.972416Z","title":"Laion-5b: An open large-scale dataset for training next gen- eration image-text models","venue":null,"work_id":"e76974b6-cabb-4cd5-9073-a7ff4a86d1b8","year":2022},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.431183Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:ccdbcf90a42c9ee2cd286f729d6b41f7b4e53b437cca7f2b58e0497a44c2e962","observation_id":"a00f56ba-dccd-4e88-8fa6-4119135a5d2f","resolution":{"observed_at":"2026-08-11T21:30:09.977976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.956340Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"48e6fe34-2aca-46f3-ab44-27eb217e4bb3","year":2018},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.435975Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:ffa8804ecd4827c7f4b681b765c692b0170b0ffdb5dd76218a22d408b1a4ef6b","observation_id":"53bf96ac-008b-4f6f-86d1-23bb9a64e7cd","resolution":{"observed_at":"2026-08-11T21:30:09.961577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T21:30:08.440449Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.440449Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:94a2cf5839e2348afee309b1013bf42766084a7bbb20739507112e0bb9674e83","observation_id":"aa65f3de-f780-458d-854a-b55b950e8bc5","resolution":{"observed_at":"2026-08-11T21:30:08.440449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-08-13T04:57:24.068800Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-11T21:30:08.445180Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.445180Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3b2d6f2899842e7f89cd5830bcf26ebc1fda366a37f86f2ca01fa1fbe0e7656c","observation_id":"3e5760db-8a9d-48ed-a2a0-cae4ef3d152c","resolution":{"observed_at":"2026-08-11T21:30:08.445180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-11T21:30:08.455468Z","title":"Generative pretraining in multi- modality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.455468Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:218c89fad08b51f1502639467db551a62f96617118a2f1c4d6c84fe8c9618ce5","observation_id":"23d37623-318c-40de-bb60-39c1e808cc58","resolution":{"observed_at":"2026-08-11T21:30:08.455468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-11T21:30:08.460392Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.460392Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:46ecae8b511b5dd1cf5742fe8d7b2f27040304de78b162381917119a5bd758c8","observation_id":"d67f96e7-aeec-4e04-bfc4-f8fe67278784","resolution":{"observed_at":"2026-08-11T21:30:08.460392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T21:30:08.465177Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.465177Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:2ba873108b37e0b104395e7393477a27a51e68edae46cf75ed5722f83792b9bb","observation_id":"ffd95997-71a4-4c28-a41d-d502774f0377","resolution":{"observed_at":"2026-08-11T21:30:08.465177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T21:30:08.469723Z","title":"Gemini 1.5: Unlocking mul- timodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.469723Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:f6fde26d9ef180160e98a35e6daec0a54fdd35b7f26be3fc33778239e723b784","observation_id":"9d011547-2090-42b1-bca7-07e699c125c0","resolution":{"observed_at":"2026-08-11T21:30:08.469723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T21:30:08.474548Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.474548Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:21f8801e78d988b85b7b6dc5898f544082dfef36ae21c14aa634ae4a270ed465","observation_id":"a2e2c36e-18a0-4084-a2f3-ab37912dc0b5","resolution":{"observed_at":"2026-08-11T21:30:08.474548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.939327Z","title":"Givt: Generative infinite-vocabulary transformers","venue":null,"work_id":"cd469aea-4f59-4ead-b55a-c07e8c2dcf2e","year":2025},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.479670Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:e2a810caf430210153f5e95b3507d4398158a0b84cbcb9ba1862e0136d6e1118","observation_id":"4d9e5565-71fb-4537-ad98-e25f5de9769c","resolution":{"observed_at":"2026-08-11T21:30:09.944108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-11T21:30:08.484543Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.484543Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:639286fb253b594d7362b5474e85c09932574f204d26febcb11ea22810ff90b0","observation_id":"d44ab93e-0129-40e2-9e46-fa3c620d224e","resolution":{"observed_at":"2026-08-11T21:30:08.484543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.489443Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.489443Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:98aac2dbdbbd274f15e41dc432d523b834871cc48de468ce7ae7c0b4dd0160e9","observation_id":"d8e3564c-f760-455b-a901-5daaa7423144","resolution":{"observed_at":"2026-08-11T21:30:08.489443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21264","last_updated":"2025-06-16T22:06:19Z","snapshot_observed_at":"2026-08-12T22:13:33.857480Z","submitted_at":"2024-10-28T17:57:07Z","title":"LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21264","snapshot_observed_at":"2026-08-11T21:30:08.494766Z","title":"Larp: Tokenizing videos with a learned autoregressive generative prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.494766Z"},"links":{"cited_paper":"/paper/2410.21264","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:cf439e66d90b909d3595454a4c15100daf5a738bf4a8535146e74483b2aae031","observation_id":"8fabbf4d-909f-490c-900e-0d38893bd01c","resolution":{"observed_at":"2026-08-11T21:30:08.494766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20171","last_updated":"2024-08-24T03:55:36Z","snapshot_observed_at":"2026-08-12T23:12:40.280328Z","submitted_at":"2024-07-29T17:00:09Z","title":"Diffusion Feedback Helps CLIP See Better","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20171","snapshot_observed_at":"2026-08-11T21:30:08.500992Z","title":"Diffusion feedback helps clip see better","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.500992Z"},"links":{"cited_paper":"/paper/2407.20171","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:78f2772f33ef23cad7e0cd01585a98f9fa0cd84ed90390bb98ae4efc9893cf1f","observation_id":"acd3ac56-11cc-44f0-af08-c1734937bba7","resolution":{"observed_at":"2026-08-11T21:30:08.500992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.914001Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"20ab7ff5-f70c-4c35-ad59-a886f9e8b317","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.506963Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:1faf0afd6db76221cca693396c2953218d21e4890783595bc1f04c24e62255c0","observation_id":"9c894d03-6918-4594-8b30-10cc637b7bdc","resolution":{"observed_at":"2026-08-11T21:30:09.918380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T21:30:08.511826Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.511826Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3ba68763bc35861b0b643bbbe5e0e1a93751b2effd1de58555b794b60cfcb681","observation_id":"8c79c8ba-9b7d-429c-a1ac-5da90d8ee83b","resolution":{"observed_at":"2026-08-11T21:30:08.511826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-11T21:30:08.516416Z","title":"Internvid: A large-scale video-text dataset for multimodal un- derstanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.516416Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:5de9616fc8b1ed6c49d9ade71408451bc08c68edf7ec88480811319c96168466","observation_id":"d04bee03-6122-498b-b595-26ce1cbf779a","resolution":{"observed_at":"2026-08-11T21:30:08.516416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-12T22:31:22.501227Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-11T21:30:08.521692Z","title":"Loong: Gen- erating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.521692Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3d84570b309ff03b203a34646212990e76fee32f0949419025ace8645f90c868","observation_id":"a68f103a-d157-45b2-89d8-ff723c089931","resolution":{"observed_at":"2026-08-11T21:30:08.521692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.897726Z","title":"Diffusion models as masked autoencoders","venue":null,"work_id":"a685b43c-7a04-441e-8421-f47080d7cb47","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.525932Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:eb80a354f006c74d68e6eb002a71e9567440d5e9c096722566e82498f637d32c","observation_id":"3874d8e5-ffbf-437c-b867-d3e88740b3c1","resolution":{"observed_at":"2026-08-11T21:30:09.903063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-08-12T04:22:15.303374Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-08-11T21:30:08.529926Z","title":"Godiva: Generating open-domain videos from natural descriptions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.529926Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c6e1d6528e37f0eb96ae20870b3579ed6ab043fbf787f19bd4ea53c077415fa5","observation_id":"895b9fd6-7f2c-4ee3-ba7a-fb937343097c","resolution":{"observed_at":"2026-08-11T21:30:08.529926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-11T21:30:08.534148Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.534148Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:4886078f6ac1537d2e27a724b71470ca0fd09700cfe8c85fa0aa506c74ce29a7","observation_id":"5f8e2a87-06d8-46c0-8006-f621f08f4bf6","resolution":{"observed_at":"2026-08-11T21:30:08.534148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-13T10:15:58.049014Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-11T21:30:08.538409Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.538409Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c8b7684d28ba23da72081f52c2953b33ce8675458ad651b9a1bbd7082a9def5b","observation_id":"ae4aec21-24c1-4aa6-a82b-ac9ff1b200ac","resolution":{"observed_at":"2026-08-11T21:30:08.538409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-11T21:30:08.543892Z","title":"Vila-u: a unified foundation model inte- grating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.543892Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c3a2da29f4beca30a2b3045797be1154d0a2b8322e18c91a796f616760169a1f","observation_id":"8353176b-b0b5-496b-be99-8f8a59fae0ab","resolution":{"observed_at":"2026-08-11T21:30:08.543892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.881423Z","title":"Denoising diffusion autoencoders are unified self-supervised 11 learners","venue":null,"work_id":"3a8f5a25-9ba1-4feb-892a-b1a9917641ac","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.548835Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:afc316fc87931a8bd1ba2d4b3068f02cbb4f1e5592bf2b9704663327917cd80a","observation_id":"b2458da6-fa1f-4222-b13f-a3f3ff68e8e4","resolution":{"observed_at":"2026-08-11T21:30:09.886501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.553398Z","title":"Next-qa: Next phase of question-answering to explaining tem- poral actions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.553398Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c8dd847032eef8bd647d24716027592255991c121a1c7af729876af4cf9f5c4e","observation_id":"87b8863b-1442-43e3-b4aa-97c7a56ae7f9","resolution":{"observed_at":"2026-08-11T21:30:08.553398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-11T21:30:08.558166Z","title":"Show-o: One single transformer to unify multimodal understanding and genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.558166Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:d59cc854bc4a7c24e5ff12546e31be39a64f60c0c6c393504ceb38287efa31fd","observation_id":"f7f5a051-14fd-4c19-a0d9-39a0c5b42968","resolution":{"observed_at":"2026-08-11T21:30:08.558166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.563006Z","title":"Dynamicrafter: Animating open- domain images with video diffusion priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.563006Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:9166d94f1e662b2cd54f9e100ee467f51ab80031aed830cef2ab6eb1b5e8785f","observation_id":"05bebe21-3796-4d4a-b25b-e5b0b4b53e1f","resolution":{"observed_at":"2026-08-11T21:30:08.563006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.843519Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"200e9096-b811-43fc-b07e-3f3b6c25c4c1","year":2016},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.567869Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:fcaeed4d27b49a0c13fe5c55c344381ef5e2a91fa91ceccb2e6389866995f25b","observation_id":"a7a79945-bb2e-4b85-ad0c-333def12026f","resolution":{"observed_at":"2026-08-11T21:30:09.849437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.826160Z","title":"Open-vocabulary panoptic segmentation with text-to-image diffusion models","venue":null,"work_id":"294bc132-68e5-43af-a3f2-e95a85f9bfa8","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.572476Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:58e48450576a8d1f0b2e51599420e0a5b2d32eef4fbb149d135199e8088229e0","observation_id":"424b2904-3b46-4d0d-aa8d-298bcf40faba","resolution":{"observed_at":"2026-08-11T21:30:09.831409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-11T21:30:08.577527Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.577527Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:2e3f726e7a2e50bc6f03af53a219a67799c57bb120112bff110acfbc32f93872","observation_id":"4a214b0c-b715-44a1-877a-52a85490991c","resolution":{"observed_at":"2026-08-11T21:30:08.577527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-11T21:30:08.583416Z","title":"Videogpt: Video generation using vq-vae and transform- ers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.583416Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:6fa388dfde28a1c2cf8613be29b5353547052d3da10bee25697ef8db36d43de4","observation_id":"e4506835-9bcd-491f-b237-7ce7b03527e5","resolution":{"observed_at":"2026-08-11T21:30:08.583416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10798","last_updated":"2025-06-04T07:35:31Z","snapshot_observed_at":"2026-08-12T22:23:27.107761Z","submitted_at":"2024-10-14T17:57:18Z","title":"MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10798","snapshot_observed_at":"2026-08-11T21:30:08.588482Z","title":"Mmar: Towards lossless multi-modal auto-regressive prababilistic modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.588482Z"},"links":{"cited_paper":"/paper/2410.10798","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:6531f0393aa76e5c9201923a2ee0ff07cb75e3c5d7666e3a0cd3cfbca45a3aaf","observation_id":"fa14b4d0-9b7e-4349-8337-a3f88209eff9","resolution":{"observed_at":"2026-08-11T21:30:08.588482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-12T23:24:01.714587Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-11T21:30:08.593471Z","title":"Seed-story: Multimodal long story generation with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.593471Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:7abe53e091c29c87336237a0a3073c93ec012800e32f540d5d03f78873cdd92b","observation_id":"d6d15063-c71c-42ca-afbd-4471e4f63b73","resolution":{"observed_at":"2026-08-11T21:30:08.593471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-11T21:30:08.598608Z","title":"Clevrer: Collision events for video representation and reasoning.arXiv preprint arXiv:1910.01442, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.598608Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3fd850fd08225926ba6a9ef899a1472ff519ff2e562db682d469e938c43ef0e1","observation_id":"1bee4769-a4db-476a-9edd-2644cc8520d7","resolution":{"observed_at":"2026-08-11T21:30:08.598608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-13T10:19:44.723226Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-11T21:30:08.603875Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.603875Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:fa53aee3fa8343510b289c142758c8bfe010f75b29868d9d2774eee7f2a05a26","observation_id":"14e4bc1c-ffd9-4d5f-8291-b8edfe12a830","resolution":{"observed_at":"2026-08-11T21:30:08.603875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.808828Z","title":"Capsfu- sion: Rethinking image-text data at scale","venue":null,"work_id":"717009e2-b496-43a6-ad58-4da24c046e50","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.608451Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3637ea744c3227cb2568dfcc9ab2c65579e75c7e0ad4a2dc20aa4ee4a98443c8","observation_id":"e95660d3-6d9b-49a9-8628-e96bdc167775","resolution":{"observed_at":"2026-08-11T21:30:09.814067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.792012Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"ef6aee07-7490-483b-a300-fb912d29c9df","year":2019},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.612556Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:ed474d50c1997e9139e6f414b1b00e4543eace1699e42106fc8c99877528bb1b","observation_id":"5fc67231-9f23-4423-ae6f-ccfda4171d1c","resolution":{"observed_at":"2026-08-11T21:30:09.797396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16280","last_updated":"2024-09-24T17:51:04Z","snapshot_observed_at":"2026-08-12T22:38:25.854863Z","submitted_at":"2024-09-24T17:51:04Z","title":"MonoFormer: One Transformer for Both Diffusion and Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16280","snapshot_observed_at":"2026-08-11T21:30:08.616778Z","title":"Monoformer: One transformer for both diffusion and autore- gression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.616778Z"},"links":{"cited_paper":"/paper/2409.16280","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:a0933fabf02cc47f16a6dc4d7ff3f147aed0a78f098376057dcea4de871fd57e","observation_id":"e1c248f8-9454-4c7e-9168-e4bc1ffe0389","resolution":{"observed_at":"2026-08-11T21:30:08.616778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.775895Z","title":"Unleashing text-to-image diffusion mod- els for visual perception","venue":null,"work_id":"ac044886-4c99-4992-9f6f-503894adbe6c","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.620784Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:7ddcb087607b6f20f802863b9caa8c00363cf70918f9ae47a808b8cbca8bf832","observation_id":"55abc623-112a-43fc-b6d1-e5db92259baf","resolution":{"observed_at":"2026-08-11T21:30:09.781187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-11T21:30:08.624654Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.624654Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:f49274cad9a2c1257f510911d79e3e17f3ddf60311404d70d5ae0f9efb1f9f15","observation_id":"aabc4237-ac62-4232-a343-d0d6653d64cd","resolution":{"observed_at":"2026-08-11T21:30:08.624654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.757308Z","title":"Towards auto- matic learning of procedures from web instructional videos","venue":null,"work_id":"afc2d2df-8c12-4840-b136-b60bd9413f4b","year":2018},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.628936Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:122b651e8f6ff447fffd51a4224c4fb8c1a209d012f234ba5eb3a9e583436bea","observation_id":"326892c7-b028-44cb-9c25-a51330864047","resolution":{"observed_at":"2026-08-11T21:30:09.763515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-13T05:02:09.710927Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-11T21:30:08.634738Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language un- derstanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.634738Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c10bec5d53236e730cab3df27ceb896d5710c74d50a387b45ec31492408b561c","observation_id":"226b838e-729e-416e-b6dd-31d478af8707","resolution":{"observed_at":"2026-08-11T21:30:08.634738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.741591Z","title":"Curious George","venue":null,"work_id":"3e0aeb88-a63e-40fe-9393-6812175779a3","year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.639585Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:0af1516bd1375b4616b3ee5641e4725ddbfd156c6c0448279695a3cbe06af03e","observation_id":"c3206fa4-c4f1-4d61-be4b-b95d74817d99","resolution":{"observed_at":"2026-08-11T21:30:09.746735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":73,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 0 inbound Pith citation observations for arXiv:2412.04432."}