{"as_of":"2026-08-10T02:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dad40e5d499e5500cbea1ac392a58a989939fd8d37d6e516aef2f7801d41bd1a","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:43:56.260106Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.01938/citation-record","integrity":"/paper/2507.01938/integrity","json":"/paper/2507.01938/citation-record.json","paper":"/paper/2507.01938"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:53.552636Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.552636Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:66b96665c0e75877b046f938a0b45e369ee56bf2ff888b7f6c7074d856b96162","observation_id":"43c302e5-3448-4025-a67e-3f2addf75b44","resolution":{"observed_at":"2026-08-06T20:43:53.552636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:43:53.636519Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.636519Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:265a68e8876ba7d865a47fccd90ded6446bd9d135a3cc4b3f5763f9f45518011","observation_id":"9ebc2bbc-2b1f-4875-8e90-0bf649427181","resolution":{"observed_at":"2026-08-06T20:43:53.636519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:59.955291Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"2087bc1a-7101-443b-a925-b4d4bc0c78e1","year":null},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.737971Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:82869e19d942c30ebdf57fd85fcc4ff9b14215a0d7c8ab580b9f42cde5b3836c","observation_id":"4802eb36-4927-402e-9cb4-ba5de35f8b21","resolution":{"observed_at":"2026-08-06T20:44:00.100101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:59.791174Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":"4656fd2b-affe-40dc-9f1e-0501710dd304","year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.797460Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:d8c3f8a520ffae8ab13efacc71b72fca71cc8dd244d08042002887aad6d2200a","observation_id":"bacf8874-ee68-4c67-b252-4550bb47cc04","resolution":{"observed_at":"2026-08-06T20:43:59.868703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T20:43:53.858179Z","title":"Muse: Text-to-image generation via masked generative transform- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.858179Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:222893e2a6f60b3c2f28038ce5290a77847e7f766aa29aa1925de7b5f5fd523d","observation_id":"dc6d1286-0035-4aa1-9ff1-5e25eab8a452","resolution":{"observed_at":"2026-08-06T20:43:53.858179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:59.599814Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":"d23f15f7-8f35-447c-82bf-bc69b6dd8215","year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.945900Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:015c5c7a6ba80dfa742e815c26e015b44dce2cfcb73e86f9197099fbec8d0ec3","observation_id":"893d855c-e8c7-4912-934f-7574eb969633","resolution":{"observed_at":"2026-08-06T20:43:59.654667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:59.336775Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"77e23f65-b494-4752-9d9b-e295999236f4","year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.131696Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:33e578770b0db8b3cc326cf85575dc6243917b638f9c23fd75c1397e1e61f263","observation_id":"b16689d6-c1ab-4694-956c-5fefb917da8e","resolution":{"observed_at":"2026-08-06T20:43:59.461151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10462","last_updated":"2025-04-02T13:30:29Z","snapshot_observed_at":"2026-07-06T18:31:21.929350Z","submitted_at":"2024-06-15T01:27:58Z","title":"CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10462","snapshot_observed_at":"2026-08-06T20:43:54.222341Z","title":"Comm: A coherent inter- leaved image-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.222341Z"},"links":{"cited_paper":"/paper/2406.10462","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:aae54406e0e639db3a39d9f322a007f0984133a57856c71ef2c0aac0c562baa5","observation_id":"5ae716e0-f550-4984-a7e7-c66ce3d745bf","resolution":{"observed_at":"2026-08-06T20:43:54.222341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:59.033797Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":"77db57f5-73b4-4a37-bdaa-edad6e98012d","year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.373281Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:daa4e96b554e695a4486be03778489c8f0fad9b8459d6d1bee925f9ec888731c","observation_id":"72c26b38-ff68-4f8c-9868-bfce4f575a80","resolution":{"observed_at":"2026-08-06T20:43:59.182767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-06T20:43:54.436324Z","title":"Autoregressive video generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.436324Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:5aaa324f13b41ad1af0a7aa36859cbf4aed7bc49d063bb5cdd64322ed21ce40b","observation_id":"54f45424-b34c-4608-89b0-aff910a20f3f","resolution":{"observed_at":"2026-08-06T20:43:54.436324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:58.814502Z","title":"Long video generation with time-agnostic vqgan and time- sensitive transformer","venue":null,"work_id":"0acb055c-bda6-4e07-a75c-45b759fb1902","year":2022},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.501787Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:a5ce497177c183f04c40ccb3cc2b55fa065094ed3957e1a1bf771ecd6ecc1a25","observation_id":"9778989b-e92b-49d3-868a-b5a4894899e0","resolution":{"observed_at":"2026-08-06T20:43:58.909897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:58.643863Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"5e792f07-5cdc-46b9-9b3e-d9cebab799bb","year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.601603Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:df7a128a0addd5d9ca0ce63140ab8917cca09dca3194ae87d2a3ad9b532e443d","observation_id":"af402e0c-d85b-4ea5-bd6b-07dec89b34af","resolution":{"observed_at":"2026-08-06T20:43:58.718900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:58.485155Z","title":"Language is not all you need: Aligning perception with language mod- els","venue":null,"work_id":"4a6cd7c1-14d7-4adf-a8f7-b45f1c52579e","year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.657760Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:abf62384d8cf04da47a5cec00b7eab765b21603b88537b12273ee6b078db39fc","observation_id":"914b15d5-6e58-4f7d-a702-6ff1ec805cbd","resolution":{"observed_at":"2026-08-06T20:43:58.551569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:58.301978Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"8fa4a9c2-73a9-42e8-8b96-9216d11bff74","year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.740002Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:835ac3624f13efc7f4b62e609c658edd136f323bf5154b609829f95489c49335","observation_id":"d7786ac6-bae9-48bf-9099-ed46134fe665","resolution":{"observed_at":"2026-08-06T20:43:58.374454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T20:43:54.807590Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.807590Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:8771b911da8688e3778ea7049492096f0ab15239c177691199b214cc13d3db2a","observation_id":"c2f98bf3-07c7-456a-ab32-346e99bbbc1e","resolution":{"observed_at":"2026-08-06T20:43:54.807590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:58.100233Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"c9c39f85-3197-4f79-b8c6-cb5d95cf014e","year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.870766Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:82156e63027872291d3d59242c5a5512214c6297d99d9955a503c6f1a3081437","observation_id":"78cac45b-6862-4a70-85a1-77d031eb7518","resolution":{"observed_at":"2026-08-06T20:43:58.184731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.943112Z","title":"Miradata: A large-scale video dataset with long durations and structured captions","venue":null,"work_id":"65583fc1-2b36-41f6-a339-ce48b8d083f4","year":2025},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.927779Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:d49df7f428100c0a0ef253a0bd067577012336d35043c1518a7da22d258ad8f6","observation_id":"e987e9a4-bb83-4785-bf3c-4dbd864715b2","resolution":{"observed_at":"2026-08-06T20:43:58.023559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-06T20:43:55.005493Z","title":"Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.005493Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:3e67d1318da79ea5e58bd36c515bfa33f9e28d76dde81e2b69c0db9bbbdbaf9a","observation_id":"b4c6a182-0564-4b9c-844f-bb400bca1984","resolution":{"observed_at":"2026-08-06T20:43:55.005493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.834176Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":"cfed3939-adf4-439a-b319-b446865cd71e","year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.068501Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:860510c356c8bba23981b3bca87975d4fe911f853d2c97a85d0e41aae96fcb3d","observation_id":"7ce8d505-8d75-4718-a23e-d4d7ae723baf","resolution":{"observed_at":"2026-08-06T20:43:57.877839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.677837Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":"7120e962-1a76-4751-a6cd-5c9baefe8d79","year":2025},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.161115Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:b8fe1d3164bd150be82761cf86a79539b97c8d76d1fdfc581162c0c20855277a","observation_id":"0f68c233-efe3-4ba6-af5f-2241af2a0f34","resolution":{"observed_at":"2026-08-06T20:43:57.745356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-09T23:28:59.299375Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-06T20:43:55.215759Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.215759Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:65b8d2fdbd348aaa43dbbcd897cd33a7604e1fbb4dbcf5c5bf4028473089c70a","observation_id":"e87fad39-fdeb-4355-a567-ee6e2f2406ed","resolution":{"observed_at":"2026-08-06T20:43:55.215759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.497961Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"37f37ffe-b7f8-43c1-be6d-dd2140d1112b","year":2019},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.273819Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:59a7c1d3b60fdc1123e7d2aa4abb379c0b2b31cdbeb9e0f085566a7a8e4055f4","observation_id":"f7658d01-f6fa-45a2-afa7-233a783f36ac","resolution":{"observed_at":"2026-08-06T20:43:57.593196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-06T20:43:55.332249Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.332249Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:10a84ec30fc4f13b92e6dead8fc0c599d0e5c4b11da79cc164cab9e2624e2613","observation_id":"89f81468-e333-496d-89e9-bb1d430facfe","resolution":{"observed_at":"2026-08-06T20:43:55.332249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.417925Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.417925Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:15e8c0b086b6b16ad2f0f94e505d5fdfc8e34e03dc246d40bf8649bb6c46e7eb","observation_id":"798a4ad3-fd62-4e98-bbfa-b8dbaddf5a59","resolution":{"observed_at":"2026-08-06T20:43:55.417925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.316513Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"59159e39-9a91-436d-b7ae-6fe57e9a3118","year":2021},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.498051Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:dbf19d12a4f22db76c76ab99874b6ebc9f6099d95cfcd82dea0b00f4da2a22ee","observation_id":"fa9d88cf-5aae-4e94-ac11-49ca387fde33","resolution":{"observed_at":"2026-08-06T20:43:57.392652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.572174Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.572174Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:67f503adb44a67f627ea349ae0ede0e572ac0a51238411b4e3d24cc4820c7abd","observation_id":"9189915f-074b-4403-b8f3-ffb67b1a3b52","resolution":{"observed_at":"2026-08-06T20:43:55.572174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.141585Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"f1325ef0-9b30-4d63-a008-15ff51fd74cb","year":2022},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.613145Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:447072e3be1e4753357d6a6dfae146be5f0076822adf7281117ff285c8509ed8","observation_id":"d2d364bf-b8a7-4e32-a9bc-c6e60bf5a320","resolution":{"observed_at":"2026-08-06T20:43:57.221343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.668887Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.668887Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:3b68e3240d881e7a0641b48e6fbab05145a9bd2246ce72d748a0d506de027d9d","observation_id":"53aeb84d-0c09-40bc-a54b-87155aaad337","resolution":{"observed_at":"2026-08-06T20:43:55.668887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04277","last_updated":"2024-10-14T07:20:01Z","snapshot_observed_at":"2026-08-08T12:07:29.709308Z","submitted_at":"2024-06-06T17:25:33Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04277","snapshot_observed_at":"2026-08-06T20:43:55.726610Z","title":"Videotetris: Towards compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.726610Z"},"links":{"cited_paper":"/paper/2406.04277","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:c7e741b115bf69e6270d4019f164cc5510e17d2a4cdbe5e682735dacf43243de","observation_id":"60b811d9-46b6-4faf-b471-aa4e413b4c5b","resolution":{"observed_at":"2026-08-06T20:43:55.726610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.975872Z","title":"Mcvd-masked conditional video diffusion for prediction, generation, and interpolation","venue":null,"work_id":"f70a8f11-2454-435a-933e-d2ddae4f9b89","year":2022},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.792112Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:7ee18dd6fe16beb4d5564bad84694d75073013c47c35703ab7402ca5b2f03885","observation_id":"affb843b-73a5-4689-9c36-cc35776635b7","resolution":{"observed_at":"2026-08-06T20:43:57.045291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T20:43:55.887241Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.887241Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:0448e3301a6519402f79ce0370f569a9250b2d55c4f2c67f4bb7c3d53c1cceee","observation_id":"c2bdba8a-bd9b-481b-8228-7e8c00c13748","resolution":{"observed_at":"2026-08-06T20:43:55.887241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T20:43:55.960100Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.960100Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:5fbc3ff59d70817e745d439774aeeb29ff10f3105678e45f89c09caa8e377ce6","observation_id":"2f0879d8-0e8e-4004-86de-263b2740616c","resolution":{"observed_at":"2026-08-06T20:43:55.960100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.767302Z","title":"Ad- vancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"19dd8b87-2aa0-40b2-af28-ca7fe50728a0","year":2022},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:56.037650Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:70982effcbea84d1619ba1cd5c0558d2ba33bf6d1508374d8c65e86f16952e0b","observation_id":"a67842d9-e018-4f27-a2d6-f5a6c0c93625","resolution":{"observed_at":"2026-08-06T20:43:56.897955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06040","last_updated":"2024-10-25T06:32:09Z","snapshot_observed_at":"2026-07-06T18:27:58.433967Z","submitted_at":"2024-06-10T06:17:55Z","title":"Vript: A Video Is Worth Thousands of Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06040","snapshot_observed_at":"2026-08-06T20:43:56.117027Z","title":"Vript: A video is worth thousands of words","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:56.117027Z"},"links":{"cited_paper":"/paper/2406.06040","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:7d61619456e6f17ca35b29c5390b408ada9f97e0c10cc8d57ce88b349af5aacb","observation_id":"ae47c4a9-105c-400c-bcc5-1530b30d7e8f","resolution":{"observed_at":"2026-08-06T20:43:56.117027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T20:43:56.196408Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:56.196408Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:8aa2562179eea28dc63bbe32275c36ea38e76e08e165d30aa4b2cb9bbffcf289","observation_id":"79c2dbd5-ad44-4826-90c9-d8dd9ada56d2","resolution":{"observed_at":"2026-08-06T20:43:56.196408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.570045Z","title":"Multimodal c4: An open, billion-scale corpus of images interleaved with text","venue":null,"work_id":"3801f22a-1675-4e37-8ab8-05f5ac67c1fb","year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:56.260106Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:9ed117969eb1704ca91ef7cb3e028c5453c5dbca10215e5d6d23cc8bb93e9c4e","observation_id":"acf65951-163e-4df2-8e47-77145e20c97e","resolution":{"observed_at":"2026-08-06T20:43:56.654879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.01938."}