{"as_of":"2026-08-18T19:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fbed9d93895963805b38e422ee9ac1b58ef1ca505af937c35abb08076604dff0","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:30:23.560193Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:20:14.972158Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:28:55.542980Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-08-11T05:20:14.972158Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.972158Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:6b8eb0c290f5f05628a42f6872bf547fc493676bec6a4308fa56f48a4177cc09","observation_id":"85fa5572-3bdd-41d3-ba03-3cfb56585fa4","resolution":{"observed_at":"2026-08-11T05:20:14.972158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-08-10T21:20:16.114855Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05442","last_updated":"2025-08-02T21:44:27Z","snapshot_observed_at":"2026-08-12T13:53:58.682629Z","submitted_at":"2025-01-09T18:55:15Z","title":"Progressive Growing of Video Tokenizers for Temporally Compact Latent Spaces","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:20:16.114855Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2501.05442"},"observation_digest":"sha256:c6d9a3a0a08642f063d471c08c9377d776a9107e955c52f2bebac92c1b270203","observation_id":"4427e8f9-248f-42a0-b985-b4244c81698b","resolution":{"observed_at":"2026-08-10T21:20:16.114855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":"2412.13061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-07-03T20:28:55.542980Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":"3a3fbc0b-f99d-4ffc-91fb-24126e805e41","year":2024},"citing_paper":{"arxiv_id":"2506.00433","last_updated":"2026-04-15T21:38:44Z","snapshot_observed_at":"2026-08-14T23:57:23.400202Z","submitted_at":"2025-05-31T07:28:32Z","title":"Latent Wavelet Diffusion For Ultra-High-Resolution Image Synthesis","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T12:00:37.025335Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2506.00433"},"observation_digest":"sha256:c575fa06fbda9637d292c1081b1fffd9903ee7bc496a48a4d6b584ec8cf63c18","observation_id":"bb307e0d-63c7-494c-a2ec-9efa73f29d14","resolution":{"observed_at":"2026-05-19T12:02:16.754970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-08-07T11:49:45.159313Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-14T16:25:04.079292Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.159313Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:f45535bccc532b39691f046f41fbfb84260823b5d199c97985124990307ecac0","observation_id":"ef69d201-f105-4960-bf9c-554ac4c7e766","resolution":{"observed_at":"2026-08-07T11:49:45.159313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-08-07T10:28:40.611770Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.611770Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:9ef864ed084c41adc9f1244a02a733c06a4e2677a12a395ef8a643f5dd23b38a","observation_id":"33048bd2-577b-4e5a-97b2-1f0dc8a1447e","resolution":{"observed_at":"2026-08-07T10:28:40.611770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-08-05T20:49:52.048245Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09858","last_updated":"2025-08-13T14:50:19Z","snapshot_observed_at":"2026-08-16T14:06:34.079160Z","submitted_at":"2025-08-13T14:50:19Z","title":"HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:49:52.048245Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2508.09858"},"observation_digest":"sha256:b95c5a630a25a772ff73e2e91ce359634adfe163848bd0ad09d1e0d75567bec7","observation_id":"6e61c7d4-8052-44c3-8a74-56aecbe1d57e","resolution":{"observed_at":"2026-08-05T20:49:52.048245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":"2412.13061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-07-03T20:28:55.542980Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":"3a3fbc0b-f99d-4ffc-91fb-24126e805e41","year":2024},"citing_paper":{"arxiv_id":"2606.17590","last_updated":"2026-06-16T06:52:52Z","snapshot_observed_at":"2026-08-13T12:30:51.704665Z","submitted_at":"2026-06-16T06:52:52Z","title":"TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-06-27T01:20:32.508409Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2606.17590"},"observation_digest":"sha256:252318192aef880a1697f5631984852e07428921f2551c429696335b1a69aaea","observation_id":"05f6dd02-a832-45f5-9bea-877cd866512f","resolution":{"observed_at":"2026-07-03T20:28:55.544391Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":"2412.13061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-07-03T20:28:55.542980Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":"3a3fbc0b-f99d-4ffc-91fb-24126e805e41","year":2024},"citing_paper":{"arxiv_id":"2606.30811","last_updated":"2026-06-29T18:35:17Z","snapshot_observed_at":"2026-08-12T18:43:43.847422Z","submitted_at":"2026-06-29T18:35:17Z","title":"AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-01T06:16:13.420481Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2606.30811"},"observation_digest":"sha256:b3020ea1d93444d2dcd2cac139503705e7ac31ddcbe1493ad6fc44a4b529dcee","observation_id":"c365d70a-3fee-412a-8dc8-0e461a32b98b","resolution":{"observed_at":"2026-07-01T09:45:39.991649Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-08-02T00:50:14.926631Z","title":"Vidtok: A versatile and open-source video tokenizer.arXiv preprint arXiv:2412.13061, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14898","last_updated":"2026-07-16T12:16:12Z","snapshot_observed_at":"2026-08-14T17:25:24.450056Z","submitted_at":"2026-07-16T12:16:12Z","title":"FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T00:50:14.926631Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2607.14898"},"observation_digest":"sha256:c7678e53d690a4ca6320860f53adfb79b03f8f12174a951adb9b601cf49989eb","observation_id":"817a5b73-23f6-472f-8b79-7989bc4ca8c3","resolution":{"observed_at":"2026-08-02T00:50:14.926631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.13061/citation-record","integrity":"/paper/2412.13061/integrity","json":"/paper/2412.13061/citation-record.json","paper":"/paper/2412.13061"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.13185","last_updated":"2024-04-07T12:11:28Z","snapshot_observed_at":"2026-08-16T14:16:52.605575Z","submitted_at":"2024-02-20T17:52:12Z","title":"UniEdit: A Unified Tuning-Free Framework for Video Motion and Appearance Editing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13185","snapshot_observed_at":"2026-08-11T13:30:23.456291Z","title":"Uniedit: A unified tuning-free framework for video motion and appearance editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.456291Z"},"links":{"cited_paper":"/paper/2402.13185","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:3dc76e9fdfb709a3548f108b994ad723c11798d0773fe01512aefb07d50d0206","observation_id":"77a296c0-a3c4-4f0f-877a-366b7ade12d6","resolution":{"observed_at":"2026-08-11T13:30:23.456291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01199","last_updated":"2024-09-09T13:49:53Z","snapshot_observed_at":"2026-08-16T13:22:05.398625Z","submitted_at":"2024-09-02T12:20:42Z","title":"OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01199","snapshot_observed_at":"2026-08-11T13:30:23.476606Z","title":"Od-vae: An omni-dimensional video compressor for improving latent video diffusion model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.476606Z"},"links":{"cited_paper":"/paper/2409.01199","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:3f1dc7ed811bcf8e14c646b409a33d32bdbda3e174f9d6b6f65ba397ad9eebd9","observation_id":"5af6f8cb-127d-4553-9916-701a0d77dd2c","resolution":{"observed_at":"2026-08-11T13:30:23.476606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-11T13:30:23.496120Z","title":"Layer normalization.arXiv preprint arXiv:1607.06450,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.496120Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:ccdfe6ab16167119731ceaa80662c836819884b889bb31bee41bd6efd9db3e4c","observation_id":"d78e62f2-88b6-4212-affb-e5460ddfd3e7","resolution":{"observed_at":"2026-08-11T13:30:23.496120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09399","last_updated":"2024-06-13T17:59:26Z","snapshot_observed_at":"2026-08-16T13:43:13.302899Z","submitted_at":"2024-06-13T17:59:26Z","title":"OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09399","snapshot_observed_at":"2026-08-11T13:30:23.537169Z","title":"Omnitokenizer: A joint image-video tokenizer for visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.537169Z"},"links":{"cited_paper":"/paper/2406.09399","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:0b42e982b042037a08c7f322907bdeba1f7de01d05e55af18dfd2b7ee243cf72","observation_id":"e239a439-bd92-4ea4-bb36-fb3388c6a8a2","resolution":{"observed_at":"2026-08-11T13:30:23.537169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-11T13:30:23.548962Z","title":"Videogpt: Video generation using vq-vae and transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.548962Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:e916ea2c29b086d1a07c48da5bb1f7b10064a96fcdec7d76c2e1a31090a17845","observation_id":"97ab6a6c-c23e-4a05-83f9-00e8e492a65d","resolution":{"observed_at":"2026-08-11T13:30:23.548962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-11T13:30:23.543239Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.543239Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:efe23ac6dc3094f91df800499e432309d88b843248686ded9980fc2dfca99ed9","observation_id":"19f470f6-33c2-4dc8-a6fd-297f4b00601b","resolution":{"observed_at":"2026-08-11T13:30:23.543239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-18T04:00:09.136122Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-11T13:30:23.521476Z","title":"Open-magvit2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.521476Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:7d34e24c12e0c79a588314d174ac8337a3effa73d02af725fd7f8a8af8c6786e","observation_id":"b007f36e-c663-488b-9de0-2b7091447943","resolution":{"observed_at":"2026-08-11T13:30:23.521476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:30:23.892832Z","title":"Kingma and Max Welling","venue":null,"work_id":"bdeb449f-521c-4cb9-baa1-467beb22940b","year":2014},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.489151Z"},"links":{"citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:197a01bb7a2520d7056e4c576470cfceab69877ea0b44e2abdd4cebddade6070","observation_id":"93ccae42-6308-4ddb-b643-350e976d7735","resolution":{"observed_at":"2026-08-11T13:30:23.900088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-11T13:30:23.503825Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.503825Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:0139aaf49efb9f6544f91f349b8d8633d58b0ef3c0adbda6796f9de3d6afa29c","observation_id":"f4b6b843-8591-45de-9fc5-9e874022bcf7","resolution":{"observed_at":"2026-08-11T13:30:23.503825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:30:23.872636Z","title":"Mcl-jcv: a jnd-based h","venue":null,"work_id":"19573df5-35ec-432d-be91-ee8d5cfbb4e3","year":2016},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.529604Z"},"links":{"citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:bb5b9fd57bb8b1fd241f363d59f0790b572418edea4e037afd619d6523c19a28","observation_id":"15c788fe-4e63-44af-8e05-70643bec5acb","resolution":{"observed_at":"2026-08-11T13:30:23.879226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07356","last_updated":"2025-03-19T10:22:15Z","snapshot_observed_at":"2026-08-17T12:53:36.850015Z","submitted_at":"2024-07-10T04:27:06Z","title":"Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07356","snapshot_observed_at":"2026-08-11T13:30:23.560193Z","title":"Video in-context learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.560193Z"},"links":{"cited_paper":"/paper/2407.07356","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:fb7ff2bccfe61f68123bde8b47e291c801a679210d814594ad1af770c14d3094","observation_id":"26e6b10e-eba2-4e9f-b75a-467e885db8f3","resolution":{"observed_at":"2026-08-11T13:30:23.560193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01808","last_updated":"2024-01-03T16:10:07Z","snapshot_observed_at":"2026-08-16T14:30:04.243738Z","submitted_at":"2024-01-03T16:10:07Z","title":"aMUSEd: An Open MUSE Reproduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01808","snapshot_observed_at":"2026-08-11T13:30:23.511895Z","title":"amused: An open muse reproduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.511895Z"},"links":{"cited_paper":"/paper/2401.01808","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:2a4f0424a12b2cd36476babbb58371a476137c23c0701eeaae7388a53209661e","observation_id":"29f3b717-890d-4ee9-83b6-8e1dc5890046","resolution":{"observed_at":"2026-08-11T13:30:23.511895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-18T00:41:06.039123Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T13:30:23.482600Z","title":"Imagen video: High definition video generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.482600Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:f92312e44ad9ec624542387ebec7d6eceee9f55bf3ccfc8a2867a065ff6dd847","observation_id":"8b702859-d4c0-4d7c-a5eb-d9652f86e853","resolution":{"observed_at":"2026-08-11T13:30:23.482600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T13:30:23.554765Z","title":"Learning interactive real-world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.554765Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:a2cfd82319c89929ee27a8876a858dd8febcdea7fcaac7bed7def3beeac0d59b","observation_id":"cea75237-4c0a-42a1-85e9-6cc0e579c6f5","resolution":{"observed_at":"2026-08-11T13:30:23.554765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-11T13:30:23.470488Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.470488Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:cedd446768a027940516b1fb69db4323fa847dbd249fb2e38fecaa783a88af88","observation_id":"c8dc4f06-7ca2-4600-a146-0675eee0062f","resolution":{"observed_at":"2026-08-11T13:30:23.470488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T13:30:23.464444Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T13:30:23.464444Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.13061"},"observation_digest":"sha256:eac6834584f8b63c4965a84660caad498c8ac7d7347ab9f5a97aa33828d57a6f","observation_id":"7a67941b-4140-4d96-8879-d984c906f2eb","resolution":{"observed_at":"2026-08-11T13:30:23.464444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 9 inbound Pith citation observations for arXiv:2412.13061."}