{"as_of":"2026-08-14T02:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d7463ee1c3a03e43b4eb25197d1e93f335665e694cd6bd1406cc4edee5d9495","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:00:31.863822Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T08:52:31.686474Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T08:52:31.987543Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"cited_work":{"arxiv_id":"2411.14762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14762","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient long video tokenization via coordinated-based patch reconstruction","venue":null,"work_id":"2bc56a9d-5270-4eeb-9604-9eb7f5a72800","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2411.14762","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:69a59c0e7e3eb1dde8456d31358f017bca87777e584ff5732fe03ca0dc16706e","observation_id":"70bc0a3e-e3ef-4560-86b2-de67a24c6e60","resolution":{"observed_at":"2026-05-11T08:52:31.993969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14762/citation-record","integrity":"/paper/2411.14762/integrity","json":"/paper/2411.14762/citation-record.json","paper":"/paper/2411.14762"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.792275Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"ec4ea9a6-69d5-4a29-b898-7f4915afe6c5","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.572869Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:010649e83652edbdf3e4505d04713150d9a3147825ba1a551f162f53ab7a578d","observation_id":"fdcf8ded-eaa4-48f4-ac5e-3ef9afc0e199","resolution":{"observed_at":"2026-08-12T15:00:32.797094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.778815Z","title":"Video generation models as world simulators.Ope- nAI Blog, 2024","venue":null,"work_id":"7668b309-67b1-4f60-a27f-bbf59787a920","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.577481Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:569c15e5512b8906214c853ade39d1370ebc0263d32f45b644e4f4e0242b7565","observation_id":"f75b73ef-49af-4791-8269-8e9a2363f1b3","resolution":{"observed_at":"2026-08-12T15:00:32.783433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.765127Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"3727c2b3-e0a1-4e1f-abdd-a2ab44d8375c","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.581261Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:117711b72db61f182f14fcb9717651fb8758c7b3c29047e5953d44b79c22faa1","observation_id":"eb1be525-3e00-4e47-9835-08ef5b59f461","resolution":{"observed_at":"2026-08-12T15:00:32.769593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.749582Z","title":"Efficient geometry-aware 3d generative adversarial networks","venue":null,"work_id":"733bdc1a-f94f-47f5-ac2b-591d9c28a06f","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.585350Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:bc9dbb63b5a1c5ac62ade018239a3213429730fa88d0bbfac979c6028f0f40d0","observation_id":"3d82438e-94fb-4764-95b3-9d558cdb7a53","resolution":{"observed_at":"2026-08-12T15:00:32.754149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.735155Z","title":"MaskGIT: Masked generative image transformer","venue":null,"work_id":"85e22085-159b-483e-9039-35db09e6bab0","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.588957Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:76a77af34a3f269a550a3eb4e9ad75bafa920a680102719933c17f4bc2c81a67","observation_id":"aa3b9a8d-a7bd-45b2-a84e-1161229179ad","resolution":{"observed_at":"2026-08-12T15:00:32.739628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.722000Z","title":"VideoINR: Learning video implicit neural represen- tation for continuous space-time super-resolution","venue":null,"work_id":"549c1074-0aed-4a03-bcb1-543a66f40111","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.592709Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:3c6dd732be40b71287f1f42588ec5abf0f56fd94fe249fe587573d6ee925c568","observation_id":"5e026116-80e1-4e49-bc7d-a2b52585c019","resolution":{"observed_at":"2026-08-12T15:00:32.726521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.708433Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"e9d0feb2-d5cd-4ed7-ab0a-1a1288f6dc26","year":2021},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.596493Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:c1f9a4e66476e0c055374c8186d94e4b10767ea40215529cf5c2566df522cddc","observation_id":"eb7fb135-130b-4adc-8f15-7e81c1d3dfcc","resolution":{"observed_at":"2026-08-12T15:00:32.713298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.692869Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"23c76726-4021-454a-9ae1-4e42f022b6ff","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.600143Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:85a6c5bdd6a8cb51e361fc3a6d658fb5e0b50ba38948b5fb6edd6842b89d1e43","observation_id":"e3104583-958f-464b-8f19-53c50cea674e","resolution":{"observed_at":"2026-08-12T15:00:32.698626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.679861Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":"a866bc01-1785-40f5-be1e-acc63c3f6041","year":2025},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.603912Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:36dae874db39de3cdbf4f05170a18e5c9c445120fda8d2d1e9d08c2cb8f959da","observation_id":"f3793d6f-e1eb-4587-aa6c-6d9df4e143f2","resolution":{"observed_at":"2026-08-12T15:00:32.683996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.666216Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":"39435156-92b1-4de3-9f7c-7def9851a40e","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.607393Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:9e6b6ea087a54bc23d910cfc45ccd59e307528582f4ab43565c0ca6d01027905","observation_id":"6ab4570e-0667-49a7-a293-7d0f1f07e86f","resolution":{"observed_at":"2026-08-12T15:00:32.670460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.654198Z","title":"Long video generation with time-agnostic vqgan and time- sensitive transformer","venue":null,"work_id":"5ecf458b-2967-4cd0-b63c-6f1ef520f821","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.611475Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:e01af69f7cb21ff2b876cf3242c8202f6be37a538c80e573f837566ab0adb408","observation_id":"34bcc14b-7ae8-4cd8-8814-30d0d0ec37d6","resolution":{"observed_at":"2026-08-12T15:00:32.658379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:31.615363Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.615363Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:12563ee13e5d3a51a6ced59103d7d79b27915e525205b2dc4ea5997ce3af8aad","observation_id":"97a2ac37-c453-4817-861f-2f0f12886975","resolution":{"observed_at":"2026-08-12T15:00:31.615363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.634443Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"64823b77-42d2-4289-98a0-b71712dea9b9","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.619377Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:e0e39321bd6d6104a62af139b57f3e39b765ef97f99269e30708634e9d21b96d","observation_id":"23499501-afd2-4824-a499-3965b05ee614","resolution":{"observed_at":"2026-08-12T15:00:32.638853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.621955Z","title":"A technical overview of av1","venue":null,"work_id":"ce136f18-3e49-4b20-9786-0e8a55a776f9","year":2021},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.623316Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:44738fd3d4865dc24e5b2f289e8559732f10ef7ec8ea760f09a8dd0a0abfc0fc","observation_id":"4db7a237-a658-48e2-87a1-e618b108fc0c","resolution":{"observed_at":"2026-08-12T15:00:32.626160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-12T15:00:31.627658Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.627658Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:b53f281e0bacd3443c7f97d06db3d5024c668294a8c1fd51947fda4d015a27cc","observation_id":"9b64092f-be6f-4740-991c-a871edfe2b6f","resolution":{"observed_at":"2026-08-12T15:00:31.627658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.608251Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"d7b2722a-2506-4ef6-a96b-fd7b193914c3","year":2020},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.632169Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:4d81b993e62fa18ae42ec7d8d9276df4c255045752ae4625f421749da54e0398","observation_id":"7986910f-9192-4604-b608-ee87e563ef7d","resolution":{"observed_at":"2026-08-12T15:00:32.613170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.595795Z","title":"CogVideo: Large-scale pretraining for text-to- video generation via transformers","venue":null,"work_id":"1038e80e-787c-4b27-bffa-1ba46dd664e2","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.635831Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:de3f0530c3b05f3b08c5ec59936e4626c83d1b5dda3932ea267bc4c750ab51e5","observation_id":"06fba8ce-8705-4ce4-aa4e-c69e33e6896f","resolution":{"observed_at":"2026-08-12T15:00:32.600180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.583166Z","title":"LRM: Large reconstruction model for single image to 3D","venue":null,"work_id":"94e0040f-bb3b-463b-b8c9-c171972c9edc","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.639953Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:dcee72943effd490465451a253fead5f632943c29f9cfefb2d1316ec395ce0a4","observation_id":"b89f7285-0f2e-4717-92a7-7e192ee4b81c","resolution":{"observed_at":"2026-08-12T15:00:32.587947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02463","last_updated":"2023-05-03T23:59:13Z","snapshot_observed_at":"2026-08-12T18:09:04.196531Z","submitted_at":"2023-05-03T23:59:13Z","title":"Shap-E: Generating Conditional 3D Implicit Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02463","snapshot_observed_at":"2026-08-12T15:00:31.643821Z","title":"Shap-e: Generat- ing conditional 3d implicit functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.643821Z"},"links":{"cited_paper":"/paper/2305.02463","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:aa776f8c58689ca247f76045f84712288691bca387f31a772f300f813ba24c8f","observation_id":"ccc72d19-cf63-4fcd-a704-37c7873e9d70","resolution":{"observed_at":"2026-08-12T15:00:31.643821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.571741Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":"0095e1b1-b13f-42fb-ad32-4a3cb2df4f88","year":2020},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.648125Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:a6a5b8c28a917fa731c94a25595cc2041e0da10290593ba4c8b5d6112383027d","observation_id":"119ccc18-5727-4a3a-8897-8997a5ba4761","resolution":{"observed_at":"2026-08-12T15:00:32.575638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.559974Z","title":"Hybrid video diffusion models with 2d triplane and 3d wavelet rep- resentation","venue":null,"work_id":"2a2acc19-b4e9-48d7-8317-652baa18cc6b","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.651927Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:f0d21cf98fb04265e0cc3785c2b21296eddabe188101fa831b81714ed0192aff","observation_id":"2583c661-2372-4d60-87fe-c2a7f33577af","resolution":{"observed_at":"2026-08-12T15:00:32.564535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.548273Z","title":"Scal- able neural video representations with learnable positional features","venue":null,"work_id":"ae21140b-3ed8-464b-89bf-a872a12d8bdc","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.656101Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:3b68e8d3972ac26ef764f9beb91704fc12f3a3c9fde1b35a4ca854723d22e999","observation_id":"9bcbdfec-f263-4587-879f-00f1ef29cf94","resolution":{"observed_at":"2026-08-12T15:00:32.552140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.536527Z","title":"9 Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":"fac7f024-d23a-4c34-9540-925c951072a2","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.660065Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:253a75cd693bc31ccb437f0de3eb9905115fafac44e15ad416d5bedc0e95f930","observation_id":"b01e019c-8d81-4a69-91fb-c4a39d026ed2","resolution":{"observed_at":"2026-08-12T15:00:32.540537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.523090Z","title":"One-2-3-45: Any single image to 3d mesh in 45 seconds without per-shape optimiza- tion","venue":null,"work_id":"af2d5e09-15e1-4a11-8290-0f272f27afe4","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.663773Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:bb4b55e049a81fb3339c8eab9d0bbeb93892a796ce610b131b38014c2f773fa0","observation_id":"89bcc7af-9278-4274-9cf9-8bb033ec06c1","resolution":{"observed_at":"2026-08-12T15:00:32.527621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.508646Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"42b52bc2-84fe-4857-ac5a-24af58b92d9c","year":2018},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.667725Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:c9cb883931c13fbc707edf1f2d95dc73ed76edb3c95209b1b41cb647302af22d","observation_id":"25a2cb62-04f1-4d72-9ff9-3a1e82af3650","resolution":{"observed_at":"2026-08-12T15:00:32.513140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.496991Z","title":"Vdt: General-purpose video diffusion transformers via mask modeling","venue":null,"work_id":"5af450c2-567f-46b3-82ba-cdbd035c7c2c","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.672238Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:179947eb263b3ef469b527f5f6e30662c3e63679f259c0044c28cf5f726047b1","observation_id":"4b571676-00d6-4ce0-a8ca-29d01e70efc0","resolution":{"observed_at":"2026-08-12T15:00:32.500891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.485181Z","title":"SiT: Explor- ing flow and diffusion-based generative models with scalable interpolant transformers","venue":null,"work_id":"58b5817b-13cb-4593-a84a-37293d0dfb19","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.676893Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:869b22f524cfca6da523b6a86622aa5a088018b295d0c4a5efb40e8245923ce6","observation_id":"bc0fb863-4141-40b1-a09b-09d638cb210f","resolution":{"observed_at":"2026-08-12T15:00:32.489274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.473644Z","title":null,"venue":null,"work_id":"34bc9aad-c864-4da5-8fcf-3d8f58227596","year":2006},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.681174Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:aa94622d6371641382093553cf3736935d19d94970d59a1e3042306a2df77aee","observation_id":"d457ce73-e466-4c2e-8381-becbc9a8c05f","resolution":{"observed_at":"2026-08-12T15:00:32.477424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.462602Z","title":"GTA: A geometry-aware attention mechanism for multi-view transformers","venue":null,"work_id":"4f31641d-a066-4c9a-8d46-4629191a34e5","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.685014Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:4ef5fa32908ff1a08e77a585e0e49d0c35587b225f061991c70fe84db246d787","observation_id":"67b4eefb-c27d-444d-9096-c39431ff008a","resolution":{"observed_at":"2026-08-12T15:00:32.466216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.451450Z","title":"A technical overview of vp9—the latest open- source video codec","venue":null,"work_id":"568e3f47-24e3-48d4-89b3-a395aa3ae1bb","year":2015},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.689257Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:12399cd1272a58a2319534849bdf83954161d1ed6131161a890350089b313b22","observation_id":"1dbf2046-3ea5-4a77-93b0-f49b07b4714c","resolution":{"observed_at":"2026-08-12T15:00:32.455366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.440207Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":"e4d13183-4e47-405c-8426-19ff727ddec6","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.692949Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:de8a2aeb0d944870a005ddeec02d82186eb4651a2ae4f1d63947e093f6ebcdbf","observation_id":"ad6e4414-6f95-47fe-a77c-c24e55c5d805","resolution":{"observed_at":"2026-08-12T15:00:32.443835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-12T15:00:31.696802Z","title":"Searching for activation functions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.696802Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:bb7acb51b49331d50ca274cdf7a291039c72452e708e9fd0d8bede23b1efbbc3","observation_id":"57d5776b-bb05-4dcc-a1c5-a1ef3a6604e4","resolution":{"observed_at":"2026-08-12T15:00:31.696802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.428861Z","title":"Gen- erating diverse high-fidelity images with VQ-V AE-2","venue":null,"work_id":"ce3cbe37-7e89-4a76-8eed-f71f21bfb40a","year":2019},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.701691Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:17b9ba875c505825b335cb491c702c88853af7f16e265144bfc2061d18a87f34","observation_id":"5aa3a3e9-6158-4f0f-9702-dac7df8b7070","resolution":{"observed_at":"2026-08-12T15:00:32.432784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.417787Z","title":null,"venue":null,"work_id":"3a9227d6-952c-4521-91b5-e2a85cf88526","year":1996},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.705694Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:3afab06ddf24b2bf78b7079ffc456e920ee7e26fb0d0ab160c5e15560250bf35","observation_id":"f2886f5a-f047-40c4-af65-c37818a9c56c","resolution":{"observed_at":"2026-08-12T15:00:32.421758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.405138Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"39743667-7018-475e-916b-1728951992f6","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.709569Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:180496c266b93c4a0f339e794b9f7236a2692f07c46d8252727b2a22486456ac","observation_id":"a18308e8-319a-4fe1-b3e3-757968f84b19","resolution":{"observed_at":"2026-08-12T15:00:32.409639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.392365Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":"fc5c2051-b576-40f3-ad20-4d97ac9e4754","year":2015},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.713764Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:c1e484e085335a8bf09ce943910336a6204987d51ece978cf710dd62c513b01d","observation_id":"3d34d4a6-566b-48cd-a0bb-1362fd2f2706","resolution":{"observed_at":"2026-08-12T15:00:32.396543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.380933Z","title":"Make-a-video: Text-to-video genera- tion without text-video data","venue":null,"work_id":"d2e8a3bc-53a7-4d5f-8f64-4c72970f989c","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.717461Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:15bc6b8f39198c0545863e53dfef46f2f63a627080823d5ad9ba36a75120405b","observation_id":"91c6350e-d218-4ee8-9233-7f2c3d88a18b","resolution":{"observed_at":"2026-08-12T15:00:32.384816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.369570Z","title":"Implicit neural representa- tions with periodic activation functions","venue":null,"work_id":"e6cfd303-c6c2-44c6-a377-b7f0bc9c6c98","year":2020},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.721583Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:b835471c8269301f568639b05e41274ff5cef0e75c3f9ab36f276ed38e39e7a5","observation_id":"f3185d23-d447-4bdf-a296-083fe22438fb","resolution":{"observed_at":"2026-08-12T15:00:32.373542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.358434Z","title":"StyleGAN-V: A continuous video generator with the price, image quality and perks of StyleGAN2","venue":null,"work_id":"a9b33314-92e6-4813-a5a7-b4444c78da20","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.725686Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:2de40721eee0e4a9c70e75e7872ca5d7493c7e9903a620133a8741f4a2aef641","observation_id":"13444ad6-3774-42a8-9510-6b8b174bca62","resolution":{"observed_at":"2026-08-12T15:00:32.362332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.346479Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"3c23b4a5-004a-4971-9544-be9ea4819d68","year":2015},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.729635Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:f45ae720a64fc9d96bf0cca540056290cdb18155b4b4219b224193aedd7ded40","observation_id":"9fff845b-dfb7-496c-b99e-717e285337d9","resolution":{"observed_at":"2026-08-12T15:00:32.350579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:31.733649Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.733649Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:a628b69913f8a188508faa1e1f19d4de20d8e42be1ebc28c8079308a256a7f62","observation_id":"1f597a3a-b91d-4043-a645-2e654262f980","resolution":{"observed_at":"2026-08-12T15:00:31.733649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-13T22:00:40.727122Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-12T15:00:31.737759Z","title":"UCF101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.737759Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:38f70af0ba212a0e011d30ba814edba3d55a797d2846e961f808d4ecf52f7850","observation_id":"d5c6504b-2b2a-4f1e-be6f-544205df4572","resolution":{"observed_at":"2026-08-12T15:00:31.737759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.322561Z","title":"Overview of the high efficiency video coding (hevc) standard","venue":null,"work_id":"345e6933-181f-436a-984d-a109f44758ee","year":2012},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.742133Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:09e4106b49328968d872c8283652ca29c37e50de233793cfede84914d77f642a","observation_id":"4d800118-b594-4f40-a788-3b185c273d1f","resolution":{"observed_at":"2026-08-12T15:00:32.327288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.308816Z","title":"High efficiency video coding (hevc)","venue":null,"work_id":"decf5b28-003c-4e52-9129-389e5333dd87","year":2014},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.746289Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:2477ce8d4b931ade6a0debf1b376afc1ebe49417846783bd8900c8959965821f","observation_id":"3ef89911-018b-4328-8a64-e81a56f45be6","resolution":{"observed_at":"2026-08-12T15:00:32.313267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-12T15:00:31.750358Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.750358Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:9bba0f585fefec749f1595b5e9cf55474bfe28982db7315f470f952c1ec94ecf","observation_id":"cb39484a-e85c-428f-8d84-f58fea5c2a79","resolution":{"observed_at":"2026-08-12T15:00:31.750358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.295994Z","title":"A good image generator is what you need for high-resolution video synthe- sis","venue":null,"work_id":"876851cb-942d-4caa-9936-ad4b71719682","year":2021},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.755065Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:9d5e786b8cea73e5fca02e9317340b113123e5357dbac41081d69e692965b68e","observation_id":"0215fffb-bf82-4712-85b6-80e83bcdab26","resolution":{"observed_at":"2026-08-12T15:00:32.300153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.282196Z","title":"MoCoGAN: Decomposing motion and content for video generation","venue":null,"work_id":"2cf9bfa6-bf18-46e3-bb73-2a93f1c3f303","year":2018},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.759054Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:6dc7bbdb3c4766d0d375cf5d533f48fbecb33bb9031976b67517bb189eae783a","observation_id":"7fb30c56-3d25-4d54-9f8f-83e725facdc9","resolution":{"observed_at":"2026-08-12T15:00:32.286251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.269962Z","title":"FVD: A new metric for video generation, 2019","venue":null,"work_id":"78640949-0513-4161-9951-1ffb4891f844","year":2019},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.763337Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:707fe2a63d43732b3a2377b65f2e4a20ec615136ad4564139bb9643702f9dfbc","observation_id":"9097d2a1-1571-4097-897d-24e5046186b7","resolution":{"observed_at":"2026-08-12T15:00:32.274143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.256020Z","title":"Neural discrete representation learning","venue":null,"work_id":"b91fbd0a-cb46-43d0-955d-ae6500d9b6c5","year":2017},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.767489Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:be482096e8417cd03e8ac7c1a118e349ffd105fd63c4fec036aaf89503f45363","observation_id":"4d08fda6-9913-4f49-bf22-d1030e6af355","resolution":{"observed_at":"2026-08-12T15:00:32.260738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:31.771230Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.771230Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:bbffe1e8a53be97c33245553b6db04a8d55f9daa93db36b7905c7d6d8679b285","observation_id":"77a92c12-139b-4592-98c1-d859db907317","resolution":{"observed_at":"2026-08-12T15:00:31.771230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.234895Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"b7f1f18d-c86f-40a3-a576-de8d2646bc38","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.775210Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:64787f53c65f185fa12a07c4c634ad1a06a7936e4f8f395b3301da5d2bb98e8d","observation_id":"1e750476-372d-4cb5-a05b-aff5c483d654","resolution":{"observed_at":"2026-08-12T15:00:32.239330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21264","last_updated":"2025-06-16T22:06:19Z","snapshot_observed_at":"2026-08-12T22:13:33.857480Z","submitted_at":"2024-10-28T17:57:07Z","title":"LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21264","snapshot_observed_at":"2026-08-12T15:00:31.779652Z","title":"LARP: Tokenizing videos with a learned autoregressive generative prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.779652Z"},"links":{"cited_paper":"/paper/2410.21264","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:1c8a3ae01921650f058e6deeb0ef0a997144ebee06d18877dd2fca55285884d2","observation_id":"5e73021d-f44d-4ac8-8af3-0535260537c7","resolution":{"observed_at":"2026-08-12T15:00:31.779652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.219859Z","title":"OmniTokenizer: A joint image- video tokenizer for visual generation","venue":null,"work_id":"ae3cf756-4747-446d-a9ee-e2ab684c6a77","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.784395Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:801f5004d189f406345b58456c523eab194bfa7ba59750375531e11558b66bda","observation_id":"f7fc426f-fe45-4413-af71-f7bb0955850c","resolution":{"observed_at":"2026-08-12T15:00:32.225131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-12T15:00:31.788200Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.788200Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:24e3e7615cde3e32c5a26c46e77e2af39a15a8025c5473db956f4ae6473365ec","observation_id":"2d9ba59e-87c2-4426-b397-bd9c44f16421","resolution":{"observed_at":"2026-08-12T15:00:31.788200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:31.793683Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.793683Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:e13bec2d4e9e4f4eb01ed5adc6b917ba09a2474cefd29e669cf226d04716257b","observation_id":"62662224-3a6e-4b82-bace-80303f622e74","resolution":{"observed_at":"2026-08-12T15:00:31.793683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.190484Z","title":"Overview of the h","venue":null,"work_id":"16f62310-7d96-4584-8b40-7560826d4027","year":2003},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.798745Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:c2e04c65e274c2b1c88f4601a83a1e6bf7df0ab9002d4013138c7faea077d2bb","observation_id":"f9676269-962f-46f7-aaa5-e263ee516df8","resolution":{"observed_at":"2026-08-12T15:00:32.201195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.176864Z","title":"Group normalization","venue":null,"work_id":"16433f8a-a2e2-4b75-ac39-61ce24e21026","year":2018},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.803530Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:092431696a4feccaebb115254521b12c324d825348abd9cfcc575b3df5a12f90","observation_id":"8f20aa74-0595-41db-8739-232e8b4a8c1e","resolution":{"observed_at":"2026-08-12T15:00:32.181726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-13T14:30:50.605700Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-12T15:00:31.807670Z","title":"Videogpt: Video generation using vq-vae and trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.807670Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:4c6c3c0b86b6965c0eb334c050e67befe553372bf8806ea0532d204bdb67f2d0","observation_id":"0a4afa8b-aee9-4585-8e79-e699a29ca685","resolution":{"observed_at":"2026-08-12T15:00:31.807670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.164374Z","title":"Temporally consistent transformers for video gen- eration","venue":null,"work_id":"4d409c51-2f4a-4327-b9aa-b9bf684cadcc","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.811547Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:fb24b573528e7a0bf717b2a5cd6bf16eae21cde723a979b0d9ca28b2f5e025b5","observation_id":"d2082f80-eb7f-4a40-9876-f6cc0be50748","resolution":{"observed_at":"2026-08-12T15:00:32.168884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08368","last_updated":"2025-02-02T19:28:27Z","snapshot_observed_at":"2026-08-13T14:17:36.830788Z","submitted_at":"2024-10-10T20:54:15Z","title":"ElasticTok: Adaptive Tokenization for Image and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08368","snapshot_observed_at":"2026-08-12T15:00:31.815756Z","title":"ElasticTok: Adap- tive tokenization for image and video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.815756Z"},"links":{"cited_paper":"/paper/2410.08368","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:d84a792f4aadeb8c6cc45eb5b58aada7823df57578d6d448129787744964af8a","observation_id":"47d1455c-4771-4e51-b3fa-d1ece7871991","resolution":{"observed_at":"2026-08-12T15:00:31.815756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-12T15:00:31.819677Z","title":"CogvideoX: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.819677Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:dcc47e57de71a6dd12cb2ed0b7bed5ab6ddeae43c7399a8a5e100ba397af07d0","observation_id":"4992d67d-bb4f-46f8-b665-d215be3bcc53","resolution":{"observed_at":"2026-08-12T15:00:31.819677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.151320Z","title":"Towards end-to-end generative model- ing of long videos with memory-efficient bidirectional trans- formers","venue":null,"work_id":"bca3ec90-fcab-497a-bd9c-391df072d954","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.823951Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:120fa8ea916370f58903203e3a87d046ef0e839cfecabe696152331f18b9eaad","observation_id":"1dd3f11c-d7c5-4685-83c3-505f9eec3555","resolution":{"observed_at":"2026-08-12T15:00:32.155536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.138104Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"52999631-6ad2-401a-8ac8-070ebb4e1e72","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.828818Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:b47855bb29ede768276ba8588f3ec8edb288cb25b2b0c8a1329d117aa6466a25","observation_id":"165bd51e-bf33-4a2c-ae8b-8b7a02a5f4fe","resolution":{"observed_at":"2026-08-12T15:00:32.142567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.124956Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":"013aa276-fad9-468f-9eb4-73ecd2ba00e9","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.832494Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:e4bb9b610ad6ddbdc1039df9d9985d3d7713cdd11df6bff12c1e0adb76ca8066","observation_id":"63aef45f-b108-4b22-9938-1df582be05ac","resolution":{"observed_at":"2026-08-12T15:00:32.129370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.111873Z","title":"Generating videos with dynamics-aware implicit generative adversarial net- works","venue":null,"work_id":"83785e9c-5e0e-461c-bcfb-29dad88f47d9","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.836383Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:1af4db453334b74fa5c5a687d2a6c04910225ae675c49eb770415d4c7ba37a03","observation_id":"610180e5-aa84-4e69-8a43-d941f533ed4d","resolution":{"observed_at":"2026-08-12T15:00:32.116479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.098622Z","title":"Video probabilistic diffusion models in projected latent space","venue":null,"work_id":"b189c62c-282b-4ce6-964f-f1cfa416f196","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.839912Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:cc583679e48ed66f8c996dc955ff3259605a540fcde7c855ad0e3009c085b5ff","observation_id":"acdafe3f-e627-4e2f-8b1e-01db5e71de82","resolution":{"observed_at":"2026-08-12T15:00:32.102853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.086257Z","title":"Efficient video diffusion models via content-frame motion-latent decomposition","venue":null,"work_id":"c6b4efd8-111a-4d9b-bc7c-9a5cfe508ddf","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.843624Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:81753f49318b2153a64681dab82e5278b52ff498cad933cca0f968b405c48a95","observation_id":"b29d40b4-e2b6-46a0-89e3-48e5402a8ac6","resolution":{"observed_at":"2026-08-12T15:00:32.090647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.071035Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"74a0dbad-a44e-4996-b0c5-67589142261c","year":2018},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.848252Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:7ea69facf97319b2740a313dea6d7b59583bc303fc1490d8a3b37b26e9fd19d2","observation_id":"a37244c2-9d80-4882-ab5b-a1cc90c788c6","resolution":{"observed_at":"2026-08-12T15:00:32.076180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-12T15:00:31.851805Z","title":"Transfusion: Pre- dict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.851805Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:2ea243d80b0cc4631a87aee97c15f2e8a0e40d46b901dbbb8dacedd96189fa48","observation_id":"242ebf3b-1c68-4012-a82f-02b04a5cc823","resolution":{"observed_at":"2026-08-12T15:00:31.851805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-12T15:00:31.855686Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.855686Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:35b8cf5bc4cb37f5f89e08c7ff11a84d7079b081eb19421a0c93a65cd1e4ec0c","observation_id":"6b27ceea-0e36-440c-ac8c-cd605693df84","resolution":{"observed_at":"2026-08-12T15:00:31.855686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.056325Z","title":"Architecture We use the same structure as SiT, except that our patch embedding and final projection layers are im- plemented separately for each plane","venue":null,"work_id":"a2c14f93-d460-4601-933b-a7dadf181726","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.859918Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:92c7bb51d33001c256c86ed10ea3b9afebb0feaa6aacbe1702393307cc80771d","observation_id":"9edbdde8-17b5-41f8-8473-b1604ffba88c","resolution":{"observed_at":"2026-08-12T15:00:32.061934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.041516Z","title":null,"venue":null,"work_id":"e9d71043-c6f4-4b34-89b6-da7f00c5c3ac","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.863822Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:35add746814ab4aa2372bcf4175d34fa27c3b88d9e04f6920ad360e39dca0d59","observation_id":"4d1fa4bd-360f-484c-8f47-e2142ff03862","resolution":{"observed_at":"2026-08-12T15:00:32.047444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:53:14.376345Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 1 inbound Pith citation observation for arXiv:2411.14762."}