{"as_of":"2026-08-14T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e7ce1bd420b35b64573f92c4e631cd1dba71f6448d1abde71f13a0dcb56ba29","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:59:36.794196Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T01:20:32.508409Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:28:55.532932Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"cited_work":{"arxiv_id":"2412.10443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10443","snapshot_observed_at":"2026-07-03T20:28:55.532932Z","title":"arXiv preprint arXiv:2412.10443 , year=","venue":null,"work_id":"dd299831-09c1-47b3-a503-8abdff1abe28","year":null},"citing_paper":{"arxiv_id":"2606.17590","last_updated":"2026-06-16T06:52:52Z","snapshot_observed_at":"2026-08-13T12:30:51.704665Z","submitted_at":"2026-06-16T06:52:52Z","title":"TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-06-27T01:20:32.508409Z"},"links":{"cited_paper":"/paper/2412.10443","citing_paper":"/paper/2606.17590"},"observation_digest":"sha256:fc138489f21d1a22ecc679a0d8f7bec4bfdb50f0fea1ce79336733b7c2163e08","observation_id":"dcdfdacf-f854-4699-b61b-7559fe8035f0","resolution":{"observed_at":"2026-07-03T20:28:55.534476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10443/citation-record","integrity":"/paper/2412.10443/integrity","json":"/paper/2412.10443/citation-record.json","paper":"/paper/2412.10443"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T17:59:36.344044Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.344044Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:922f87b911f11832ebb6597d42007f93e4efc4aaab14cb3720d72a9a633e07d1","observation_id":"f634ee9b-78dd-4f3c-ab01-fd27cce0af3a","resolution":{"observed_at":"2026-08-11T17:59:36.344044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T17:59:36.350357Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.350357Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:f8039832efbb8b337a6c3c50230d73722a966d23182b793f35da53b90ca3c14d","observation_id":"71491f69-a707-4d05-8975-ad2eaf8a759c","resolution":{"observed_at":"2026-08-11T17:59:36.350357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:36.358325Z","title":"End- to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.358325Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:ebd02860dbef8719924753166f4b3bae4f59ff5fc225040d80ec9af4a5f26bb6","observation_id":"6a4497d6-f0d1-49da-bde6-b8d708fc57b0","resolution":{"observed_at":"2026-08-11T17:59:36.358325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:36.364476Z","title":"A short note about kinetics-","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.364476Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:c9254ff3bd2e3de7ee27a83701e4a30841a2e673cc4cc29dac05c828fde1a35f","observation_id":"6a715bda-cc16-4c5d-979d-cea8fd1f9c25","resolution":{"observed_at":"2026-08-11T17:59:36.364476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:38.163693Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"67171ec3-1304-43f1-b51c-359161bd85b9","year":2022},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.380212Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:bd0ef72e13380fd9a157e43f1658fa80ac270f86f17c44d164c19c1bab94767d","observation_id":"a57b8f75-1b49-4082-8570-7131645bab46","resolution":{"observed_at":"2026-08-11T17:59:38.169986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:38.139886Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"22c39d20-84b8-48c9-9260-561fdb043a36","year":2023},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.386691Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:fb3432faaa2ed96a1cf571badefde661ec735052b4eb3f6dfe310ccc6a278304","observation_id":"d9edbc7e-0e6f-4054-8ba4-bd1424e111f4","resolution":{"observed_at":"2026-08-11T17:59:38.146366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:38.113607Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"a8a4d954-dac6-4abd-a8fe-7a7235d012ca","year":2009},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.394212Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:83d4bc43d2a4c63b0e446fed0596930af1e7336ff6fe72a58fbeb57ada70a09c","observation_id":"8cdea5bc-c0aa-47ac-83e8-53e8f13526d0","resolution":{"observed_at":"2026-08-11T17:59:38.119413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:38.090872Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"5e3de18e-5bbf-459a-b032-6f15e5e2b30d","year":2018},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.402336Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:ef782c2ea1cc4bd4f71839100dc751d77bb917617851c79e847a76906f4e21eb","observation_id":"27031164-1ba2-4614-9208-8eef7c0f54c2","resolution":{"observed_at":"2026-08-11T17:59:38.098205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:38.069166Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"b8ec252f-3f8f-4ad9-ad7a-338514208332","year":2020},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.410230Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:5db4b507b4cc6f2b6b4f9ec43d6cc7e58cd600a019c78576a3169603091c6a04","observation_id":"0ca42ab5-0596-4bf9-8331-7643f4587299","resolution":{"observed_at":"2026-08-11T17:59:38.075974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:36.416735Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.416735Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:b5492cebe9df0cdf285d453c05e3fe5e262fc81093115f4e8b03fd5818cdd51a","observation_id":"d8e1eb6c-ca63-41a9-9d10-d1d3cabc4ca7","resolution":{"observed_at":"2026-08-11T17:59:36.416735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:38.031648Z","title":"Long video generation with time-agnostic vqgan and time- sensitive transformer","venue":null,"work_id":"5844cd25-f9a3-494b-bf2d-c122fe1072ac","year":null},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.423291Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:afdf8be4ea3718a57841b10d6f8d29b9dcc7435d7daca47cf0a6f53be558e377","observation_id":"1076691a-c275-4857-8126-7412d4262aee","resolution":{"observed_at":"2026-08-11T17:59:38.038739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:36.429338Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.429338Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:f9aa5d93d8af2acbb2b65f00e2370dc2a3790dde82460b4c9d39dc2604d250ec","observation_id":"51dacad5-eb1a-47a6-b833-7650d0da9238","resolution":{"observed_at":"2026-08-11T17:59:36.429338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-11T17:59:36.437373Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.437373Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:1b25bebc45e4a28b6481a2df42e4d1555c73f8bf96cd36e12eab19d6af8c5c27","observation_id":"5a81665d-89ab-4346-b607-3b6f6aa400af","resolution":{"observed_at":"2026-08-11T17:59:36.437373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.991488Z","title":"Video-lavit: Unified video- language pre-training with decoupled visual-motional tok- enization","venue":null,"work_id":"94b52266-7c82-437c-9cc3-5ea81ee3d54a","year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.457304Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:90d5f3cd3b70dd8ed6059a32f8bbf6a4bf675bd014761705d2b74b070a9266a1","observation_id":"5f623e22-7c16-48dd-b4f7-228542323d09","resolution":{"observed_at":"2026-08-11T17:59:37.998333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.967542Z","title":"Unified language-vision pre- training in llm with dynamic discrete visual tokenization","venue":null,"work_id":"470b1567-aa09-47db-8d37-b6b376d3bea1","year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.465436Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:d24bd04a0eebe20f8d6cba618d2151e647a290356719431321a6cfd0932bead3","observation_id":"f4b85abb-128f-48d2-9e92-63ce885fad3e","resolution":{"observed_at":"2026-08-11T17:59:37.974956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T17:59:36.471459Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.471459Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:7cb03cadba819494457e620c5700b084a0f140c6cde47e4bbb9728749f1447a0","observation_id":"e6641644-3148-462f-8aec-51579427366d","resolution":{"observed_at":"2026-08-11T17:59:36.471459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.943573Z","title":"Auto-encoding variational bayes","venue":null,"work_id":"0494a393-925b-44a3-8c95-55f58d0601e4","year":null},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.486052Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:885e53ac1171c807dd03ce9968fe69ce7ef768af88ca075a2735bfcac77ab301","observation_id":"1be71f54-55f5-4b17-bfc5-424bfbe85832","resolution":{"observed_at":"2026-08-11T17:59:37.949263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T17:59:36.496799Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.496799Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:e37200d212608ece3617de0e1f8f4ba167856d19c36c9eec687cb32576febeae","observation_id":"945b8942-8d6d-41ac-8fa1-8bca06121c9b","resolution":{"observed_at":"2026-08-11T17:59:36.496799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.914555Z","title":"Semi-supervised classifi- cation with graph convolutional networks","venue":null,"work_id":"5394a3f3-021c-486e-a223-2c6782c42edf","year":2016},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.502676Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:61ac428cbd9dddfe05d4031f172e7f2b2d05e98f7debeeba6f19594a93d7f16e","observation_id":"b63f6f55-b613-41e1-8ae5-71a27ae45d90","resolution":{"observed_at":"2026-08-11T17:59:37.922814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08990","last_updated":"2021-08-20T03:57:58Z","snapshot_observed_at":"2026-08-13T18:25:35.888974Z","submitted_at":"2021-08-20T03:57:58Z","title":"Few Shot Activity Recognition Using Variational Inference","version":1},"cited_work":{"arxiv_id":"2108.08990","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.08990","snapshot_observed_at":"2026-08-11T17:59:37.053477Z","title":"Few Shot Activity Recognition Using Variational Inference","venue":"cs.CV","work_id":"9c18132c-713e-44c9-bef5-77a152124f8b","year":2021},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.508594Z"},"links":{"cited_paper":"/paper/2108.08990","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:9333bfc47764da9e5a33c8230eb673a25a5ce63c3dbf50fb3d93141f9fa3e641","observation_id":"6a136bf9-69fe-47a5-8ae4-3b95ef5f41ae","resolution":{"observed_at":"2026-08-11T17:59:37.063800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.894976Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":"f9f898c4-7c6b-4a08-a8b4-f0a87a649c4e","year":2022},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.514927Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:2ca4f86ce017f0c6000cc2ebd6d8a3859bd00cc72f06256cf89a2407dcbdc172","observation_id":"968cd9ef-e880-467c-bb60-10da10c89a25","resolution":{"observed_at":"2026-08-11T17:59:37.900772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.875343Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"b202b0e6-03d4-4888-aea5-20929909f7f7","year":2023},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.522503Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:46b5631ca4c5b55c432ce4dc119245c0461240535095ba9e2af543ba88d61f54","observation_id":"c4e0ab49-b0b7-41f1-8331-03dfe4465fc2","resolution":{"observed_at":"2026-08-11T17:59:37.881820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.852432Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"605957d7-4683-4d2b-be49-bb41707721ae","year":2023},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.530575Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:611d39b72b54e14dad6839172943c461ec678bf18f0155bd123b6342d9b0b568","observation_id":"211ad92b-f31d-4486-a9f4-25a9bf0f52aa","resolution":{"observed_at":"2026-08-11T17:59:37.860558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.824490Z","title":"Language quan- tized autoencoders: Towards unsupervised text-image align- ment","venue":null,"work_id":"70481a7e-0570-4efc-aa2d-4c494a48fe2a","year":2023},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.536630Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:591e7bee5bddfd3eb952d0b797984833421b778930da2bb3ea117c0f5276e0d6","observation_id":"e273481b-cba3-4d46-b71e-8a8c6a482911","resolution":{"observed_at":"2026-08-11T17:59:37.836268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-14T01:35:56.896431Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-11T17:59:36.547616Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.547616Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:c5b1049512db850ffe07da4dbe15aa9221dd544e38339ee510d1f15a4587806c","observation_id":"5df510ed-3dba-488d-a51c-b6cb1d70606b","resolution":{"observed_at":"2026-08-11T17:59:36.547616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.803024Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":"b25bc781-077d-4b81-a378-7133945db423","year":2019},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.554655Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:38bf9313036682f38c75113a73eaae97d3eee15a2b02bc1b7224c1e74ff7613a","observation_id":"9f7c6b2b-26f6-4834-bc1f-318f6f1ccd48","resolution":{"observed_at":"2026-08-11T17:59:37.809123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.783629Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"b4686380-3fc9-4fc1-bd96-ace538281cec","year":2021},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.562189Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:c2a42234233d6bd0ddc94404825193f880c705475bea0cb73e2ee1e82020b9e3","observation_id":"9a323101-e69d-48ba-98db-1db98b6dc1e1","resolution":{"observed_at":"2026-08-11T17:59:37.789162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.765576Z","title":"Gen- erating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"1105cf4d-f554-46eb-b652-68a7f996353d","year":2019},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.574766Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:2b52d0a8ab24bc971be9dd43411b7d4244917f0ae603ce8931b3fed025940f7b","observation_id":"0b53fd07-f0ef-46b4-a302-a3d17184de8d","resolution":{"observed_at":"2026-08-11T17:59:37.771282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:36.586598Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.586598Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:6fdf725f9ee1ff7835a29024d834c9bc38df70a8784f12c20cf02cb86519f2b8","observation_id":"3819aea2-0056-4517-af94-f79d33b26bf5","resolution":{"observed_at":"2026-08-11T17:59:36.586598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-13T22:00:40.727122Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-11T17:59:36.597282Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.597282Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:363d21068948e657a06180e620147b7c5497ff71cbc547e27ca5db9b5f975dc7","observation_id":"59ee048b-eb94-4b44-a119-36745675eca5","resolution":{"observed_at":"2026-08-11T17:59:36.597282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-11T17:59:36.606993Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.606993Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:154656b4851ea0d9cc58b904b20e48f9195907e3aef2d2be34587fb387bd60c6","observation_id":"38cd57ad-b971-4384-95e5-d0349e67821f","resolution":{"observed_at":"2026-08-11T17:59:36.606993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.730622Z","title":"Generative pretraining in multi- modality","venue":null,"work_id":"acd825f9-6dc1-4819-8b2e-a212d92eae1f","year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.614175Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:3c5865e04f8dbc8a7bb0cbab387435abba772842b3fb971f40562a334208b0f9","observation_id":"8cd2ac95-c35b-44e8-aa51-4b9e854e0c77","resolution":{"observed_at":"2026-08-11T17:59:37.738569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T17:59:36.620381Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.620381Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:5d061339f5dee28511d895d180e78a26ddbf6bc948beb43b6d54e3e13e1b9c1b","observation_id":"9523df4c-8de3-4e26-9389-7f5d77b4c31f","resolution":{"observed_at":"2026-08-11T17:59:36.620381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.711563Z","title":"Multimodal few-shot learning with frozen language models","venue":null,"work_id":"a446b5a9-9c60-4fd5-884d-6f3bb932b93a","year":2021},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.627771Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:df02e1c310fc522e63729ed819a94404e591a12b447becb72b382de6508d0ebf","observation_id":"127c0691-132b-4380-88be-fa6457fa7560","resolution":{"observed_at":"2026-08-11T17:59:37.717409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-11T17:59:36.634407Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.634407Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:59536d3747e9bb2553d34d403f69bc6070812df7ad3f67ece29e55c233660272","observation_id":"cd4fe5d6-f837-4844-b485-01fa2be2b4a9","resolution":{"observed_at":"2026-08-11T17:59:36.634407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.692903Z","title":"Neural discrete representation learning","venue":null,"work_id":"b98c2b9f-8ae7-4836-9de4-82fe877bb11d","year":2017},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.640644Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:c31658d46510a296480a28f8efc7e590058b140f24172f6ee681a70a5a89f1d8","observation_id":"f5774657-632d-44e9-aa56-5ac20279ac83","resolution":{"observed_at":"2026-08-11T17:59:37.700155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:36.647046Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.647046Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:812d549fd74f5f0eb6ef25978579b5a55d41f323fa25929606191ad66e81e30f","observation_id":"d637f0b4-aa73-49d5-83f1-6d1f5827fde4","resolution":{"observed_at":"2026-08-11T17:59:36.647046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.662385Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"1858994e-3df6-48b9-81cf-3e93e12386d9","year":2023},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.654064Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:f586eaf1a78c63ab73887df30337521aa73307a956378c83d9f9a757aa25d5f5","observation_id":"ad5233e0-c6f6-4f7c-95a8-29db850161bc","resolution":{"observed_at":"2026-08-11T17:59:37.668417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21264","last_updated":"2025-06-16T22:06:19Z","snapshot_observed_at":"2026-08-14T16:06:34.494217Z","submitted_at":"2024-10-28T17:57:07Z","title":"LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21264","snapshot_observed_at":"2026-08-11T17:59:36.661509Z","title":"Larp: Tokenizing videos with a learned autoregressive generative prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.661509Z"},"links":{"cited_paper":"/paper/2410.21264","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:2dd5724a3f4f66bcc92af816eda081f0932cecedd552afdedd5e04c4bb71ad37","observation_id":"40f906bf-7435-48b5-99db-ea375161fe36","resolution":{"observed_at":"2026-08-11T17:59:36.661509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.632627Z","title":"Omnivid: A generative framework for universal video understanding","venue":null,"work_id":"2d27edfd-f2b3-4a54-95c0-4633c7511f35","year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.668216Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:ed62df9ef384fdaba19272be3f1441b10ea9a2a215f848ae04f8b799a0342ea4","observation_id":"47a0d732-ed91-4c61-9932-0e8cb2f64b06","resolution":{"observed_at":"2026-08-11T17:59:37.641124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.607093Z","title":"Omnitokenizer: A joint image- video tokenizer for visual generation","venue":null,"work_id":"de85f867-6025-4559-a327-3f3d8cb405a9","year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.675383Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:a2998dd0c7a67fc9971e76dc5bba5f11c480b95c8c232c909640ff63a032ea3f","observation_id":"43331cb1-d65b-48e0-b710-798d2cb80e4d","resolution":{"observed_at":"2026-08-11T17:59:37.614591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.587332Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding","venue":null,"work_id":"5471dbe8-90fd-4b86-a66e-50cbcdd8b647","year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.682041Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:61cf71ef97f12a4ed9649792184196aed0766b32c03eabc5e9b399ca568ebf22","observation_id":"085300f3-bda5-4665-99aa-1b86c3deefc9","resolution":{"observed_at":"2026-08-11T17:59:37.594358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.565277Z","title":"De-diffusion makes text a strong cross- modal interface","venue":null,"work_id":"c96ebb9a-4651-401b-964d-1be38697bece","year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.688675Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:79249c98d2d3d8e4e03b1882baf70d8d617634d5757a6c1efa509b7d9ced5156","observation_id":"81439c27-75d2-4c21-8185-8d74e302f3e9","resolution":{"observed_at":"2026-08-11T17:59:37.572619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-13T14:30:50.605700Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-11T17:59:36.697826Z","title":"Videogpt: Video generation using vq-vae and trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.697826Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:c4b729268bc183b50c4601e1aceb615479746af3d803e42ab5a4226f70221b1d","observation_id":"cd2a7da0-6e65-4afb-93e8-f4c3b646fef9","resolution":{"observed_at":"2026-08-11T17:59:36.697826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.545128Z","title":"Towards end-to-end generative model- ing of long videos with memory-efficient bidirectional trans- formers","venue":null,"work_id":"43c04984-51b8-4399-a752-f1f5ef1688e5","year":2023},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.705007Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:6ad62f952556e01de7cefb909bdddcd670a775f80eb1ff79643794fe21a4b36f","observation_id":"12804a7a-50fd-4d25-b397-e47ba164fd20","resolution":{"observed_at":"2026-08-11T17:59:37.550993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.515757Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":"489bd8c2-eeb7-4c68-bea7-d19374522daf","year":2022},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.711425Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:a9b3e56b029f1a6bea11edae716802d60e3f40153ac4f1cde43287bec9797265","observation_id":"6086b9fa-b514-431c-ad34-c7ba61ba6bdc","resolution":{"observed_at":"2026-08-11T17:59:37.522142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.492800Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation.ICLR,","venue":null,"work_id":"9ae3ce1b-17df-4d8b-96b8-60fe57b0522b","year":null},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.718292Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:895933fa0be71a59a794449e53d9a77bafbbefb30721bfec50d14967cc8cf8b1","observation_id":"2ea36884-0cf5-4716-b389-726e4ac4b9ae","resolution":{"observed_at":"2026-08-11T17:59:37.499444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.467082Z","title":"MAGVIT: Masked generative video transformer","venue":null,"work_id":"31da56aa-b7d2-413f-9a25-0e8a2438a364","year":2023},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.726515Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:1515a57738c9caabb396354aa4b90864c86cc591867cd7da755f2bad1b5c98dd","observation_id":"3a84aa0f-197d-439a-9d56-a797a50f47bd","resolution":{"observed_at":"2026-08-11T17:59:37.476987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.436547Z","title":"Spae: Semantic pyramid autoencoder for multimodal generation with frozen llms","venue":null,"work_id":"eead8468-828d-4679-b4e5-be124d503245","year":2023},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.733286Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:6635c4004ab4cd275ebf7f399c6952d1daaaf30c70c0f6118c4738456821320e","observation_id":"2712b039-6360-480f-8be5-9e698c9bdf6e","resolution":{"observed_at":"2026-08-11T17:59:37.443170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.412128Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":"224fe866-57db-4334-90a5-75cbd107de03","year":null},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.744271Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:7426c7b00aef7ff79bbd6ed84908c36224c798cef022f0e50aa5b18a2b1d5a9b","observation_id":"5ebfcc74-81b4-48a7-bafd-167b2d5b3256","resolution":{"observed_at":"2026-08-11T17:59:37.420600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.377779Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":"7fb8abbc-d282-40f7-8079-2ff88a4ea6dc","year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.751607Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:22edae3f9411d1e20e1b47a1bdc3b4b5f1aecb4765397f8f77d762edee40b252","observation_id":"d55f7f7f-eec3-43ee-b530-bfd01eb1349e","resolution":{"observed_at":"2026-08-11T17:59:37.388111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.349354Z","title":"Codebook transfer with part-of-speech for vector-quantized image modeling","venue":null,"work_id":"222d4a94-df70-4487-a79a-4428fdcb4d55","year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.758094Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:096c826cb5fe6f86875bf8d7c1d1c4b14657797d53b5a6f926a5b358266fb513","observation_id":"3d8b81bb-0891-4f13-9d92-c23b56d3278b","resolution":{"observed_at":"2026-08-11T17:59:37.358649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.319278Z","title":"Few-shot action recog- nition with permutation-invariant attention","venue":null,"work_id":"22e86999-e715-410d-a0fb-870a7740915a","year":2020},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.764498Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:6087df4b637d51315ca241d2752ed9dc3f69dae151da79041bf7901bd76b4904","observation_id":"b1f89d5c-a185-4574-b5af-94784b189269","resolution":{"observed_at":"2026-08-11T17:59:37.332058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.297070Z","title":"Beyond text: Frozen large language models in visual signal comprehension","venue":null,"work_id":"6c1ba17a-e97c-494d-aa3b-9b08640d4360","year":2024},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.772186Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:633190915e4594e66019c4c0afcca25bda0114246a529b90a2f25b7953e16b97","observation_id":"48e76d7f-93fc-47d4-8e9c-e396faaf397d","resolution":{"observed_at":"2026-08-11T17:59:37.304341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.265767Z","title":"Model Implementation Details Visual Tokenizer","venue":null,"work_id":"20beb5fa-2c4f-4e82-95a4-3248580b7ab6","year":null},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.780363Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:2be0f3116daf2537d61c20cfb5a5bcffe9c886e12718f106fd744c62ca04c94a","observation_id":"a5e2f6f3-0c49-42f8-80b7-7b51a6083305","resolution":{"observed_at":"2026-08-11T17:59:37.273559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.244491Z","title":"More evaluation metrics We assess SweetTok using additional metrics: PSNR, SSIM, and LPIPS","venue":null,"work_id":"0d8e9c9a-2169-4efe-a311-07b7c22d54d0","year":null},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.786936Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:51040696578ccfd1cd467168edd951d7f193fe496022c915daea71b245a4b24c","observation_id":"cf8fdd52-de64-46e5-bbf3-7775f13e1624","resolution":{"observed_at":"2026-08-11T17:59:37.252753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:59:37.223240Z","title":null,"venue":null,"work_id":"c0bedae6-55b8-42ca-8090-fda8e524132f","year":null},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.794196Z"},"links":{"citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:b7826cbcfe6d93e78fb99b1ef0c18379954f2239914f267726af93bb6670627a","observation_id":"3a6be956-8f12-4a23-a0fd-31d0cf93c06e","resolution":{"observed_at":"2026-08-11T17:59:37.229840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-08-14T18:44:38.993682Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-11T17:59:36.373349Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization","version":3},"reference_index":600,"source":"pdf_text","source_observed_at":"2026-08-11T17:59:36.373349Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2412.10443"},"observation_digest":"sha256:1da4b5a803066bd61a93b8d0bdf3d0e86cf8787669200ad39dc5d50654d7710f","observation_id":"9e6d8dbe-d8ff-4ad1-becf-fe83f8bc503e","resolution":{"observed_at":"2026-08-11T17:59:36.373349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10443","last_updated":"2025-03-11T03:19:42Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T06:27:57.115356Z","submitted_at":"2024-12-11T13:48:06Z","title":"SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":37},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2412.10443."}