{"as_of":"2026-08-17T04:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0dbef921075285cf814dca666a60026a386bbbeeba015393c296f1395e836697","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:08:54.630490Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:31:52.653212Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T06:04:21.611097Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09144","snapshot_observed_at":"2026-08-10T18:31:52.653212Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.11260","last_updated":"2025-09-10T14:02:23Z","snapshot_observed_at":"2026-08-16T09:13:51.664817Z","submitted_at":"2025-01-20T04:00:02Z","title":"A Survey of World Models for Autonomous Driving","version":4},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-08-10T18:31:52.653212Z"},"links":{"cited_paper":"/paper/2507.09144","citing_paper":"/paper/2501.11260"},"observation_digest":"sha256:cc9adb935f63364324ac9d0fc2ed791d13956377988535c5a700e2967d29fa58","observation_id":"2006e092-da95-418d-9d11-334218175e27","resolution":{"observed_at":"2026-08-10T18:31:52.653212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09144","snapshot_observed_at":"2026-08-05T06:04:23.964735Z","title":"I2-World: Intra-inter tokenization for efficient dynamic 4D scene forecasting.arXiv preprint arXiv:2507.09144, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07996","last_updated":"2026-07-20T17:34:32Z","snapshot_observed_at":"2026-08-17T01:42:27.928087Z","submitted_at":"2025-09-04T17:59:58Z","title":"3D and 4D World Modeling: A Survey","version":4},"reference_index":142,"source":"pdf_text","source_observed_at":"2026-08-05T06:04:23.964735Z"},"links":{"cited_paper":"/paper/2507.09144","citing_paper":"/paper/2509.07996"},"observation_digest":"sha256:336f1b8320274d3cd81c6b3f6dd34f9c0713d9f9fa9808d25ccfec580f8e9a1f","observation_id":"6e1c4be7-4d62-43e7-9758-7e2c00ad752c","resolution":{"observed_at":"2026-08-05T06:04:23.964735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"cited_work":{"arxiv_id":"2507.09144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09144","snapshot_observed_at":"2026-06-30T06:04:21.611097Z","title":"I 2-world: Intra-inter tok- enization for efficient dynamic 4d scene forecasting","venue":null,"work_id":"f5901678-8fcd-42aa-9397-0a6fc864293a","year":2025},"citing_paper":{"arxiv_id":"2511.22039","last_updated":"2026-04-14T12:13:24Z","snapshot_observed_at":"2026-08-14T15:49:07.476670Z","submitted_at":"2025-11-27T02:48:45Z","title":"SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T05:26:34.859975Z"},"links":{"cited_paper":"/paper/2507.09144","citing_paper":"/paper/2511.22039"},"observation_digest":"sha256:6bc6e58405a55b8c3eb83f61187ed1c1017604d8ddcf1bc7c0a9981c2db0f056","observation_id":"f43675e7-76f5-40d7-a1c2-e3fcd4bb03a6","resolution":{"observed_at":"2026-05-17T05:29:05.040869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"cited_work":{"arxiv_id":"2507.09144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09144","snapshot_observed_at":"2026-06-30T06:04:21.611097Z","title":"I 2-world: Intra-inter tok- enization for efficient dynamic 4d scene forecasting","venue":null,"work_id":"f5901678-8fcd-42aa-9397-0a6fc864293a","year":2025},"citing_paper":{"arxiv_id":"2606.30421","last_updated":"2026-06-29T15:05:41Z","snapshot_observed_at":"2026-08-14T15:49:50.255013Z","submitted_at":"2026-06-29T15:05:41Z","title":"OWMDrive: Causality-Aware End-to-End Autonomous Driving via 4D Occupancy World Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T05:59:20.898830Z"},"links":{"cited_paper":"/paper/2507.09144","citing_paper":"/paper/2606.30421"},"observation_digest":"sha256:50237604267f94af1a7e913a3a176dadec0bc66b0a29a3f8a691eef18c1ac681","observation_id":"e607822e-c87d-47a0-b335-f9067297f13b","resolution":{"observed_at":"2026-06-30T06:04:21.612613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09144/citation-record","integrity":"/paper/2507.09144/integrity","json":"/paper/2507.09144/citation-record.json","paper":"/paper/2507.09144"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:08:48.426576Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:48.426576Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:fb8ae105ffd1e2f7fe78d8fc4abb62a4881cb747dd96703abf8541ec39f1263c","observation_id":"2bbb9c59-7659-4e8c-b65c-7d0c19f7301d","resolution":{"observed_at":"2026-08-06T18:08:48.426576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:04.982450Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":"a0549908-ab89-43b6-a5f8-5a69cb7897bc","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:48.668292Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:d6444ad278ce2a810f766ec3f26f6c0af3320ad348789a07ee697e129e22d2ed","observation_id":"66e84cc4-ba7a-4fea-87e8-4649dd5ce474","resolution":{"observed_at":"2026-08-06T18:09:05.081203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:04.750874Z","title":"V-jepa 2: Self- supervised video models enable understanding, prediction and planning","venue":null,"work_id":"3aab61a8-d256-459f-afe3-27df60068bbd","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.219446Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:9b731e7a8a968943acbffdbdb477a5317bfbbd65a4861a423435b68a93ffcd08","observation_id":"965e659d-8f89-4c29-a8c4-1a91d51690e3","resolution":{"observed_at":"2026-08-06T18:09:04.858535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:04.513161Z","title":"Semantickitti: A dataset for semantic scene understanding of lidar sequences","venue":null,"work_id":"9403bb85-c882-4aeb-80c9-cf062876f14c","year":2019},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.517326Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:906d230af3cf72be44f7a84fe6ede51ddcd80ed64e1560ddb05bbc1ed0516856","observation_id":"e18bab8f-8330-4d94-b8d7-08db64eae7e1","resolution":{"observed_at":"2026-08-06T18:09:04.637797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:04.274416Z","title":"The lov ´asz-softmax loss: A tractable surrogate for the optimization of the intersection-over-union measure in neural networks","venue":null,"work_id":"85259d81-957d-4225-a587-8d9de7b56baa","year":2018},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.609521Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:3ab7b5904473db28f0970988d20607e28536126869d0f5e69db35b2f6faea424","observation_id":"d138711c-cb41-429a-806c-385803b99432","resolution":{"observed_at":"2026-08-06T18:09:04.395568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:04.021415Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Gi- ancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"48ceb51f-9062-4103-9a81-f1f876dd66ed","year":2020},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.711273Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:7a8217d93eab1b3bea0ea0343c02a3817ecfba7a9de51b0857385c26ae4a3785","observation_id":"222df20f-8547-4aaf-8c8a-44d37659da11","resolution":{"observed_at":"2026-08-06T18:09:04.147704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.897907Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"89938f5a-b805-40a2-ba1d-cc13dc3292a8","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.808930Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:17b3c879ff5f835dfc02d0177230ec1a6377e146a168ec5b6fe0c4b80c62a537","observation_id":"30610dcb-f2ad-4225-ae5c-3319f977822f","resolution":{"observed_at":"2026-08-06T18:09:03.950736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.770001Z","title":"A survey of world models for autonomous driving","venue":null,"work_id":"96537b4a-4d62-47d0-b488-500b33563660","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.879554Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:54b44e96029d59fb14b66033f9f4cb30f0275815cf42a4646f7635f17e177551","observation_id":"6cb1d39a-9ec5-4da8-959d-fbb62f2def67","resolution":{"observed_at":"2026-08-06T18:09:03.829784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.625246Z","title":"Magicdrive: Street view generation with diverse 3d geometry control","venue":null,"work_id":"32c2a0f1-b837-4f80-a264-18b64c0a15c7","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.965754Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:9880615e37965e57fc9fda346e8bb118c1f3b7ce32e0059e7926b77562aaf1c2","observation_id":"69a33bb2-4a40-43c9-bddf-56f726d7088d","resolution":{"observed_at":"2026-08-06T18:09:03.709724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.484517Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","venue":null,"work_id":"b5539680-acb6-48c6-a6bd-f9cca9bfbc84","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.039181Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:19a0155e8af5105fd73fd7111b344dfa4afe42b875a4cf0b021bec321a5b8f55","observation_id":"65c97ca3-6e9a-4349-a51e-cf2bedf367a4","resolution":{"observed_at":"2026-08-06T18:09:03.536278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10429","last_updated":"2024-10-14T12:24:32Z","snapshot_observed_at":"2026-08-16T13:09:39.148287Z","submitted_at":"2024-10-14T12:24:32Z","title":"DOME: Taming Diffusion Model into High-Fidelity Controllable Occupancy World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10429","snapshot_observed_at":"2026-08-06T18:08:50.127134Z","title":"Dome: Tam- ing diffusion model into high-fidelity controllable occupancy world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.127134Z"},"links":{"cited_paper":"/paper/2410.10429","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:e8bd99fc72c1378a9feeeec93d94b9d258969376af7fe23ba4bd0c4651cdda60","observation_id":"69b499b6-93b8-40fa-9686-373f74471843","resolution":{"observed_at":"2026-08-06T18:08:50.127134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-07-06T12:21:28.059661Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-06T18:08:50.235191Z","title":"Bevdet: High-performance multi-camera 3d object detection in bird-eye-view","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.235191Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:3a2a35ac07ebd65c1ed4d86a80d64c6fd4314812b77b282fbf816059b1c0c2a7","observation_id":"b62e77aa-7eca-46f6-9bce-74fd1ac180f8","resolution":{"observed_at":"2026-08-06T18:08:50.235191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.346437Z","title":"Tri-perspective view for vision-based 3d se- mantic occupancy prediction","venue":null,"work_id":"3a02e0f0-5afe-4e6d-869d-bf2437af774b","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.317153Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:ec236090ca8be2c70f3f19581714e2ed02ae9dcd84c22c42af5778bbaa203f36","observation_id":"b5f1f833-cbcc-475b-80a4-ec8076d79f0e","resolution":{"observed_at":"2026-08-06T18:09:03.399408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.219928Z","title":"Differentiable raycasting for self- supervised occupancy forecasting","venue":null,"work_id":"20ee0254-49f4-4f59-a94b-c6bb49fcce8e","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.393125Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:f0c4dd752ff7b18336677a7bcfa29ba66b99adf18e52271008edaee919a174f8","observation_id":"2f1c8941-a1f8-45af-8b68-6128e989fd7c","resolution":{"observed_at":"2026-08-06T18:09:03.272688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.066990Z","title":"Point cloud forecasting as a proxy for 4d occupancy forecast- ing","venue":null,"work_id":"f6c8980d-6f91-46f9-b7d8-fe9f9ac128b5","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.493807Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:f69f20ca2a9717ec9ec851feacb0256a325447ce2182273d3be76e92d47b6daf","observation_id":"743d97d8-8b93-4b63-979b-e20815fa1e63","resolution":{"observed_at":"2026-08-06T18:09:03.143906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:02.879628Z","title":"Pointpillars: Fast encoders for object detection from point clouds","venue":null,"work_id":"0aca508b-a4f4-4fa8-96f6-206763a8fbde","year":2019},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.560096Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:9eec4af195b8a924e2b8e72f023a440916c81716cc333deaac7892072a97efa8","observation_id":"c08a5008-6392-4e0e-8251-69842482cb4c","resolution":{"observed_at":"2026-08-06T18:09:02.998009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:02.660959Z","title":"Autoregressive image generation using resid- ual quantization","venue":null,"work_id":"01c09c9e-81a1-4253-b79a-4b60a856c4bd","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.633261Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:8cfac674fc859ac26d7d02f24ce2a47085a687e8338276a1190f39152872ce2d","observation_id":"82b2bad3-c536-47cb-a5b6-92c6fa2c0a5d","resolution":{"observed_at":"2026-08-06T18:09:02.760488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:02.349012Z","title":"Uniscene: Unified occupancy-centric driving scene generation","venue":null,"work_id":"1096766c-223d-4c4b-8f0c-69f645712d8b","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.728848Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:df831c55d45bfc5df56ccf4d934d454b323a9e959b168b9671534953954a8394","observation_id":"7f6b9285-69a5-400f-b4d2-06beacf22cbe","resolution":{"observed_at":"2026-08-06T18:09:02.498928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:02.127565Z","title":"Bevstereo: Enhancing depth estimation in multi-view 3d object detection with temporal stereo","venue":null,"work_id":"e108f24a-dd83-46a9-a833-0fc5508acd96","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.823568Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:a9764049062949a1d170a5ead9fa4f590f5d1c5cd7248f0a7af018f6b8a3400d","observation_id":"7e130820-8fb4-4571-98c5-9f8758968697","resolution":{"observed_at":"2026-08-06T18:09:02.228951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:01.886756Z","title":"Bevdepth: Acquisition of reliable depth for multi-view 3d object detec- tion","venue":null,"work_id":"ea500ee0-016e-451d-9a63-aabc5f760f37","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.919951Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:0c6130d36617dc0e0adab33b74c1c87d487c138c790221cc0ea2192a4b26ffee","observation_id":"a25f3e61-c40e-45d0-b959-15d23045e2b6","resolution":{"observed_at":"2026-08-06T18:09:01.997157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:01.639590Z","title":"V oxformer: Sparse voxel transformer for camera- based 3d semantic scene completion","venue":null,"work_id":"4eadb069-47b6-4112-80b1-b09558a33112","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.017115Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:137693366795804d48aff6db62154fe1dcb27fad3c11f5acf3b5948018d9c55e","observation_id":"34ebb596-8c32-4c92-a71f-dd79da3ea0dd","resolution":{"observed_at":"2026-08-06T18:09:01.753154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:01.440073Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"a03ba8c9-ce26-48ca-a659-5cc8a7bf577a","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.104435Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:abb53ff83eb39724a892975a6899e6d4e3b96a22ad25773f1c18bc48bd78fb91","observation_id":"e88a43db-e0d1-4b78-90db-45eeeac41333","resolution":{"observed_at":"2026-08-06T18:09:01.507827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:01.298223Z","title":"Fb-occ: 3d occupancy prediction based on forward-backward view transformation","venue":null,"work_id":"9190872d-ec48-4dc3-9cb2-328f347a3155","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.303891Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:3ef94a21ad18a7487a17ceb7f967a2921384711b303a30715c6ff785db0c13f1","observation_id":"54451612-7eee-4b13-af85-73dd2aa7caf2","resolution":{"observed_at":"2026-08-06T18:09:01.369519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:01.112497Z","title":"Stcocc: Sparse spatial-temporal cascade renova- tion for 3d occupancy and scene flow prediction","venue":null,"work_id":"13cbf885-bf4e-4b20-b59c-bd8402602791","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.531927Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:026cc9f969b890d01e920c09d8c516a2e9206f1ca99240aa9a54517f87fb31d4","observation_id":"83c3227f-c3fe-448b-b16c-bac86c11e6c0","resolution":{"observed_at":"2026-08-06T18:09:01.219357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.888812Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":"fb619188-46ca-492a-895e-c3481bda18aa","year":2017},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.706309Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:bd092a49ca3a8ae269d174aceead349de87f556816ddb51f5e7dd22bdd27c9ae","observation_id":"d1d715e2-b9ae-429c-9bdd-dd3b1685f073","resolution":{"observed_at":"2026-08-06T18:09:00.962012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.745465Z","title":"Sparsebev: High-performance sparse 3d object detec- tion from multi-camera videos","venue":null,"work_id":"7ad4f431-3272-4370-9e2b-3c211598c4cc","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.885899Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:df34f76117312b6d9bc6ff3cb91c8f9853dc52753c136f229342a8c41ad8985c","observation_id":"61e59656-1b88-428f-ae1e-98855dbfa616","resolution":{"observed_at":"2026-08-06T18:09:00.821938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:08:52.036255Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.036255Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:6b810c9d19ddd593d9f0738513cbf15eea66f69e98e8323a45c0a539dbd54b81","observation_id":"25fc74c4-001e-41fb-a08d-66a1b61921aa","resolution":{"observed_at":"2026-08-06T18:08:52.036255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.550663Z","title":"Self-supervised point cloud prediction using 3d spatio-temporal convolutional networks","venue":null,"work_id":"be9dcd70-18d2-4e8f-866c-a6316c5a891a","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.184670Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:c27c8662f467734935c16068a05bbb0e421c079aa4c47e904deab302adbf3943","observation_id":"6f43300d-16b0-4564-9856-629564ac49a0","resolution":{"observed_at":"2026-08-06T18:09:00.628992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.361226Z","title":"Uniworld: Autonomous driving pre-training via world models","venue":null,"work_id":"1298180a-ac2f-4bcf-afed-6a6fa19985bf","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.361405Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:b287d3437c23b515490ab9de079ef7524ff857ccfb9b52aff0f4376f4f649e97","observation_id":"f9f9068e-3c70-45fa-9962-bfbf5778fb65","resolution":{"observed_at":"2026-08-06T18:09:00.442668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.208589Z","title":"Driveworld: 4d pre-trained scene understanding via world models for autonomous driving","venue":null,"work_id":"74551087-56e8-4b02-8eb5-d530e86b28b0","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.433606Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:f95264e321919f10367aabf4cba921adb70e61db97d9724fcbda6965969e4d14","observation_id":"8ec25494-0bef-441c-8f0e-d8bd45c3547c","resolution":{"observed_at":"2026-08-06T18:09:00.271810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.054867Z","title":"Renderocc: Vision- centric 3d occupancy prediction with 2d rendering supervi- sion","venue":null,"work_id":"85dd592f-b968-43ec-b88b-0d606d945d8c","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.515304Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:da3b262f75224c335706679be0bed6a012c10f68196ec03adaa3c74845cb4b51","observation_id":"f7c78b6c-5e7a-49f7-8015-1e195d58c065","resolution":{"observed_at":"2026-08-06T18:09:00.141947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.842808Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"f1a07400-a9cd-4833-832a-f7316f1a3544","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.559195Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:1dab5d68871b59fc4f34e4c8eef38c910e4a16c522dddc3d1db7ff16b84d86ca","observation_id":"0adca95e-b7c8-49ec-951c-7a4af22a493d","resolution":{"observed_at":"2026-08-06T18:08:59.939166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.715175Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"6e075b0a-114f-4767-b0ae-b27e588e53ed","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.612080Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:485720380f4c31300b6035a24d0a56e6ccbce6f988e4226b8ea2eb91d9f45a33","observation_id":"d14a39b2-6cb5-430b-8cf1-ec119baabb23","resolution":{"observed_at":"2026-08-06T18:08:59.761346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.670827Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.670827Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:d9b1376f23a1869101760e764f604cc7b6d431db4dce0d870e3dce6dbcb91638","observation_id":"33feea60-fcd3-4d54-a652-beae61e9d8bd","resolution":{"observed_at":"2026-08-06T18:08:52.670827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.576120Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"a1f9cfcb-9592-44a7-9101-57cf68d48e1b","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.708980Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:a3a682cd84a4b1bdea8c136a37bbe630a95745f7dcd3e512f942a30b90e8bad0","observation_id":"099d5316-3ec0-4356-8e00-1c683c10e7b3","resolution":{"observed_at":"2026-08-06T18:08:59.640948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.426299Z","title":"Pointr- cnn: 3d object proposal generation and detection from point cloud","venue":null,"work_id":"2708be7b-ec0e-4f14-b790-f9ffce75ca28","year":2019},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.840969Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:1cc5ae0f1f46f5e2da599998f29d16444b5053dbf053806ad1b2a3d123430f05","observation_id":"56daf1cb-2efe-4f22-b982-5708c729dd9b","resolution":{"observed_at":"2026-08-06T18:08:59.534102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.274799Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"1f9156a7-f69e-48db-ba93-bbad8b5e5134","year":2020},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.948765Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:ddf7dfc4f4ce71112acf8882b11ac8aebbeb70323f369f155bec34ed33f2d7f9","observation_id":"db5da3c2-a0fa-45ce-833e-f30d6135bdf8","resolution":{"observed_at":"2026-08-06T18:08:59.360467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.154054Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":"48cc607e-39d9-4c68-b403-fe7548d322c2","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.006460Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:daaa5f15d725b00f95a9ac2df50725ef9d2a2412a021d65f86149cd77dce6bdb","observation_id":"57067620-3d17-407b-aae0-014d1c8ded3f","resolution":{"observed_at":"2026-08-06T18:08:59.215295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.011776Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"a1aef2f9-e7e4-47bb-846c-52fa1941037c","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.053424Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:f076013b399016b54fd9b21a2f8765a3c2f933da07a8a48b53006702237869cf","observation_id":"7a74403d-91a4-4a80-bb60-32c6fa72906d","resolution":{"observed_at":"2026-08-06T18:08:59.073376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.840947Z","title":"Occ3d: A large-scale 3d occupancy prediction benchmark for au- tonomous driving","venue":null,"work_id":"eb6bc198-54ad-44b0-9f92-c14bae9ef267","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.176555Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:597995f4dfe4a3dcd3a59c45a87f53b454e7fede649a7fbdcbbaece82fb69673","observation_id":"21565967-1c02-42c9-b6fc-a13e8aad039d","resolution":{"observed_at":"2026-08-06T18:08:58.911047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.670854Z","title":"Neural discrete representation learning","venue":null,"work_id":"00814ac3-9983-4917-8c7c-337f1a122ef0","year":2017},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.240006Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:d9901308a619d4f48cfdf5b8abfbff889c05757644567066019311cc74c8065b","observation_id":"099436e3-04e4-439d-aa0b-bce8c8bed48a","resolution":{"observed_at":"2026-08-06T18:08:58.743975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.542548Z","title":"Attention is all you need","venue":null,"work_id":"c2a7e5e0-8fa3-4a1e-9c62-5aeb4e041834","year":2017},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.315105Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:5642c1bb34882c7f60cccccbde4c42129dc2961b577d41d7b022221112b254b1","observation_id":"04e126c0-afaa-4328-ac32-2f3c4c46b1d5","resolution":{"observed_at":"2026-08-06T18:08:58.609298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.395322Z","title":"Omnitokenizer: A joint image-video tokenizer for visual generation","venue":null,"work_id":"e50fc7d3-ff41-4739-b9b7-1275c2d66d24","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.386792Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:79439742ad4f1129288f6dd080b81c63b563f57c96fa937c5f300c42d1c6e54b","observation_id":"bccb78db-3114-4aa3-abae-3579711fe1bc","resolution":{"observed_at":"2026-08-06T18:08:58.452120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20337","last_updated":"2024-05-30T17:59:42Z","snapshot_observed_at":"2026-08-16T13:47:37.874188Z","submitted_at":"2024-05-30T17:59:42Z","title":"OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20337","snapshot_observed_at":"2026-08-06T18:08:53.539429Z","title":"Occsora: 4d occupancy generation models as world simulators for autonomous driv- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.539429Z"},"links":{"cited_paper":"/paper/2405.20337","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:240674d83bf43e7b96a649d935c5cc1f119793a498a4cf46e02a638c4214d5dd","observation_id":"f459aa87-5b1d-4d6e-9b2d-05fce9a823b5","resolution":{"observed_at":"2026-08-06T18:08:53.539429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.255244Z","title":"Drivedreamer: Towards real-world- drive world models for autonomous driving","venue":null,"work_id":"95caf110-7b88-4cf7-a394-929fe678ac7a","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.625583Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:06bccfd14fe322f35ecf735988c85ce8900578208dc94f4a8b2a9f5a4c36398d","observation_id":"c7f01f57-31fe-47f7-9af9-073e815af061","resolution":{"observed_at":"2026-08-06T18:08:58.317739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.120123Z","title":"Occllama: An occupancy- language-action generative world model for autonomous driv- ing","venue":null,"work_id":"ec424f52-b60a-4d48-8293-2abaaf89506c","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.699531Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:938a7805fd4bb5ed2e008693d831781d9ebd19cacc83d5cbc1d4db30f7879b03","observation_id":"110888b1-8ef1-485e-afcd-c52478dc0446","resolution":{"observed_at":"2026-08-06T18:08:58.179254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:57.923971Z","title":"Inverting the pose forecasting pipeline with spf2: Sequential pointcloud forecasting for sequential pose forecasting","venue":null,"work_id":"24b0b340-f1fb-4568-9510-948e1ee54c51","year":2021},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.809724Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:6457b294558b8ae8a73e846e8fce5a31c7609d21e6d5a8f352b22af3f0003de6","observation_id":"e8361453-a2cb-467a-aabb-d712ebffad80","resolution":{"observed_at":"2026-08-06T18:08:58.033467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:57.730872Z","title":"ivideogpt: Interactive videogpts are scalable world models","venue":null,"work_id":"78a8a6be-7c1e-4a8b-ba6b-3661af4d5a73","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.915478Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:c1bb17eae67ad8968d30f43706c2d2f48313b1b18df9169212daf6f7a0c3e5f8","observation_id":"a4e81d92-c85a-463c-8ed0-9110de2c7fff","resolution":{"observed_at":"2026-08-06T18:08:57.800415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:57.582581Z","title":"Occ-llm: Enhancing autonomous driving with occupancy-based large language models","venue":null,"work_id":"cfd05ca6-f2da-4c0f-9d09-408d59e4af3a","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.001361Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:d27ebf3ef87720925b2900c9f95c067187fbc0bdaaca3cf0f9554e17df1a1ec8","observation_id":"3c105349-79a2-4657-a197-2c3e912ed02a","resolution":{"observed_at":"2026-08-06T18:08:57.655793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:57.272610Z","title":"Videogpt: Video generation using vq-vae and transform- ers","venue":null,"work_id":"b8a15772-9244-4b84-8c5f-26c1a78683c6","year":2021},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.064863Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:9f5d8b097c47e4fe8fad89195d664eecc982ecf1e7db0065be5dc5941f1a3be9","observation_id":"064180a0-e7b7-4992-8186-da7c2a7cb1de","resolution":{"observed_at":"2026-08-06T18:08:57.483539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:56.982802Z","title":"Renderworld: World model with self-supervised 3d label","venue":null,"work_id":"33876852-2830-4104-b5c4-6411923794ad","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.151092Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:c7c70bcfdcb3cb50e00e42c7c2a1c495f3860d8200433cc929ee504a8706679b","observation_id":"694925b3-ab48-4c1f-956c-1f7ab4d310c1","resolution":{"observed_at":"2026-08-06T18:08:57.138598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:56.678758Z","title":"Bevformer v2: Adapting modern image backbones to bird’s-eye-view recognition via perspective su- pervision","venue":null,"work_id":"3b9432ba-0a1e-4bae-ab63-fcbcc4a24d5c","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.187795Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:c7ee067245a5765add73b974d55c9a70032e5df47dc4b9e3ad2055516e87744d","observation_id":"2d2f8d2f-4caf-4d18-91d9-b125fae29c9a","resolution":{"observed_at":"2026-08-06T18:08:56.805746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:56.369107Z","title":"Driving in the occupancy world: Vision-centric 4d occupancy forecasting and planning via world models for autonomous driving.AAAI,","venue":null,"work_id":"6c719852-2404-4a1d-88ca-4721b5500b42","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.228110Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:3ebceaec2e6af9be3fb0a1b459ea738c58fa7054f9bac5861db0a6d7fe6c02f7","observation_id":"e977cd88-d0f1-4faf-af0c-27e452e22984","resolution":{"observed_at":"2026-08-06T18:08:56.536961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:56.076410Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"0638fcef-7334-4299-b132-9da7262cdf4f","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.289856Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:50ea47fb5c1628f8a6835d855ac152463bfad478d02df471d35e5888184e1132","observation_id":"8b6a7c64-83c9-49c0-9ef6-8062a3b23f88","resolution":{"observed_at":"2026-08-06T18:08:56.185791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13772","last_updated":"2024-12-18T12:10:33Z","snapshot_observed_at":"2026-08-15T05:32:07.792167Z","submitted_at":"2024-12-18T12:10:33Z","title":"An Efficient Occupancy World Model via Decoupled Dynamic Flow and Image-assisted Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13772","snapshot_observed_at":"2026-08-06T18:08:54.319827Z","title":"An efficient occupancy world model via decoupled dynamic flow and image-assisted training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.319827Z"},"links":{"cited_paper":"/paper/2412.13772","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:3ab9549176fd5faf3424fb411e5bd122543f89138f491af3d0eb441d88f7f0ad","observation_id":"77cf7902-228e-4d73-a16a-b73cc266e453","resolution":{"observed_at":"2026-08-06T18:08:54.319827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:55.825255Z","title":"Copilot4d: Learning unsupervised world models for autonomous driving via discrete diffusion","venue":null,"work_id":"b0bc869b-e7ba-4c28-a6da-59579d7f3b19","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.357990Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:baf0cfec54fa8d5090ce7b25fa01c7cfa4984c358087a90fcd31f4de0138d27b","observation_id":"78fd15a8-b6d8-49f2-8ae5-b05f35aad011","resolution":{"observed_at":"2026-08-06T18:08:55.948100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06845","last_updated":"2024-04-11T04:17:13Z","snapshot_observed_at":"2026-08-16T14:10:55.463304Z","submitted_at":"2024-03-11T16:03:35Z","title":"DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06845","snapshot_observed_at":"2026-08-06T18:08:54.392162Z","title":"Drivedreamer- 2: Llm-enhanced world models for diverse driving video gen- eration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.392162Z"},"links":{"cited_paper":"/paper/2403.06845","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:abe445aa1d4fec23efae61387a3d339058f32d94369a48fc7c040c36802a1302","observation_id":"c46c6f49-6e33-4b5c-86c4-8484eba1f7f1","resolution":{"observed_at":"2026-08-06T18:08:54.392162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:55.494459Z","title":"Cv-vae: A compatible video vae for latent generative video models","venue":null,"work_id":"9254ba5d-7203-4735-a0a5-cf80af68dba7","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.443696Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:8335c821929c9889ecda547ab705e4e28187bce20e8bd34cafe1fb47757b26a1","observation_id":"127bba40-acbf-4a51-8fbb-e1c9940887e5","resolution":{"observed_at":"2026-08-06T18:08:55.684773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:55.266530Z","title":"Occworld: Learning a 3d occupancy world model for autonomous driving","venue":null,"work_id":"902b7f78-a278-4435-9e15-fb54f623e027","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.484694Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:76aa910f307d85beae6823ec1de026b11eef1db5074591ad872d0205db41ee9d","observation_id":"53cbfdfe-6fb4-43e3-ab81-33f0a834df97","resolution":{"observed_at":"2026-08-06T18:08:55.372362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:55.081531Z","title":"Hitvideo: Hierarchical tokenizers for enhancing text-to- video generation with autoregressive large language models","venue":null,"work_id":"3373496e-8db7-4a6d-8b35-ee9dfc2e529d","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.528141Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:736970a9d643634e8e44c14d349adc1ac5db1078a33361f3779927cbe5d6b340","observation_id":"16c40c42-07a2-4d24-9052-96b0e4c25d69","resolution":{"observed_at":"2026-08-06T18:08:55.194296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:54.974664Z","title":"Scaling the codebook size of vq-gan to 100,000 with a utilization rate of 99%","venue":null,"work_id":"233e901f-bae5-4081-a57c-b64d3e632386","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.571426Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:dd06344c2f7e28a1ed0505fda141d32910f99eea4f587b0c8713c5d8dee7118a","observation_id":"3d658106-c657-4d36-a2cd-79356caeb59a","resolution":{"observed_at":"2026-08-06T18:08:55.034751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:54.811695Z","title":"Deformable detr: Deformable transformers for end-to-end object detection","venue":null,"work_id":"65139e59-f7ab-4d54-a32f-eac2c987988d","year":2021},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.630490Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:31e94c6de4c8a8626f27564338344c519deab361ddf89fe7ba986e3d8682bebb","observation_id":"f72cfb80-31fc-4cc4-b8a8-f94862811795","resolution":{"observed_at":"2026-08-06T18:08:54.873947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T16:15:52.434748Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":54},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 4 inbound Pith citation observations for arXiv:2507.09144."}