{"as_of":"2026-08-14T12:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:baa2eb159c970c359972c3e4dfd9389809b837da07db8d5ebdc7233503ffb60a","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:24:27.413833Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:13:32.849963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:38:55.747199Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-08-04T09:12:50.711030Z","title":"Back to the Features: DINO as a foundation for video world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.16732","last_updated":"2026-06-25T19:54:02Z","snapshot_observed_at":"2026-08-12T21:04:24.441891Z","submitted_at":"2025-10-19T07:12:32Z","title":"A Comprehensive Survey on World Models for Embodied AI","version":3},"reference_index":182,"source":"pdf_text","source_observed_at":"2026-08-04T09:12:50.711030Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2510.16732"},"observation_digest":"sha256:d2d25078e824a777a9d043b03016d2c47a45f1e1c8f461816301c47cd530fdd3","observation_id":"45352b30-b791-45f5-99dd-c580d9001316","resolution":{"observed_at":"2026-08-04T09:12:50.711030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":"2507.19468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-03T20:38:55.747199Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":"818abe8f-4c3f-40df-a548-298982eaa685","year":2025},"citing_paper":{"arxiv_id":"2512.24497","last_updated":"2026-05-18T09:26:59Z","snapshot_observed_at":"2026-08-13T04:43:20.278133Z","submitted_at":"2025-12-30T22:50:03Z","title":"What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-21T15:33:24.616338Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2512.24497"},"observation_digest":"sha256:4ee568a7a733a7d34090c55a1c5154b0d35036891b8e832e34d0fbc0f03f2c9e","observation_id":"6990b1c1-0b58-4d1d-bea8-3cf3c3357260","resolution":{"observed_at":"2026-05-21T15:34:15.048528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":"2507.19468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-03T20:38:55.747199Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":"818abe8f-4c3f-40df-a548-298982eaa685","year":2025},"citing_paper":{"arxiv_id":"2604.11707","last_updated":"2026-04-13T16:42:46Z","snapshot_observed_at":"2026-08-14T02:26:44.424103Z","submitted_at":"2026-04-13T16:42:46Z","title":"Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:30:53.578491Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2604.11707"},"observation_digest":"sha256:9b4a4072bec8007ebd8f4301c7e6d17218256470a7a93492e92850c42440da98","observation_id":"2d0f6416-88ae-45fd-90ad-13e7e65f9fc5","resolution":{"observed_at":"2026-05-11T08:45:58.662898Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":"2507.19468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-03T20:38:55.747199Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":"818abe8f-4c3f-40df-a548-298982eaa685","year":2025},"citing_paper":{"arxiv_id":"2604.11737","last_updated":"2026-04-13T17:14:47Z","snapshot_observed_at":"2026-08-13T00:36:03.853913Z","submitted_at":"2026-04-13T17:14:47Z","title":"Learning Long-term Motion Embeddings for Efficient Kinematics Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:55:26.222900Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2604.11737"},"observation_digest":"sha256:ca0ccfd15867c23655b982bce651b3486fa9e653044233d2805c263a537d85eb","observation_id":"c622365f-1f1e-4c0b-86fa-1a3eabadefd5","resolution":{"observed_at":"2026-05-11T09:36:05.038995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":"2507.19468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-03T20:38:55.747199Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":"818abe8f-4c3f-40df-a548-298982eaa685","year":2025},"citing_paper":{"arxiv_id":"2605.02134","last_updated":"2026-05-04T01:30:04Z","snapshot_observed_at":"2026-08-14T02:15:30.136224Z","submitted_at":"2026-05-04T01:30:04Z","title":"Video Generation with Predictive Latents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T16:55:54.709581Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2605.02134"},"observation_digest":"sha256:ad74779f0652ae4044a366fca4ebf25da8fa274a619062aabf74bdbfeb3ee2f0","observation_id":"ff25bd88-1c4c-4954-a78c-2a65cc27c661","resolution":{"observed_at":"2026-05-11T16:26:09.276917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":"2507.19468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-03T20:38:55.747199Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":"818abe8f-4c3f-40df-a548-298982eaa685","year":2025},"citing_paper":{"arxiv_id":"2605.03245","last_updated":"2026-05-05T00:26:57Z","snapshot_observed_at":"2026-08-11T00:16:23.697482Z","submitted_at":"2026-05-05T00:26:57Z","title":"Text-Conditional JEPA for Learning Semantically Rich Visual Representations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T17:58:43.650308Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2605.03245"},"observation_digest":"sha256:7f31cd067098aa7a76af14526594feb156fda958d12887aae2d40bf53d69cadb","observation_id":"3d292a4f-e3b0-4ca5-8273-791a8fff967f","resolution":{"observed_at":"2026-05-12T10:51:30.617299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":"2507.19468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-03T20:38:55.747199Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":"818abe8f-4c3f-40df-a548-298982eaa685","year":2025},"citing_paper":{"arxiv_id":"2605.06388","last_updated":"2026-05-07T15:05:26Z","snapshot_observed_at":"2026-08-12T15:42:05.987893Z","submitted_at":"2026-05-07T15:05:26Z","title":"Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T13:16:27.868477Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2605.06388"},"observation_digest":"sha256:ed27e74b031bd034e9c7eac449d917938efcdb7a6adca248a12edb69489b85cc","observation_id":"fbfa1ba5-dd6c-4464-80fa-3e540fd130ff","resolution":{"observed_at":"2026-05-11T18:56:07.075706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":"2507.19468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-03T20:38:55.747199Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":"818abe8f-4c3f-40df-a548-298982eaa685","year":2025},"citing_paper":{"arxiv_id":"2605.07079","last_updated":"2026-05-08T00:58:16Z","snapshot_observed_at":"2026-08-12T15:41:14.531044Z","submitted_at":"2026-05-08T00:58:16Z","title":"Learning Visual Feature-Based World Models via Residual Latent Action","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T01:37:27.658078Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2605.07079"},"observation_digest":"sha256:9ded36d70b68ce05f41c072ecdffa5add34546bb66fe93a5eafffb9993db498d","observation_id":"4db30d88-b06a-4425-b9c8-8c25c42dd8a0","resolution":{"observed_at":"2026-05-11T01:40:51.976743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":"2507.19468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-03T20:38:55.747199Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":"818abe8f-4c3f-40df-a548-298982eaa685","year":2025},"citing_paper":{"arxiv_id":"2605.25620","last_updated":"2026-05-25T09:21:43Z","snapshot_observed_at":"2026-08-14T05:39:45.974683Z","submitted_at":"2026-05-25T09:21:43Z","title":"Back to Parsimonious Latents: Learning Task-Centric World Models from Visual Foundations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T21:43:59.953809Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2605.25620"},"observation_digest":"sha256:c921f5741266afc42ff46873c5bab26a1b23080b68a4d8d95b0aac4940512d13","observation_id":"daa4d663-5748-4cd1-bb00-e70f719cbccc","resolution":{"observed_at":"2026-06-29T22:04:00.631958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":"2507.19468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-03T20:38:55.747199Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":"818abe8f-4c3f-40df-a548-298982eaa685","year":2025},"citing_paper":{"arxiv_id":"2606.10656","last_updated":"2026-06-09T10:04:38Z","snapshot_observed_at":"2026-08-06T18:20:43.521746Z","submitted_at":"2026-06-09T10:04:38Z","title":"Envision4D: Envisioning Visual Futures via Feed-forward 4D Gaussian Splatting for Autonomous Driving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T13:48:15.379724Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2606.10656"},"observation_digest":"sha256:5ae7f92b2b6ee4671198fd45ee8d746a6fbc8b8a244b37d33956f76ac12e6175","observation_id":"ae265a73-b4f7-4c7b-b72d-bfb4a17d3ea0","resolution":{"observed_at":"2026-07-03T04:37:36.945597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":"2507.19468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-03T20:38:55.747199Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":"818abe8f-4c3f-40df-a548-298982eaa685","year":2025},"citing_paper":{"arxiv_id":"2606.12191","last_updated":"2026-06-10T15:15:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T15:15:01Z","title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","version":1},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:30.702256Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2606.12191"},"observation_digest":"sha256:a191c3e9ec70ee5b871090316877ed75153b1a8eeba9c39a53e56bbbc2fc5416","observation_id":"bb059efd-1c82-45a5-bb56-67e876b71806","resolution":{"observed_at":"2026-07-03T10:58:02.812991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":"2507.19468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-03T20:38:55.747199Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":"818abe8f-4c3f-40df-a548-298982eaa685","year":2025},"citing_paper":{"arxiv_id":"2606.18250","last_updated":"2026-06-16T17:59:46Z","snapshot_observed_at":"2026-08-14T01:44:25.522269Z","submitted_at":"2026-06-16T17:59:46Z","title":"Future Dynamic 3D Reconstruction: A 3D World Model with Disentangled Ego-Motion","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T01:14:19.195054Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2606.18250"},"observation_digest":"sha256:e31a9262e236724c8fd521ca4afaf5345c031da3f1990535ed8aba39d93b2289","observation_id":"c07cf121-1c4a-42a8-8068-55d7b3522e2e","resolution":{"observed_at":"2026-07-03T20:38:55.748766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-07-11T19:24:48.899301Z","title":"Back to the features: Dino as a foundation for video world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04409","last_updated":"2026-07-05T17:02:40Z","snapshot_observed_at":"2026-08-13T11:30:46.774675Z","submitted_at":"2026-07-05T17:02:40Z","title":"Learning Task-Sufficient World Models by Synergizing Agentic Exploration and Structured Modeling","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-07-11T19:24:48.899301Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2607.04409"},"observation_digest":"sha256:0abd50c6c27c8b8bd35d1f5c8399df81cc5f67e2e5bc56069d702f09f62e4bfc","observation_id":"1c8089d9-01b6-4a7d-bfb3-f439e3855bb7","resolution":{"observed_at":"2026-07-11T19:24:48.899301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-08-01T07:07:42.787898Z","title":"Back to the features: Dino as a foundation for video world models.arXiv preprint arXiv:2507.19468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21576","last_updated":"2026-07-23T17:55:07Z","snapshot_observed_at":"2026-08-14T08:57:34.776814Z","submitted_at":"2026-07-23T17:55:07Z","title":"Self-Supervised Learning of Structured Dynamics from Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T07:07:42.787898Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2607.21576"},"observation_digest":"sha256:48c990d2f344851904e048764e86c99cbf0285be953a68ee05bea10f27e15ac9","observation_id":"645df39c-c401-4de0-81ef-3b53daab1ac7","resolution":{"observed_at":"2026-08-01T07:07:42.787898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-08-01T06:34:04.062862Z","title":"Back to the features: Dino as a foundation for video world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27511","last_updated":"2026-07-29T22:55:54Z","snapshot_observed_at":"2026-08-14T11:38:13.892361Z","submitted_at":"2026-07-29T22:55:54Z","title":"Failure Detection for Surgical Robot Imitation Policies via Flow-Matching World Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T06:34:04.062862Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2607.27511"},"observation_digest":"sha256:10bb6ee2fb83d144b5f0e233294a642250e195d5b336af82ed3f99df341b440c","observation_id":"f1a7fb7f-ec3d-455c-afbc-2c92c56a6548","resolution":{"observed_at":"2026-08-01T06:34:04.062862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-08-04T07:37:52.354911Z","title":"Back to the features: Dino as a foundation for video world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-11T14:36:40.589425Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.354911Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:f88f9b6292edfbf6f3e26618dbf0063acdb7c29be84a3cc97e0daa2f2cc283cf","observation_id":"291abc56-8acb-4515-949a-231de4f18a6e","resolution":{"observed_at":"2026-08-04T07:37:52.354911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-08-08T05:52:17.229060Z","title":"Back to the fea- tures: Dino as a foundation for video world models.arXiv preprint arXiv:2507.19468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05597","last_updated":"2026-08-06T04:43:53Z","snapshot_observed_at":"2026-08-13T17:31:05.039018Z","submitted_at":"2026-08-06T04:43:53Z","title":"Uncertainty-Aware World Model for Aerial Image-Goal Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T05:52:17.229060Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2608.05597"},"observation_digest":"sha256:855c977a2b7e32d4d94cd962b2a4ef9513b05176b11c1fd41d42a786bcbcfbf1","observation_id":"4e666f9c-e272-4158-ab78-ad6e6b9fe3e9","resolution":{"observed_at":"2026-08-08T05:52:17.229060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-08-10T05:06:02.500245Z","title":"Back to the features: Dino as a foundation for video world models.arXiv preprint arXiv:2507.19468,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07409","last_updated":"2026-08-07T16:55:58Z","snapshot_observed_at":"2026-08-14T07:42:26.428636Z","submitted_at":"2026-08-07T16:55:58Z","title":"UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:02.500245Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2608.07409"},"observation_digest":"sha256:d0c7ce1e0312167ffa6624a141225c25c1fc2ea47aa8d73fe5409dd296ae95f0","observation_id":"352b986b-b00f-4e1c-950a-b0af7760ac81","resolution":{"observed_at":"2026-08-10T05:06:02.500245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-08-12T00:13:32.849963Z","title":"Baldassarre, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09073","last_updated":"2026-08-10T03:23:26Z","snapshot_observed_at":"2026-08-13T23:41:18.691691Z","submitted_at":"2026-08-10T03:23:26Z","title":"Latent World Models with Monotone Planning Costs for Image-Goal Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:32.849963Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2608.09073"},"observation_digest":"sha256:cd5dcff14d1d5a1f5a6afc9adf159d6adec386540b318f958c065d722b95954e","observation_id":"e49d4b57-609f-4f4a-bc96-a628a10630a8","resolution":{"observed_at":"2026-08-12T00:13:32.849963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.19468/citation-record","integrity":"/paper/2507.19468/integrity","json":"/paper/2507.19468/citation-record.json","paper":"/paper/2507.19468"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:31.051471Z","title":"Recurrent world models facilitate policy evolution","venue":null,"work_id":"f272d478-69f1-48b6-835d-d3fec09888e6","year":2018},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:19.077215Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:fd7b98cdfdd4c8b3c182dafb51636099eec2d02afe5373b47a9dccfca89d1d0e","observation_id":"b1793104-a74f-4e87-964c-91983d040163","resolution":{"observed_at":"2026-08-06T14:24:31.055775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-08-06T14:24:19.230074Z","title":"Gaia-1: A generative world model for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:19.230074Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:1bb65197b179dace056758bb364b7b68ef4c2d5e2462a97335a3754a1cb7ca63","observation_id":"0179cea5-6424-4d8f-ac0e-f1d2fef54403","resolution":{"observed_at":"2026-08-06T14:24:19.230074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:31.036429Z","title":"Learning interactive real-world simulators","venue":null,"work_id":"8f9a430e-3356-4b5c-ace9-3bf193516b06","year":2023},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:19.337762Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:f893277b97094dfc6a0a2eec146bcf0c72423faa90653ce7bdb4046c8aa873e9","observation_id":"4b154396-d440-430a-8111-04af2298a4ba","resolution":{"observed_at":"2026-08-06T14:24:31.041389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:31.021622Z","title":"Video gen- eration models as world simulators","venue":null,"work_id":"681baa57-3f8f-488f-a1f5-260e9061b94b","year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:19.507700Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:47b39c28e23824dcac8e93a72c927a41f1b097b1464bdb486734c8fb692fbc24","observation_id":"7fb5ea1f-3d80-4c4e-8b2a-92e7f5e8334c","resolution":{"observed_at":"2026-08-06T14:24:31.026043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:31.007153Z","title":"Genie: Generative interactive environments","venue":null,"work_id":"a3e7ce78-d5a3-416f-b143-6506d99d22de","year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:19.584629Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:d1a3ab38b5715d6225eba43977705e3c251e89cfafc55c1c37dcfd27b3c9f5d4","observation_id":"2d701c55-b1d1-4af9-8117-9b6a962f88d6","resolution":{"observed_at":"2026-08-06T14:24:31.011696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.992661Z","title":"Genie 2: A large- scale foundation world model","venue":null,"work_id":"ec958399-968d-42d5-868c-777ceae47f73","year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:19.683448Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:31f5bca76824cf4b6158083fe5399d3533ac894f5ee257f78b34e587b6e6faac","observation_id":"73d6bbeb-9f8c-491a-a2a3-78dd21eb5f6d","resolution":{"observed_at":"2026-08-06T14:24:30.997168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15672","last_updated":"2025-02-21T18:56:02Z","snapshot_observed_at":"2026-08-13T04:44:00.014879Z","submitted_at":"2025-02-21T18:56:02Z","title":"VaViM and VaVAM: Autonomous Driving through Video Generative Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15672","snapshot_observed_at":"2026-08-06T14:24:19.834310Z","title":"Vavim and vavam: Autonomous driving through video generative modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:19.834310Z"},"links":{"cited_paper":"/paper/2502.15672","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:0fdef5660780e859387022dddfdca928f03079bfe6e113cdc45e98ebc5b2967d","observation_id":"4adec688-ce17-42ab-b3d9-c6d341f9820c","resolution":{"observed_at":"2026-08-06T14:24:19.834310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-06T14:24:19.930972Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:19.930972Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:ccab823423aaf3e13708cadfdeeed242b120fe2ee924864d655eb474560277b0","observation_id":"ffa81ed9-aa70-491f-b8cb-3ff58afef1fb","resolution":{"observed_at":"2026-08-06T14:24:19.930972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20523","last_updated":"2025-03-26T13:11:35Z","snapshot_observed_at":"2026-08-12T12:54:06.280248Z","submitted_at":"2025-03-26T13:11:35Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20523","snapshot_observed_at":"2026-08-06T14:24:20.014729Z","title":"GAIA-2: A controllable multi-view generative world model for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:20.014729Z"},"links":{"cited_paper":"/paper/2503.20523","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:316dac833c0374c49918927649a122e1c58a5c70c17f7a61bd1ed83fd3667649","observation_id":"fc51d744-670f-40f3-9f11-8694ce637b23","resolution":{"observed_at":"2026-08-06T14:24:20.014729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T14:24:20.142280Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:20.142280Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:efc7d343ed073843fcf8c0c87a184dce5de60164b4117efcfc83a10e1dfadbe0","observation_id":"bb315865-5db7-4819-bc0d-baafc365e7c2","resolution":{"observed_at":"2026-08-06T14:24:20.142280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T14:24:20.265832Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:20.265832Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:4a3e266f1e1c3d46792f8a6f07637b5b85207d6df2846c746d491c25d3a504d1","observation_id":"bcbccda0-410e-4d95-a9a9-cb3ab5d0cd5d","resolution":{"observed_at":"2026-08-06T14:24:20.265832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.977615Z","title":"A path towards autonomous machine intelligence, 2022","venue":null,"work_id":"c1b94dfd-f172-4401-8308-d7404cfb7d95","year":2022},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:20.456825Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:160cb4a39fed253edd56df1f8b9145b941552d0f07861bae5b0037887ea75cc9","observation_id":"0eccd809-ad50-47f5-9447-5aeef1810379","resolution":{"observed_at":"2026-08-06T14:24:30.983100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.963310Z","title":"OpenEQA: Embodied question answering in the era of foundation models","venue":null,"work_id":"e350fca8-b7f2-4a47-bca2-51a599fb4883","year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:20.586542Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:9806b363a3776e89b770dbdaf324d6edd9f5fa222463f104783e3f016878d6bb","observation_id":"d0c234e6-1a2b-4618-9ab2-719c06c4d710","resolution":{"observed_at":"2026-08-06T14:24:30.967819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:20.719121Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:20.719121Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:42bc8ec82e2b15e7060474e7afe9e7fdb723b38e7fa649f6802c497594c337f4","observation_id":"e02f184d-7cac-4cfc-81d6-28773b0476c5","resolution":{"observed_at":"2026-08-06T14:24:20.719121Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.949699Z","title":"Mastering diverse control tasks through world models","venue":null,"work_id":"ad71e890-37ac-480c-a2bb-c0bb9a2b53fb","year":2025},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:20.834970Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:b7dab9d921457b0184245006bf33c992b61bc94867ba90ab814351e5387cad80","observation_id":"1f3285bb-c00b-4e96-95c8-4a43c1316cd9","resolution":{"observed_at":"2026-08-06T14:24:30.953943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.934677Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":"d02fdad7-af64-4e7d-8038-5756209c48d7","year":2025},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:20.915469Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:23f9933c41af887143f06dc4a69107d3e665c61e116447d73789e1299b0ae00d","observation_id":"ea5e4040-e89c-4eaf-ac5c-274cf314330b","resolution":{"observed_at":"2026-08-06T14:24:30.939126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.921100Z","title":"TD-MPC2: Scalable, robust world models for continuous control","venue":null,"work_id":"077f4ab6-8037-4c5f-a08f-f3b1c2600736","year":2023},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:21.018373Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:a60aa8496b258f9fe5beaca2e0bcf9beb797e0aecb2005e8e1a6c997ef8031c1","observation_id":"ba063c0b-b3c1-41c5-96aa-68cefb1d2837","resolution":{"observed_at":"2026-08-06T14:24:30.925431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04983","last_updated":"2025-02-01T02:40:49Z","snapshot_observed_at":"2026-08-13T16:10:49.002039Z","submitted_at":"2024-11-07T18:54:37Z","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04983","snapshot_observed_at":"2026-08-06T14:24:21.154250Z","title":"DINO-WM: World models on pre-trained visual features enable zero-shot planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:21.154250Z"},"links":{"cited_paper":"/paper/2411.04983","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:1aabc2a6dc28caa12b8d732d18ed9639fa89ae1e3cf42635ebed62f781f81d73","observation_id":"4db01b73-96d7-4aeb-a5fa-acb017067f80","resolution":{"observed_at":"2026-08-06T14:24:21.154250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:21.241933Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:21.241933Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:2d53f6b724d349bd4f5a51aa3d606c08a908583c74d054598a4d231c4e00cb84","observation_id":"3c0dde91-6f37-42c5-a384-a85f000ee1a8","resolution":{"observed_at":"2026-08-06T14:24:21.241933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:21.304379Z","title":"DINO-Foresight: Looking into the future with dino","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:21.304379Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:2d4dcaaef14dab5849d56d203a9376b64513fe05f3b9152ad87b727cab053509","observation_id":"53a54ef5-62be-437b-9dcd-efb08d7d9e91","resolution":{"observed_at":"2026-08-06T14:24:21.304379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11831","last_updated":"2025-02-17T14:27:14Z","snapshot_observed_at":"2026-08-07T18:12:21.463545Z","submitted_at":"2025-02-17T14:27:14Z","title":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11831","snapshot_observed_at":"2026-08-06T14:24:21.361886Z","title":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:21.361886Z"},"links":{"cited_paper":"/paper/2502.11831","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:d0a36cb4b4c22d8f0796c57be1a2e3ce4d7026fc87f53e9bbd1a67d33882a707","observation_id":"016f5174-ad6c-4bcf-a506-bd1506d81b97","resolution":{"observed_at":"2026-08-06T14:24:21.361886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-14T09:57:44.505326Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-08-06T14:24:21.470319Z","title":"Do generative video models understand physical principles? arXiv preprint arXiv:2501.09038, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:21.470319Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:cd1bdf87f9b2f75455e3326ebae4feb5cca506c5c387048b2426cdaf2eda57b4","observation_id":"654ba3bc-8375-471f-b089-b03401cd4432","resolution":{"observed_at":"2026-08-06T14:24:21.470319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.906867Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"93e6cde2-8320-4b85-9874-dfe73e10a381","year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:21.647569Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:ea76ea84e4849b8c98444093bf21f2bdc1c21bbc86435258abfb1971c8d434d4","observation_id":"36e28ed2-1d9e-4a14-9032-6cbdc86660a2","resolution":{"observed_at":"2026-08-06T14:24:30.911680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.892242Z","title":"Revisiting feature prediction for learning visual representations from video","venue":null,"work_id":"04477e04-b389-433d-b46e-9d66a36ad550","year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:21.744798Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:706c37ca5f7d679cc8c26f5528bbb90df2640812458fabeada48e6c38e98601c","observation_id":"3b3052f3-e33d-4d7b-a8ae-1e252b6e5418","resolution":{"observed_at":"2026-08-06T14:24:30.896830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.878945Z","title":null,"venue":null,"work_id":"eff954bf-9be9-498c-ae6c-67169afda34e","year":1991},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:21.880961Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:8fe0f0d42ed706c39e437e82e08c847ccc4b46291a54f5542cac08c3285ca8ad","observation_id":"4c73bb99-2c26-4c60-b9ed-c9a6c6e69886","resolution":{"observed_at":"2026-08-06T14:24:30.883309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.865026Z","title":"Making the world differentiable: on using self supervised fully recurrent neural networks for dynamic reinforcement learning and planning in non-stationary environments","venue":null,"work_id":"39be2f9b-2a42-4c8a-adda-c08a4701503e","year":1990},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:22.040712Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:f68941219bafeeb65c9bf383e8a0f5f496f8ba193d46c8f4ff246f906968dd14","observation_id":"ef1d1eb6-988e-4a84-af0c-3f1db23db1bb","resolution":{"observed_at":"2026-08-06T14:24:30.869882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.851423Z","title":"Goodwin and K.S","venue":null,"work_id":"9b004cde-0589-4f1a-9d90-dbb31c375fdf","year":1984},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:22.182653Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:2a145f22e1e8f951dfd002539fd95129b6db49a53fc248faf5ddc3486b4e33c8","observation_id":"26f586b3-8529-437f-89b5-dada133df858","resolution":{"observed_at":"2026-08-06T14:24:30.855677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.837553Z","title":"Lillicrap, Jimmy Ba, and Mohammad Norouzi","venue":null,"work_id":"4219de00-7d21-4b86-b09c-0b2442c78008","year":2019},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:22.266415Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:d4b5f2127e1c3acd15619de049535b0b85e6a69330b8883a3e9e5aa440ac7fac","observation_id":"19fc8569-9ab7-4751-8b8e-5d8ac6a8e45d","resolution":{"observed_at":"2026-08-06T14:24:30.842316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.818864Z","title":"Transformers are sample-efficient world models","venue":null,"work_id":"6516da37-1c0f-4fb9-ad4e-3927e2c2ef3c","year":2023},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:22.432112Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:269ca01ad8c95e4947d3e8fd83fc1688b81f89556318b10c520e528a0b622c7d","observation_id":"3b706e76-2b7a-4f7d-a657-83b5d9e96710","resolution":{"observed_at":"2026-08-06T14:24:30.827733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.805300Z","title":"Lillicrap, Ian S","venue":null,"work_id":"5b544322-0060-4d99-8088-2258b9b92045","year":2019},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:22.521742Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:fe1e19b403677d51ce80405d777c771fbab08f349e93b7f68e9a9dce54e8a364","observation_id":"8e661078-69cf-4222-95ea-870e109aac45","resolution":{"observed_at":"2026-08-06T14:24:30.809530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03572","last_updated":"2025-04-11T19:20:22Z","snapshot_observed_at":"2026-08-14T05:03:21.311347Z","submitted_at":"2024-12-04T18:59:45Z","title":"Navigation World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03572","snapshot_observed_at":"2026-08-06T14:24:22.613110Z","title":"Navigation world models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:22.613110Z"},"links":{"cited_paper":"/paper/2412.03572","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:250296d4b86b3337baff546a2010b2ebf53cc3a45200b1ac74e2cf09ad600961","observation_id":"52f6a0c8-1e60-40e8-9650-88639314e742","resolution":{"observed_at":"2026-08-06T14:24:22.613110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.791139Z","title":"Video pixel networks","venue":null,"work_id":"b76665b6-3236-430a-bc66-9f506e62a2cd","year":2016},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:22.763667Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:0aa40a99c289b90d3ceeb9aec1f6fccf8080a665346f94086fb304b4f3e22b79","observation_id":"0384afb7-0a13-4177-9083-d338d19ed56d","resolution":{"observed_at":"2026-08-06T14:24:30.795669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.776805Z","title":"Campbell, and Sergey Levine","venue":null,"work_id":"55f1927c-87e5-4a2e-ac20-0d1c4ad7862b","year":2018},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:22.874245Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:87ace3dd34a76d5dbb6d25aac1a4bdf89abe4c67bfeafce33edaf42c2f03c231","observation_id":"804d5eee-2073-439a-ba4e-d462db24c9ab","resolution":{"observed_at":"2026-08-06T14:24:30.781330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.760893Z","title":"Stochastic video generation with a learned prior","venue":null,"work_id":"5002ec8a-596b-4aef-b23f-613bdf504995","year":2018},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:22.976795Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:b71d45748307e5755961ecee768297c84e3760a77658f755837ea51f385478b6","observation_id":"44a791d4-8383-43bc-a26a-aa3708502244","resolution":{"observed_at":"2026-08-06T14:24:30.767071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-13T14:30:50.605700Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-06T14:24:23.088610Z","title":"VideoGPT: Video generation using vq-vae and transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:23.088610Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:2b0e94a399fb49f68a7e8eb1a524a113c3a7b5510a8af30287c50d85ae0c3748","observation_id":"565226b3-6805-4451-b262-4fc06a239848","resolution":{"observed_at":"2026-08-06T14:24:23.088610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.745933Z","title":"Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang","venue":null,"work_id":"ece0d216-0228-4f2e-b335-c14083107bf8","year":2023},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:23.203680Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:6ed125c9ca2188ded5d3e85ddff88d91e9a28b89dad9d96a75d326b040c8f8cb","observation_id":"29563b80-7240-4290-ae59-85480841aacb","resolution":{"observed_at":"2026-08-06T14:24:30.750767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.731122Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"428fa5d6-6dd4-4bb7-8896-6a7bef65994f","year":2023},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:23.318467Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:c89a916a52799ec22db37305b02819281989c79cea86381280d0778c312663c1","observation_id":"bb5284a2-4701-4b36-879f-9bd3700b14a7","resolution":{"observed_at":"2026-08-06T14:24:30.735696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.716806Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"c778448d-43ec-4fbe-9a31-abe57f128128","year":2023},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:23.443562Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:71390549eb450d84d66af663781540d42e9a07a76840d265ac6bfc9047f47a2d","observation_id":"dce58889-429a-411d-a136-2d6f2ed8005b","resolution":{"observed_at":"2026-08-06T14:24:30.721118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.702573Z","title":null,"venue":null,"work_id":"428e047f-2092-49a4-9a3c-4a25e4c8d7cc","year":2023},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:23.584776Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:05394f6e872cd17705d88f329010fe9789e2bfcf22ae78ca416b380d8af18366","observation_id":"01cadf25-56c1-4351-8f1d-db96fb6ef124","resolution":{"observed_at":"2026-08-06T14:24:30.706950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.688729Z","title":"Action-conditional video prediction using deep networks in atari games","venue":null,"work_id":"fc2b27f1-a0db-44fc-8c7e-9aeccd56e3bf","year":2015},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:23.693050Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:b6aa8886ffaf457a3fb3872b8b4ad53842ce5c6ad1fe801bf99f05eed498eba7","observation_id":"3c46f61a-997a-47da-8a7d-3af9cf1aa378","resolution":{"observed_at":"2026-08-06T14:24:30.693050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.675433Z","title":"Recurrent environment simulators","venue":null,"work_id":"bdeeb8b4-f306-4872-9cb1-e475dd34b3f8","year":2017},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:23.796136Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:aa2b3149b0ce2a58f50a56692fe9abb106bd497936526bfc5bdb35a68848a1df","observation_id":"b44315c2-8172-4e68-b4ba-9daa4ac01abd","resolution":{"observed_at":"2026-08-06T14:24:30.679684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-13T01:58:53.405976Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-08-06T14:24:23.915976Z","title":"How far is video generation from world model: A physical law perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:23.915976Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:7eadbbcadaee17f201b7587522e5a11ef5712bde9f3b28514ccadeefa70a7617","observation_id":"c172c475-0d52-44f7-8ffa-e3ec1e963f03","resolution":{"observed_at":"2026-08-06T14:24:23.915976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.661161Z","title":"Predicting deeper into the future of semantic segmentation","venue":null,"work_id":"bdb34513-6091-4fd4-86d7-6ccdbcedf2e6","year":2017},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:24.025940Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:afc926dc76dc76f94bdf887e5c94b53519b9e49aea315e970bd2645ddf718ea2","observation_id":"9fe1ac1d-86aa-4c3b-81bb-e7701028d066","resolution":{"observed_at":"2026-08-06T14:24:30.665757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.648306Z","title":"Segmenting the future","venue":null,"work_id":"167f3c95-0d20-44c3-b043-d1c5ad545e11","year":2019},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:24.189747Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:a9cefebadc0b9fe2c109a311eadd75f010a203ec24aa8548950278ff721022d2","observation_id":"1eb57702-7e8d-4226-b2fe-eb621e331a5e","resolution":{"observed_at":"2026-08-06T14:24:30.652445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.634449Z","title":"Predicting future instance segmentation by forecasting convolutional features","venue":null,"work_id":"71502890-fa2e-4d81-8352-c6e099ca6385","year":2018},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:24.324980Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:ae21a1505cbba67d0ca2ca492170c74aa102ba532fcc8af86ec5282b5be4ec4b","observation_id":"68260170-b9e6-4000-b060-9342b2c4ff86","resolution":{"observed_at":"2026-08-06T14:24:30.638948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.619949Z","title":"Anticipating visual representations from unlabeled video","venue":null,"work_id":"d952fce6-af1f-454c-9540-1e53c6c194ef","year":2016},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:24.422184Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:e2ce4eeadc954d0111fd41a2ec86f5dbd2a804aced5c324c49edfce8a05c764d","observation_id":"2628495f-951c-4f04-a059-b058736068da","resolution":{"observed_at":"2026-08-06T14:24:30.624286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.604788Z","title":"Anticipative video transformer","venue":null,"work_id":"1165429b-a6f4-4923-83e1-d17a4c8b2303","year":2021},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:24.592648Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:aa686a830a3bb24a957887537a5b61b74eeb33caaff8c8ac09aab7a5e70eff83","observation_id":"a016a948-361f-4659-a82a-eeae9b4a274c","resolution":{"observed_at":"2026-08-06T14:24:30.609549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.589821Z","title":"Anticipative feature fusion transformer for multi-modal action anticipation","venue":null,"work_id":"4a619afc-ebc0-49e0-8da5-a05016b03f10","year":2022},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:24.712355Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:a6c10cf03c2011061fda9dc22cbe64dc7d6ee9ae8d9a6ed67591c7711c7cdff1","observation_id":"9148fbf3-2de1-40ca-889d-cee7904f7a5c","resolution":{"observed_at":"2026-08-06T14:24:30.594484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.576242Z","title":"Auto-encoding variational bayes","venue":null,"work_id":"55516b4b-8518-4a4c-9556-884209b6b319","year":2022},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:24.837044Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:284f88add4bdb506833f96cf140b21f85a4c3ae85d5b2c95d86a1e5d15f4dece","observation_id":"eaf442db-a459-40d0-89ac-26a65676b1cd","resolution":{"observed_at":"2026-08-06T14:24:30.580519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.561522Z","title":"Neural discrete representation learning","venue":null,"work_id":"1da23e0a-c5e9-4b02-a079-c8d614772bad","year":2017},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:24.973247Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:21475402aa00390d02d7389c866bfe66a20366584f42b5b68f61f300d623b31b","observation_id":"c738cca5-7455-441b-87b1-54eefcf11fe9","resolution":{"observed_at":"2026-08-06T14:24:30.566076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.546819Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features, 2025","venue":null,"work_id":"2a5d5d29-1a7b-4798-803e-fe96bf6559a6","year":2025},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:25.107537Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:eb0d464aab293dec5a07edb7d1dd6591d06007d5e747e31ce23c54ed20ed091b","observation_id":"a6acc1d8-ba77-4c9d-8a94-b5d7dc414d3a","resolution":{"observed_at":"2026-08-06T14:24:30.551500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:25.211077Z","title":"Is sora a world simulator? a comprehensive survey on general world models and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:25.211077Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:6591cebcee33b13e787a40a5c0e68ba1c50089438713043db4e8e85187565c5b","observation_id":"b8227ae9-e0dd-4a69-8b53-caeaff8f0025","resolution":{"observed_at":"2026-08-06T14:24:25.211077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.532976Z","title":"Attention is all you need","venue":null,"work_id":"ad921c12-01dd-44c7-9eb6-6a2451f42c57","year":2017},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:25.350254Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:e21be204cc7bc38cef912f5549ee1ee8bf907b29437e8ce08803df93dfa613dc","observation_id":"39511b93-9ee4-443d-897b-b0109e6079c5","resolution":{"observed_at":"2026-08-06T14:24:30.537053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.519192Z","title":"Rethinking patch dependence for masked autoencoders","venue":null,"work_id":"f0e4d7bf-55f5-442b-9d38-a617287a93f8","year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:25.415133Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:86789d99bafe33e177b83d21da17288769d49b3f528a53875b13ad91e4470d2c","observation_id":"eed14a7d-ab82-4edb-9878-e52b80edcad6","resolution":{"observed_at":"2026-08-06T14:24:30.523486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.504375Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"cba7b9e0-20e9-439f-97a3-42100a67c0dd","year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:25.556611Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:a496ed34c9bac1b7a3ae72bce11b4ac03b95807cdc6d5d9c61571d557dfcdad0","observation_id":"4ac9ebb9-dc8c-4d04-b230-e64a4fec428b","resolution":{"observed_at":"2026-08-06T14:24:30.509534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.490479Z","title":"Vision transformers need registers","venue":null,"work_id":"a16eca98-ec93-40ee-99c2-c5ba9f65b086","year":2023},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:25.695128Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:45f6432f91f851a1fca4c080e6705a811a9d0e201cc243c1bf9a4d03cf51d8b5","observation_id":"68af77d5-c39d-42b9-b83f-16f835a1cf8b","resolution":{"observed_at":"2026-08-06T14:24:30.495017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.475297Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"21bf46a5-1e8e-4150-a763-277568787691","year":2019},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:25.818978Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:c5fba84cd41d69b6d67be8549ffcd82cad7f41132d3fa7cb90947711c6726f2b","observation_id":"e4f855f6-375b-4026-a3b6-823c7d425163","resolution":{"observed_at":"2026-08-06T14:24:30.480014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.449666Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"1e4860b1-0dc9-4040-a257-ace826471e7b","year":2016},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:25.921907Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:ca1caf50d1f7233553fbf16176c8c2a363f394ffe58e72b7bcec7418fcf44b5c","observation_id":"a06719da-5e2a-4bf3-a51a-6c7ebfa765ac","resolution":{"observed_at":"2026-08-06T14:24:30.464341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.222586Z","title":"something something","venue":null,"work_id":"b19a831c-9ef1-4021-ae5c-9651077ad7de","year":2017},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:26.044296Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:53900f362c69cb8a0e2044e10d2ba0f56ae31291adb8f9e7411c51f648241f6c","observation_id":"976a6f12-4538-489b-b861-bb5e2580d606","resolution":{"observed_at":"2026-08-06T14:24:30.405943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:30.059891Z","title":"HowTo100M: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"6eace503-f788-4169-bfb9-4992d13c698f","year":2019},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:26.154041Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:bb38eef67c87eb59bcccb27794e99991b817b399900ed7382d13911a1aa5c901","observation_id":"286aa182-e8f9-43dd-a393-f26013f487e0","resolution":{"observed_at":"2026-08-06T14:24:30.143267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T14:24:26.303259Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:26.303259Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:f0400f3a06d491c6be93c0d1269cb3c250efbd71e5e212473b774b01e2c0b61c","observation_id":"4333be0b-3730-4a2a-83f7-8fb509f8e3f5","resolution":{"observed_at":"2026-08-06T14:24:26.303259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:29.884330Z","title":"Vspw: A large-scale dataset for video scene parsing in the wild","venue":null,"work_id":"5f7ab090-ded8-4809-8a28-b8cb51f5c685","year":2021},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:26.392949Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:132a42e5b33c185148d1f4313bb36553b9824066214fbc50d4d5790d0183797e","observation_id":"6f9f5bbd-1ed7-4973-98be-02026336fcce","resolution":{"observed_at":"2026-08-06T14:24:29.977033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:29.608874Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":"fd5010ca-b304-478e-97d2-ab7d438fe4f8","year":2013},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:26.501283Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:8c87f1665b2177d8af3732e84d68fb069698ce7536c7ac31ff16295b69ce3d00","observation_id":"c5d6f065-3eca-452f-8ff1-22224bcd48fb","resolution":{"observed_at":"2026-08-06T14:24:29.765314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:29.370276Z","title":"Intphys 2019: A benchmark for visual intuitive physics understanding","venue":null,"work_id":"d3ede288-87ab-431c-8e91-d52755d46313","year":2019},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:26.639434Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:253e6e47cefccaf214a988b014bf0dca690be03f6d545b2108a1699ec9adb8ab","observation_id":"f433dafc-05c4-462c-8ddb-ff829a673852","resolution":{"observed_at":"2026-08-06T14:24:29.528079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:29.104156Z","title":"Grasp: A novel benchmark for evaluating language grounding and situated physics understanding in multimodal language models","venue":null,"work_id":"38f73c04-6507-4271-a87d-31b91c8b506d","year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:26.806966Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:68aeafed655da8e275f1ac94e6c75c39930d795a4be317f5911d6b4566038cd7","observation_id":"2ac9a11d-82c4-4829-bb97-74c685065b4c","resolution":{"observed_at":"2026-08-06T14:24:29.215945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:28.933842Z","title":"Benchmarking progress to infant-level physical reasoning in AI","venue":null,"work_id":"75138499-438c-4c3f-a5e3-6bdaa85e7c1b","year":2022},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:26.935176Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:5b7128d417d21d2f84a78460679057599b9b04a657fface0257006c16bdc274a","observation_id":"c268f0f6-7bb6-43a1-9e2d-9435c87e56a4","resolution":{"observed_at":"2026-08-06T14:24:28.996247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:28.732780Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"5c194798-f93b-42ad-8d70-006c9a044c5a","year":2024},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:27.014609Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:f1aae4b8d4d663ce84f92a5f7b1ea04434a599f0a5ea566bef23be32e056c51a","observation_id":"1740f303-981d-4def-b921-67142f76e457","resolution":{"observed_at":"2026-08-06T14:24:28.842843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:28.417496Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"520b17f0-c0c3-4f16-bd14-cd32f5afadc2","year":2023},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:27.155767Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:5afec60e8ec606f2a90e77836b0936d0af039a77e365ca7f6271957a306e6026","observation_id":"d1c76065-4ee6-4099-a90b-120c29683baf","resolution":{"observed_at":"2026-08-06T14:24:28.524596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-14T04:09:47.636898Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-06T14:24:27.292378Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:27.292378Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:3913f793165cdcf8b5fce197dab2501bcf418e58235bf01e3f4ccf6f640fb732","observation_id":"d2fa7a46-05c6-4f23-94ad-e2e3f5929667","resolution":{"observed_at":"2026-08-06T14:24:27.292378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:24:28.204698Z","title":"frameskip","venue":null,"work_id":"57b95334-efec-48cf-b1d5-300bf376cd59","year":2000},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:27.413833Z"},"links":{"citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:7b287dfb0f4a25db932ac3f5a30198d99113fe82f4f59ce2e4f5f87045b9beb3","observation_id":"90779470-eb7c-4758-bf85-4ec3483610a5","resolution":{"observed_at":"2026-08-06T14:24:28.242547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T04:55:24.146216Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":50},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 19 inbound Pith citation observations for arXiv:2507.19468."}