{"as_of":"2026-08-19T20:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a39af73da06c013f2a89f75b37e6000e40411109aa9e2fb103fd80f9abb7c5e","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:47:13.750039Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17523/citation-record","integrity":"/paper/2607.17523/integrity","json":"/paper/2607.17523/citation-record.json","paper":"/paper/2607.17523"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:04.983265Z","title":"Youtu-llm: Unlocking the native agentic potential for lightweight large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:04.983265Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:14800d831ae932307f844a238b086c9f3b473d6c4e78892e0ead81b59a60b8a2","observation_id":"c3b7b776-f939-4895-a031-237815ada913","resolution":{"observed_at":"2026-08-01T17:47:04.983265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-01T17:47:05.062133Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.062133Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:da075aafc0b64eb4b312f814a9523e3bd5ba4a01b634c153bc5185a4467642d9","observation_id":"b268883f-6059-47e9-814b-78ba70662e6f","resolution":{"observed_at":"2026-08-01T17:47:05.062133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:05.183713Z","title":"Sora 2.https://openai.com/index/sora-2, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.183713Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:e44c8920f1b058ac9d9f6f126b70651af623edf69572bed790e9e300942bbd11","observation_id":"3362a094-430d-475b-b4a9-73d0ce640b1d","resolution":{"observed_at":"2026-08-01T17:47:05.183713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-08-01T17:47:05.356951Z","title":"Hunyuanvideo 1.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.356951Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:bdbd2d52c3cf55cf68ee848dfe3a427b3c24c3b2c44d685b710f3c74c9714a03","observation_id":"92675ba5-d455-41dd-a856-07ad00e3b75d","resolution":{"observed_at":"2026-08-01T17:47:05.356951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:05.530332Z","title":"Veo 3.https://aistudio.google.com/models/veo-3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.530332Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:b09895d8482765ccb361adff8c942bf3149d9d477e34df94bd77e794281a3dcc","observation_id":"6c2d970b-d489-4ddd-ba65-e5a47f9ce6df","resolution":{"observed_at":"2026-08-01T17:47:05.530332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T17:47:05.639163Z","title":"Wan: Open and advanced large-scale video generative models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.639163Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:ee517413218a7eae5c9c85aaf8eeb67aed70232f38c5e01827298d374de8f567","observation_id":"ea11f366-8280-42aa-bc23-0f5cda6c1acc","resolution":{"observed_at":"2026-08-01T17:47:05.639163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14502","last_updated":"2026-07-23T02:50:21Z","snapshot_observed_at":"2026-08-16T03:36:56.551252Z","submitted_at":"2026-06-12T14:33:55Z","title":"From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14502","snapshot_observed_at":"2026-08-01T17:47:05.751020Z","title":"From chatbot to digital colleague: The paradigm shift toward persistent autonomous ai.arXiv preprint arXiv:2606.14502, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.751020Z"},"links":{"cited_paper":"/paper/2606.14502","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:40c6e893bf3f912c4dabf6b5f2c46412ab1efc982454156783832bec0fc97c49","observation_id":"41acdf30-f207-439f-a381-4e6b87a1b8b2","resolution":{"observed_at":"2026-08-01T17:47:05.751020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-01T17:47:05.927225Z","title":"World simulation with video foundation models for physical ai.arXiv preprint arXiv:2511.00062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:05.927225Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:5656cf0ad3911e9839b5ae4c6f93aeaeac19c5e49757eab36920997bd8a09660","observation_id":"6f71d0e0-f3e8-46bc-a99b-beb811933f59","resolution":{"observed_at":"2026-08-01T17:47:05.927225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:06.134736Z","title":"Understanding world or predicting future? a comprehensive survey of world models.ACM Computing Surveys, 58(3):1–38, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:06.134736Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:96f6fc61d0e3fd7ec46ce78837f0bf42e37ab2d5557ba6c3e2df5c64cfdd8a37","observation_id":"183adc3c-406c-406f-9150-098284b56556","resolution":{"observed_at":"2026-08-01T17:47:06.134736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-16T12:51:43.372607Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-08-01T17:47:06.272600Z","title":"Videophy-2: A challenging action-centric physical com- monsense evaluation in video generation.arXiv preprint arXiv:2503.06800, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:06.272600Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:ba0e3e6ff21801c7718e28f128c04ae66304f8476f1ce7311086e20b6b229ec4","observation_id":"5920ead6-c2f8-48fb-9f7d-3462801e86f6","resolution":{"observed_at":"2026-08-01T17:47:06.272600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:06.472741Z","title":"The past mistake is the future wisdom: Error-driven contrastive probability optimization for chinese spell checking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:06.472741Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:29ef66453c4f354cbff51d47f1971d9d2d5f456ac12fb4fb79b7e4369fda71f0","observation_id":"28b0cf78-ac9b-4bb2-842d-17a99a13261c","resolution":{"observed_at":"2026-08-01T17:47:06.472741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:06.688624Z","title":"Think- ing with video: Video generation as a promising multimodal reasoning paradigm","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:06.688624Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:2ec42ecc0b3dea3cb523a0da82a5a60fb09cfaa40bc1389733a03854b162a5cb","observation_id":"bcf34f7e-8d07-4f11-b174-56cac699311d","resolution":{"observed_at":"2026-08-01T17:47:06.688624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:06.902542Z","title":"Reasoning via video: The first evaluation of video models’ reasoning abilities through maze-solving tasks.arXiv preprint arXiv:2511.15065, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:06.902542Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:71cc9468c8d1b5b594ab50d9a0d56f8e14c0e62bd8102aa4b1c9a10e613c2425","observation_id":"79b302f7-46fa-476c-9608-8aaf018b30bb","resolution":{"observed_at":"2026-08-01T17:47:06.902542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.063535Z","title":"Weave: Unleashing and benchmarking the in-context interleaved comprehension and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.063535Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:cd9086f522be99304dae4f5c8d94eea872412de4d30ee5e2ef567d1f4f0e60e0","observation_id":"2849c63f-b004-45be-a2a4-aea3c427aa1b","resolution":{"observed_at":"2026-08-01T17:47:07.063535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.188868Z","title":"Tivibench: Benchmarking think-in-video reasoning for video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.188868Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:6b7cbf20b4af7d8e0fbd3ea6cfc3ed751945c25299adc6f5c66e9654d01c0dd0","observation_id":"eb068e54-0837-4871-aaad-0c0c9c255731","resolution":{"observed_at":"2026-08-01T17:47:07.188868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.292420Z","title":"Evaluating gemini robotics policies in a veo world simulator.arXiv preprint arXiv:2512.10675, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.292420Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:3a2356e38c3138fbba1dc18cbc01f3f10f7192c49d0cb5c7af3eb648fe804a82","observation_id":"df8b54b6-e33e-4890-b847-28dae3b270fa","resolution":{"observed_at":"2026-08-01T17:47:07.292420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.399742Z","title":"Ggbench: A geometric generative reasoning benchmark for unified multimodal models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.399742Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:3fb456670324e1082a1a46f8475961612f3ce67f94ee960fc2848968ab87a51d","observation_id":"340e3464-76b5-4ebb-8910-eeda2658bb8a","resolution":{"observed_at":"2026-08-01T17:47:07.399742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.550254Z","title":"Let’s think with images efficiently! an interleaved-modal chain-of-thought reasoning framework with dynamic and precise visual thoughts","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.550254Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:67b83cc61152287165d6f8019848a53e56665e656b83ee8c8963f289273c06b8","observation_id":"c588afa7-58f2-49db-bfbf-e07be89a9d08","resolution":{"observed_at":"2026-08-01T17:47:07.550254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:07.733004Z","title":"Physgen: Rigid-body physics-grounded image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.733004Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:f7f6a670d1594268551e52ac12ec21f81bfe378dfaa7beb6d4c139841a29f8b3","observation_id":"7c54f164-3993-4179-9b48-475a6b2ee650","resolution":{"observed_at":"2026-08-01T17:47:07.733004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21765","last_updated":"2025-03-27T17:58:33Z","snapshot_observed_at":"2026-08-16T12:46:11.670108Z","submitted_at":"2025-03-27T17:58:33Z","title":"Exploring the Evolution of Physics Cognition in Video Generation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21765","snapshot_observed_at":"2026-08-01T17:47:07.906970Z","title":"Exploring the evolution of physics cognition in video generation: A survey.arXiv preprint arXiv:2503.21765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:07.906970Z"},"links":{"cited_paper":"/paper/2503.21765","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:3cf61c3c0127b6e66ea746baaf6d3a8976f53c7b5219be186dee9c948d35d3a4","observation_id":"4e7da424-a68d-4c27-8ee9-6419c9091ffb","resolution":{"observed_at":"2026-08-01T17:47:07.906970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.045401Z","title":"Improved techniques for training gans.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.045401Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:c77df298b291c4a5e8fb0bec15c69cb1842760126208763c35f573eff6818487","observation_id":"2d7942be-06a5-4a8f-8624-74c3ee6f3621","resolution":{"observed_at":"2026-08-01T17:47:08.045401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.215955Z","title":"FVD: A new metric for video generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.215955Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:4a7aa79de9dbb46ed48f2ad66aa93bfada5b1e3ea1cc604d9f11deb09962f165","observation_id":"4384fc51-e1a3-477b-8302-9fe4f393075b","resolution":{"observed_at":"2026-08-01T17:47:08.215955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.494735Z","title":"On the content bias in fréchet video distance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.494735Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:f85a81309f367281caf09465e81ccba7bf23a88f69a7a64600840099feaae558","observation_id":"4bbd32dc-1b98-4c46-bbe5-53e1ca6f2694","resolution":{"observed_at":"2026-08-01T17:47:08.494735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06665","last_updated":"2024-04-29T23:21:33Z","snapshot_observed_at":"2026-08-19T05:17:20.406773Z","submitted_at":"2024-02-06T17:15:33Z","title":"The Essential Role of Causality in Foundation World Models for Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06665","snapshot_observed_at":"2026-08-01T17:47:08.632064Z","title":"The essential role of causality in foundation world models for embodied ai.arXiv preprint arXiv:2402.06665, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.632064Z"},"links":{"cited_paper":"/paper/2402.06665","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:159bb822ef9f4fac39f9252c67054fc5b1e75400bd8a5f4ba397d633ec1af92b","observation_id":"0993dd37-f5d0-4ae7-a738-2c0c41d2a414","resolution":{"observed_at":"2026-08-01T17:47:08.632064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.796963Z","title":"Diffusion art or digital forgery? investigating data replication in diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.796963Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:777118385aefe1f147111ca755162bb3a8e78b6ca2d6cfae8eb72cc5531161ea","observation_id":"f4d139b7-71ad-4e7d-a290-2d3d1a41e8fd","resolution":{"observed_at":"2026-08-01T17:47:08.796963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.955102Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.955102Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:214961381dc79fdbdd3291297fb75d0db8a71a1fd60c09cffd291458640d30a0","observation_id":"8d3fbe95-ac2c-4864-9de3-afdfa3d18455","resolution":{"observed_at":"2026-08-01T17:47:08.955102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:09.107864Z","title":"Do generative video models understand physical principles? InProceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 948–958, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.107864Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:eabe1cfb197a93f9f146b0069b8ae3235e7084b3c57c2b0dba5043aee86f8742","observation_id":"346eedb5-5d52-47ae-8da8-8821aa4496aa","resolution":{"observed_at":"2026-08-01T17:47:09.107864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03821","last_updated":"2026-05-05T14:49:00Z","snapshot_observed_at":"2026-08-14T13:26:14.864218Z","submitted_at":"2026-05-05T14:49:00Z","title":"RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03821","snapshot_observed_at":"2026-08-01T17:47:09.268892Z","title":"Roboalign-r1: Distilled multimodal reward alignment for robot video world models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.268892Z"},"links":{"cited_paper":"/paper/2605.03821","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:3bf115c93a471773a64eadea3796f8af1b30deed7c65eaea3094da1b178c4f76","observation_id":"681bab52-da7f-4f80-8208-920d355eba84","resolution":{"observed_at":"2026-08-01T17:47:09.268892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:09.423659Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.423659Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:80c0c77e30e48411567c560491f001e1cb1b74ecc39a43d3e2219a3357b36d2c","observation_id":"7cfdd990-47cb-419e-9141-1f8aba064fdb","resolution":{"observed_at":"2026-08-01T17:47:09.423659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:09.568545Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.568545Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:1c4358bee284a43757ef5ad332480ef2e7772c58d4ed238da5daaaabdb4f4282","observation_id":"b03da153-1e28-4dde-80d4-d80e60feac85","resolution":{"observed_at":"2026-08-01T17:47:09.568545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:09.717609Z","title":"Video generation models as world simulators.OpenAI Blog, 1(8):1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.717609Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:683cf0b0517f437ec4fc25db6a343ad404ca89f78ccce391ccfbcbb0f61b46e6","observation_id":"d16d4994-edc7-486f-8ca0-c70b18120e6d","resolution":{"observed_at":"2026-08-01T17:47:09.717609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:09.883305Z","title":"What about gravity in video generation? post-training newton’s laws with verifiable rewards.arXiv preprint arXiv:2512.00425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:09.883305Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:3427142a9684f3a8237650fb7f71daacea67f4451c3f84466eea358175696319","observation_id":"cfbbbf81-aae1-4bb4-8f0c-b48111c36c11","resolution":{"observed_at":"2026-08-01T17:47:09.883305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:10.028648Z","title":"T2v-compbench: A comprehensive benchmark for compositional text-to- video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.028648Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:dd4f180c294b4f7360f34c767b3cc6db70e787788560be6c57d4b4b0d3321376","observation_id":"f1606849-161b-4dde-92ac-bcd5521a617c","resolution":{"observed_at":"2026-08-01T17:47:10.028648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:10.192580Z","title":"Vibe: A text-to-video benchmark for evaluating hal- lucination in large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.192580Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:f4503f9155071e6905b3192905a75173c5c245412d94e314c63594633caba6ef","observation_id":"81b672e5-e006-454e-9c39-3baadfdbd46b","resolution":{"observed_at":"2026-08-01T17:47:10.192580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-08-18T07:04:58.690133Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-01T17:47:10.369130Z","title":"World models.arXiv preprint arXiv:1803.10122, 2(3), 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.369130Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:a79dfc13e7a68ef9565c03e960e5a48487dd6306c835c51b28fae6f312c32f44","observation_id":"6005acd2-3838-4655-b5b2-f94ef9c5749b","resolution":{"observed_at":"2026-08-01T17:47:10.369130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:10.488113Z","title":"A path towards autonomous machine intelligence version 0.9","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.488113Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:ac513a18336ea3dbd108204c3a82de37aa9ac4d893c63281b9426bfdecee345e","observation_id":"865b148a-0639-4b83-bed5-70275e86a37e","resolution":{"observed_at":"2026-08-01T17:47:10.488113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08003","last_updated":"2025-04-09T16:10:15Z","snapshot_observed_at":"2026-08-16T12:42:39.095400Z","submitted_at":"2025-04-09T16:10:15Z","title":"Have we unified image generation and understanding yet? An empirical study of GPT-4o's image generation ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08003","snapshot_observed_at":"2026-08-01T17:47:10.650083Z","title":"Have we unified image generation and understanding yet? an empirical study of gpt-4o’s image generation ability.arXiv preprint arXiv:2504.08003, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.650083Z"},"links":{"cited_paper":"/paper/2504.08003","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:69947ce53c61c54b57d766915b46b1b66610f0875a14ec5e9e4a5af6c3968991","observation_id":"1fe3a9cc-1e28-4c26-bd81-91db74b9caa6","resolution":{"observed_at":"2026-08-01T17:47:10.650083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:10.778104Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.778104Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:54cd3de86d96f9292b555e201190cbf477dbc7584f90ab0aa04ac8906d52a912","observation_id":"bdc30d75-403e-4271-bb63-5728bbb293b0","resolution":{"observed_at":"2026-08-01T17:47:10.778104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:10.959513Z","title":"The sound of water: Inferring physical properties from pouring liquids","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:10.959513Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:b887f78c74084a74656cde3744cdccb5ca344cc05854f145038fd71c2002d5a1","observation_id":"6d7ff8a3-ca4f-4be4-a1bd-f9fb1fdcd440","resolution":{"observed_at":"2026-08-01T17:47:10.959513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08261","last_updated":"2022-06-20T14:27:21Z","snapshot_observed_at":"2026-08-16T18:16:57.747861Z","submitted_at":"2021-06-15T16:13:39Z","title":"Physion: Evaluating Physical Prediction from Vision in Humans and Machines","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08261","snapshot_observed_at":"2026-08-01T17:47:11.071407Z","title":"Physion: Evaluating physical prediction from vision in humans and machines","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.071407Z"},"links":{"cited_paper":"/paper/2106.08261","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:5cfc71dd3f8e6b1ad466f5d8af86eed7b4891159c1cece3b64a9f0361ac70265","observation_id":"e1672087-e3a2-4a30-8032-89efe9002863","resolution":{"observed_at":"2026-08-01T17:47:11.071407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02508","last_updated":"2024-09-04T08:08:21Z","snapshot_observed_at":"2026-08-16T13:21:30.561060Z","submitted_at":"2024-09-04T08:08:21Z","title":"TLD: A Vehicle Tail Light signal Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02508","snapshot_observed_at":"2026-08-01T17:47:11.177637Z","title":"Tld: A vehicle tail light signal dataset and benchmark.arXiv preprint arXiv:2409.02508, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.177637Z"},"links":{"cited_paper":"/paper/2409.02508","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:979b5c1701d73d319138036a15356344b325a2f59f6baab702099e5ae705c2e2","observation_id":"56746adb-4ee7-424c-b99f-fe235f2ce35d","resolution":{"observed_at":"2026-08-01T17:47:11.177637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-01T17:47:11.299311Z","title":"The kinetics human action video dataset.arXiv preprint arXiv:1705.06950, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.299311Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:f98537799da9e3f513a67dacaa0785b29ff7d3c0c780e3f62f84e856cdc514f8","observation_id":"3119fe02-6076-421d-8623-8fb47675dd61","resolution":{"observed_at":"2026-08-01T17:47:11.299311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:11.456060Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.456060Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:647bcd832a8b46b33aa572b98347bfedea57cb7b1a8adb713b85c7ec1d52b28b","observation_id":"0f149436-6454-4854-ba04-5fbd4a2ec778","resolution":{"observed_at":"2026-08-01T17:47:11.456060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-01T17:47:11.624753Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.624753Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:2badb910072ab49b2e479cdb9caa7b79df13145c6beb275845031d453673b47a","observation_id":"0c291af9-b8e3-4bc6-b573-09e9e32aa427","resolution":{"observed_at":"2026-08-01T17:47:11.624753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:11.737381Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.737381Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:edad9d8fd6870be90280dd18426b0880250b559201e53490bf8f205b77b91038","observation_id":"7c66c50e-c190-47bc-94e1-ae62a2776045","resolution":{"observed_at":"2026-08-01T17:47:11.737381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T17:47:11.848598Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.848598Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:8f6051ae78a55eed70fc04d6ec261e32bbf38960791308b1020421e632386362","observation_id":"bb04f007-3916-4d36-9401-c8711314876a","resolution":{"observed_at":"2026-08-01T17:47:11.848598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-01T17:47:11.966954Z","title":"Openai gpt-5 system card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.966954Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:fda29290c07633a994143ae2b73e9e3537849353b2183e7698225f1d10825cf5","observation_id":"289c7a03-9513-4594-ae01-e88413b45fc5","resolution":{"observed_at":"2026-08-01T17:47:11.966954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.088675Z","title":"Scaling zero-shot reference-to-video generation.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.088675Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:10c301b478bd71f8c47a24f1d35197155011be5c936d63290303e3de1c8845bc","observation_id":"a6f56fdd-2510-4055-8df2-90eceae09a42","resolution":{"observed_at":"2026-08-01T17:47:12.088675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04678","snapshot_observed_at":"2026-08-01T17:47:12.237328Z","title":"Reward forcing: Efficient streaming video generation with rewarded distribution matching distillation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.237328Z"},"links":{"cited_paper":"/paper/2512.04678","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:610e8d556d059d967610cda9eaeb1218b797b4c6e1e70c84f652987ae9089cd0","observation_id":"4917b50f-6f35-4b29-a0d0-58d904216787","resolution":{"observed_at":"2026-08-01T17:47:12.237328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.350191Z","title":"Stable video infinity: Infinite-length video generation with error recycling.arXiv preprint arXiv:2510.09212, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.350191Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:f2fe0353553a931a5f5bc4efd1f18c7a306629b828707fd06222c19db13611b0","observation_id":"f2523d10-3c97-4cc1-bb65-31af0cb879ce","resolution":{"observed_at":"2026-08-01T17:47:12.350191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-08-18T20:19:46.462831Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-08-01T17:47:12.458101Z","title":"thinking with long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.458101Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:5ae631c4cb4eb131f3c9545595d0517a335d4a6438f895c9b73294a26f8ef62a","observation_id":"5f57e935-e817-4ec8-8ad7-79753866fcaa","resolution":{"observed_at":"2026-08-01T17:47:12.458101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.611214Z","title":"V-reasonbench: Toward unified reasoning benchmark suite for video generation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.611214Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:723d57c28bf6b8596c21c70774bfc044ed5e03b3fb839a105b516496652d5f78","observation_id":"349359b0-731f-4220-8f57-5b05ee3c02d4","resolution":{"observed_at":"2026-08-01T17:47:12.611214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.825883Z","title":"Vitcot: Video-text interleaved chain-of-thought for boosting video understanding in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.825883Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:c5689891007fc9248cf0d10d6189b5d8797e22b346e6e8a2fe832ca509267cd7","observation_id":"27ab5293-97ed-488f-9cb7-7bcc0a468d3a","resolution":{"observed_at":"2026-08-01T17:47:12.825883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.956508Z","title":"Ruler-bench: Probing rule-based reasoning abilities of next-level video generation models for vision foundation intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.956508Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:3f20528357c7e10cb9e3b89b1685b45d88ac22b1b1bf102466c68c7f2de9f7e2","observation_id":"2fc1c363-0dc2-4bfa-a372-cdecc44e767f","resolution":{"observed_at":"2026-08-01T17:47:12.956508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.071487Z","title":"Can world simulators reason? gen-vire: A generative visual reasoning benchmark,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.071487Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:7687a110212620f1c1cf96be9848e8c6c351221c1db394553b522d9d5544d25a","observation_id":"542dec33-ec6a-4828-b0a5-1c969dd8ed89","resolution":{"observed_at":"2026-08-01T17:47:13.071487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.292641Z","title":"CCHall: A novel benchmark for joint cross-lingual and cross- modal hallucinations detection in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.292641Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:37d71e7cd634545b5fc7daccddd3287befe59b9f9f697be2919579181b3d5356","observation_id":"8d8fd854-c9e1-49ed-a6c3-6e3595abf3dc","resolution":{"observed_at":"2026-08-01T17:47:13.292641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.421131Z","title":"Large language models meet nlp: A survey.Frontiers of Computer Science, 20(11):2011361, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.421131Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:fdbf0a5111f20597bfeca95dd06d1dc02bc67872663f4dbe0cd574d45b006163","observation_id":"6d0f5da2-5c50-4887-a9a1-c7fd7163c42a","resolution":{"observed_at":"2026-08-01T17:47:13.421131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.478604Z","title":"Are video models ready as zero-shot reasoners? an empirical study with the mme-cof benchmark.arXiv preprint arXiv:2510.26802, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.478604Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:205a9a6562d2515cb5f4fc355917f19f8bf7a9c0c572ee7a39f0fa82f285a134","observation_id":"dcc1aacd-a901-45d8-a871-ea3b0a1777c7","resolution":{"observed_at":"2026-08-01T17:47:13.478604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.365314Z","title":"ISBN 979-8-89176-251-0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.365314Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:e23f22924d3a983fa97b1938b25cd2224d91ca764b6e26164f316f3eb4f923ae","observation_id":"ba003690-3d5e-4339-81a0-d116a936937c","resolution":{"observed_at":"2026-08-01T17:47:13.365314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02607","last_updated":"2026-07-01T13:51:02Z","snapshot_observed_at":"2026-08-13T03:38:38.036410Z","submitted_at":"2026-07-01T13:51:02Z","title":"Latent Visual Cache for Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02607","snapshot_observed_at":"2026-08-01T17:47:13.597841Z","title":"Latent visual cache for video reasoning.arXiv preprint arXiv:2607.02607, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.597841Z"},"links":{"cited_paper":"/paper/2607.02607","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:934baf5c2947dd09da3e2f28b055678801359d260a74b3cb549a0ec17b9667bf","observation_id":"30cf12d7-beed-4d12-9caa-a1ba8ba98eb2","resolution":{"observed_at":"2026-08-01T17:47:13.597841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.651779Z","title":"Mmgr: Multi-modal generative reasoning.arXiv preprint arXiv:2512.14691, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.651779Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:29522a7dfea46bcd6999b99cc136172e702b4ced576d2a381c6f81a72005f05d","observation_id":"e985d63c-cca1-4f9b-9f41-16b1dcd9e458","resolution":{"observed_at":"2026-08-01T17:47:13.651779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.540223Z","title":"Video models start to solve chess, maze, sudoku, mental rotation, and raven’matrices.arXiv preprint arXiv:2512.05969, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.540223Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:2d91b0fe664c2a3136a6431b73e3bd977db72393e5ba1ac5b78933e6b76e5179","observation_id":"38e2166c-e519-4414-a023-a8ccac217909","resolution":{"observed_at":"2026-08-01T17:47:13.540223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.750039Z","title":"Beyond the last frame: Process-aware evaluation for generative video reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.750039Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:89aec65a55ee9910843315b69b2ebb47ba96b7c9dd2bb1ceff0a564795638518","observation_id":"307fd135-8114-41b9-a092-782e9b338d94","resolution":{"observed_at":"2026-08-01T17:47:13.750039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:08.331772Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:08.331772Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:264b94ad61fbc1eea3494c33f6c884264acd228c34ec5822bf0cbca93c9778ec","observation_id":"605f4c84-aa7a-48b6-9c5d-73b0fd3f4a94","resolution":{"observed_at":"2026-08-01T17:47:08.331772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.188710Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.188710Z"},"links":{"citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:e2faf5644e088aa113abcb360cd797aa037f71f324a4795bd192ad4c4077c25c","observation_id":"179ec37e-e83d-4301-9e90-1933f2fb7440","resolution":{"observed_at":"2026-08-01T17:47:13.188710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T19:02:36.994111Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2607.17523."}