{"as_of":"2026-08-10T11:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:36acfff86b29a6cdb287365001ea1f044f22c0713ffca7f4945a75ae931689ca","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:08:33.957835Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":52,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T05:06:51.699806Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-06T19:42:27.116832Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2507.05169","last_updated":"2026-06-17T19:20:50Z","snapshot_observed_at":"2026-08-08T07:42:25.836184Z","submitted_at":"2025-07-07T16:23:46Z","title":"Critique of World Model","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:42:27.116832Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2507.05169"},"observation_digest":"sha256:1ca0c844f4afcdd28683a16799ae141d31983baecc6787f86a8bc64228044ed2","observation_id":"b840df6a-923a-4426-b29f-9a4cd8b76843","resolution":{"observed_at":"2026-08-06T19:42:27.116832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.10299","last_updated":"2026-06-09T01:34:18Z","snapshot_observed_at":"2026-08-08T12:59:37.851529Z","submitted_at":"2026-06-09T01:34:18Z","title":"What Spatial Memory Must Store: Occlusion as the Test for Language-Agent Memory","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T13:46:29.718269Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.10299"},"observation_digest":"sha256:e41cf6e8dad8bb6f2fdaf0569f2b845bf35a7e49cea9c576e3e7390f612e9c78","observation_id":"29cba8cc-5629-4e9f-953f-62913f2fb8f9","resolution":{"observed_at":"2026-07-03T04:37:37.213686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.17730","last_updated":"2026-06-16T09:47:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-16T09:47:32Z","title":"ActWorld: From Explorable to Interactive World Model via Action-Aware Memory","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T01:22:12.771098Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.17730"},"observation_digest":"sha256:bbd7176d637c933bb4b4ddc5000f0379fe6c4a40c822df2840181df188ca31e2","observation_id":"91adc934-0bf2-40d7-944c-8c6ddbb0fb3a","resolution":{"observed_at":"2026-07-03T20:28:55.397948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.18375","last_updated":"2026-06-23T16:50:09Z","snapshot_observed_at":"2026-08-02T07:17:06.028384Z","submitted_at":"2026-06-16T18:23:23Z","title":"PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T00:19:33.170645Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.18375"},"observation_digest":"sha256:20f2670e3ec98f6d29893643a489006a6330468c2cab1839de6819ef4874e760","observation_id":"6ca8f406-2a4b-422f-9777-76ce08f88f85","resolution":{"observed_at":"2026-07-03T21:38:58.754179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.18610","last_updated":"2026-06-26T17:59:04Z","snapshot_observed_at":"2026-08-08T09:10:50.377259Z","submitted_at":"2026-06-17T02:15:46Z","title":"SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T21:18:07.494794Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.18610"},"observation_digest":"sha256:4688e83a0dd99a2ddac4b9d39029452f4a676577f9c3a718b4a3ef495ac49fcf","observation_id":"fa8e1f51-2122-4199-8976-eac1433f015c","resolution":{"observed_at":"2026-07-04T00:19:13.362817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.18610","last_updated":"2026-06-26T17:59:04Z","snapshot_observed_at":"2026-08-08T09:10:50.377259Z","submitted_at":"2026-06-17T02:15:46Z","title":"SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:30.594399Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.18610"},"observation_digest":"sha256:b40d478fe5ba92511c36b740b32d53ac217b536f9f854ccac6c808d2874f1f46","observation_id":"b6c19015-8863-419a-a00d-ae261b110023","resolution":{"observed_at":"2026-06-29T18:23:51.389791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.18943","last_updated":"2026-06-17T11:23:52Z","snapshot_observed_at":"2026-08-01T03:49:23.750491Z","submitted_at":"2026-06-17T11:23:52Z","title":"Physics-IQ Verified","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T21:13:36.568700Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.18943"},"observation_digest":"sha256:c21c4e31a4090c889ea2d22e6c5ecdf2f13420dbb14f4bb1f288c19e0682a11d","observation_id":"4a382069-ca46-4061-8322-4b9cea202198","resolution":{"observed_at":"2026-07-04T00:29:15.556417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:0a27fa7ee596ef3c83ce2858b4e9b467dc3793a649183486d62652c05e84d7a6","observation_id":"891ebd45-3d91-4e59-b077-7546724672b3","resolution":{"observed_at":"2026-07-04T00:39:17.503977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.23743","last_updated":"2026-06-24T14:59:15Z","snapshot_observed_at":"2026-07-06T23:58:25.400508Z","submitted_at":"2026-06-21T17:23:20Z","title":"Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T11:05:44.972128Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.23743"},"observation_digest":"sha256:a0c78d992db7b0b20d814495876ea25690b9b33437bcb5e6c1c1a465236e71e7","observation_id":"dc43e339-80bc-457f-acb7-8a04d4428f56","resolution":{"observed_at":"2026-07-04T08:49:41.558859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.23991","last_updated":"2026-06-22T22:50:02Z","snapshot_observed_at":"2026-07-06T23:58:40.070269Z","submitted_at":"2026-06-22T22:50:02Z","title":"Critique of Agent Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T07:57:20.830605Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.23991"},"observation_digest":"sha256:ce9125899adc2af6f371d0ac0ebd78183a1e877649473146183c2480ef62345a","observation_id":"4fb51621-8fce-4a31-9f5a-9e337858f7a3","resolution":{"observed_at":"2026-07-04T11:29:51.076095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.24888","last_updated":"2026-06-23T17:59:55Z","snapshot_observed_at":"2026-08-08T16:38:03.178919Z","submitted_at":"2026-06-23T17:59:55Z","title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","version":1},"reference_index":212,"source":"arxiv_source","source_observed_at":"2026-06-26T00:06:11.951205Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.24888"},"observation_digest":"sha256:5dd6ff866ad5996a4d47118df0b3bc156a80e17274495478e67b9636adaf5023","observation_id":"2d8ece93-2c98-486b-b0a7-44a037d7cca0","resolution":{"observed_at":"2026-07-04T16:59:58.195744Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.25473","last_updated":"2026-06-24T06:58:02Z","snapshot_observed_at":"2026-08-05T22:45:50.916812Z","submitted_at":"2026-06-24T06:58:02Z","title":"Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-25T20:57:30.765802Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.25473"},"observation_digest":"sha256:7b534b8b10435312a694312c7ad30361b127a43a23d7404d9efec984e7f5982c","observation_id":"65459639-2a72-4e6e-b9b7-6ba7fbd8258e","resolution":{"observed_at":"2026-07-04T19:50:11.445672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.26095","last_updated":"2026-06-24T17:59:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-24T17:59:56Z","title":"Learning Action Priors for Cross-embodiment Robot Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T19:09:56.409766Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.26095"},"observation_digest":"sha256:cf43f8c4c0d7fdef6f2f86c77c5609e946f576c8d2010fee8fbbd98a855b122c","observation_id":"e1402191-1b5d-44fd-97dc-807539f2af53","resolution":{"observed_at":"2026-07-04T21:00:09.820221Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.28128","last_updated":"2026-06-26T14:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-26T14:30:18Z","title":"PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T04:34:38.286863Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.28128"},"observation_digest":"sha256:05a7b64604580bd2b4b88eaa2fc1fffb959967baa9aed1c1d4d19435ca7535e6","observation_id":"0707065f-fc4d-47f5-9996-73e35bf64de4","resolution":{"observed_at":"2026-06-29T20:03:56.948658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.28385","last_updated":"2026-06-22T06:45:09Z","snapshot_observed_at":"2026-08-06T16:34:35.638612Z","submitted_at":"2026-06-22T06:45:09Z","title":"RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T10:49:58.019238Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.28385"},"observation_digest":"sha256:45ba5fb230675a2e9b9c2928117724f76ad167c4b053a39859b0e0aab8d0123f","observation_id":"42699cb3-ed34-4566-a74e-45d7db3f8368","resolution":{"observed_at":"2026-06-30T10:54:35.850307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.29013","last_updated":"2026-06-27T17:18:07Z","snapshot_observed_at":"2026-07-07T00:03:02.476882Z","submitted_at":"2026-06-27T17:18:07Z","title":"Mural: Transferring LLM knowledge to image generation via Mixture-of-Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T09:23:59.752793Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.29013"},"observation_digest":"sha256:ed6d585dc1c8e6d9edef5f0a3ceb4766cb6e87c0f4ff9398898fe52f1eba34bd","observation_id":"8df2960d-1060-4c18-84e1-97ccce87eeca","resolution":{"observed_at":"2026-06-30T09:24:32.131834Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.31946","last_updated":"2026-07-14T06:00:42Z","snapshot_observed_at":"2026-08-06T01:48:36.332753Z","submitted_at":"2026-06-30T16:52:53Z","title":"World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T05:31:43.678762Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.31946"},"observation_digest":"sha256:99fe6e5cf6e34bd7f1ca1a1d9962d1ceba25f6e34aab1f5025e1cb69e937a1a9","observation_id":"8df1cee3-7063-430e-9ec5-4fda6ccc8145","resolution":{"observed_at":"2026-07-01T10:25:41.706604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-07-15T10:20:59.147440Z","title":"Cosmos 3: Omnimodal world models for physical AI,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.31946","last_updated":"2026-07-14T06:00:42Z","snapshot_observed_at":"2026-08-06T01:48:36.332753Z","submitted_at":"2026-06-30T16:52:53Z","title":"World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-15T10:20:59.147440Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.31946"},"observation_digest":"sha256:c7cde7c11a2b9134ba712baaf4a11806c715fd0ce736309e27412ebf0b6f6561","observation_id":"5aae7d9a-c867-495b-95f1-9df375d77f2f","resolution":{"observed_at":"2026-07-15T10:20:59.147440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2607.01088","last_updated":"2026-07-01T15:45:08Z","snapshot_observed_at":"2026-08-02T11:41:51.446909Z","submitted_at":"2026-07-01T15:45:08Z","title":"ROSA: A Robotics Foundation Model Serving System for Robot Factories","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-02T11:11:39.584755Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.01088"},"observation_digest":"sha256:2c7ca5765bf325123c03505b3e1acef4f46c85339ca45e9802ab229dbdd759e3","observation_id":"595f0b64-ad7b-46dc-a55b-0de06bfff587","resolution":{"observed_at":"2026-07-02T11:16:52.666121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-07-12T09:10:40.344868Z","title":"arXiv:2606.02800 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02604","last_updated":"2026-07-01T13:16:44Z","snapshot_observed_at":"2026-08-04T14:27:57.604048Z","submitted_at":"2026-07-01T13:16:44Z","title":"DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:40.344868Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.02604"},"observation_digest":"sha256:73162d506f0a065c9aa54c7c3474dc523b26ff03a826fb54ebbb9e0246fb86e0","observation_id":"6e6bf47c-766d-4292-bb0c-2aeecf7e3122","resolution":{"observed_at":"2026-07-12T09:10:40.344868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-07-12T08:04:48.963890Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02642","last_updated":"2026-07-02T17:02:43Z","snapshot_observed_at":"2026-08-03T12:39:47.539491Z","submitted_at":"2026-07-02T17:02:43Z","title":"GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T08:04:48.963890Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.02642"},"observation_digest":"sha256:ac7e359de1acc11782483c106e09b6f4938a9aa188dadf5a49f418a426591f77","observation_id":"e815add8-2379-4d1f-97f4-1b2bbe946ad3","resolution":{"observed_at":"2026-07-12T08:04:48.963890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Cosmos 3: Omnimodal world models for physical ai","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:2754d38d3d9aa08e9ea6dcfe5c56a72c02005000ada86f7afcd81164fd55209e","observation_id":"2e3ebbcd-57e3-4dbe-8636-e49b96634871","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2607.06401","last_updated":"2026-07-07T15:31:32Z","snapshot_observed_at":"2026-08-03T02:43:03.919769Z","submitted_at":"2026-07-07T15:31:32Z","title":"A Definition and Roadmap for World Models","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-07-08T07:10:33.826140Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.06401"},"observation_digest":"sha256:2d006295c1202f9308797bdce0e3a86b7db32466304eafa1b8af5bc7a136902f","observation_id":"340b9926-bd9a-4491-b57a-94fc9fb807a6","resolution":{"observed_at":"2026-07-08T07:14:44.336323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2607.06403","last_updated":"2026-07-07T15:33:12Z","snapshot_observed_at":"2026-08-06T21:08:13.002956Z","submitted_at":"2026-07-07T15:33:12Z","title":"From Foundation to Application: Improving VLA Models in Practice","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T07:06:13.473493Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.06403"},"observation_digest":"sha256:4dbd9cdd8231c83e5c6293a27abe978a9b97a714db78ab26e54a0bbc746b9859","observation_id":"5cfc9951-4d25-4d42-a0ba-7eb2e0803ad2","resolution":{"observed_at":"2026-07-08T07:14:45.485926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-07-13T06:48:14.554799Z","title":"Agarwal, A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.06988","last_updated":"2026-07-10T02:22:52Z","snapshot_observed_at":"2026-08-07T16:54:08.238920Z","submitted_at":"2026-07-08T04:23:22Z","title":"WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T06:48:14.554799Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.06988"},"observation_digest":"sha256:4e3b6c9478328beccba5202705cbd832cd292347dcd354dcdd2a529ea52ca446","observation_id":"fea50311-ff49-4e5f-9c6d-776b88c0059e","resolution":{"observed_at":"2026-07-13T06:48:14.554799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2607.07534","last_updated":"2026-07-08T15:33:25Z","snapshot_observed_at":"2026-08-09T17:35:23.965336Z","submitted_at":"2026-07-08T15:33:25Z","title":"Infinite Worlds with Versatile Interactions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T07:51:36.802801Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.07534"},"observation_digest":"sha256:de7bb12713b2afe462d5c0db0e1395a81c404ad2969208641ffa481dd05bba84","observation_id":"d70e5411-8c99-4851-8678-3fdf7bf4fa3f","resolution":{"observed_at":"2026-07-09T07:56:04.717628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-10T07:57:28.813921Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:2edb5b938bd0e223a1e91cbd3fbe193a287aa30b95ce4f13592db6ec3011e394","observation_id":"ad2ace2e-2a21-4fd2-b5d8-120e307a1492","resolution":{"observed_at":"2026-07-09T03:05:55.157813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-03T10:58:25.857415Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:82b81259998b73f065d20edd6c3b1a218a45e0291a58b08775eda82e3e7690e4","observation_id":"25d1cb50-f7ab-4983-8cba-96e8942e7e39","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-02T03:16:51.556914Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13960","last_updated":"2026-07-17T13:39:37Z","snapshot_observed_at":"2026-08-03T18:30:12.569959Z","submitted_at":"2026-07-15T15:46:42Z","title":"GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:51.556914Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.13960"},"observation_digest":"sha256:01a89a8e04557f536ec63b646934140fdb563d9d83c7d8a23d742633c64fa6d1","observation_id":"1d25b611-2925-4a85-b2b2-b76883d1024e","resolution":{"observed_at":"2026-08-02T03:16:51.556914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-02T03:16:52.065229Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.065229Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:9dc69ee7e20d849629bf0258ec43cef30d86b31dca3d948ad5c359e545c75a8c","observation_id":"1483f19f-b5a1-418b-8d45-1f748282ee72","resolution":{"observed_at":"2026-08-02T03:16:52.065229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-02T00:03:59.225496Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-08T14:49:11.837999Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.225496Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:9c640c8e21f69ff0c2a90a1c997941c39ff5e611c0eb8b700fb578c27d37c0f5","observation_id":"605d0126-85e7-43ba-99c7-d5c89b8e032a","resolution":{"observed_at":"2026-08-02T00:03:59.225496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-01T16:32:50.585508Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17977","last_updated":"2026-07-31T13:34:17Z","snapshot_observed_at":"2026-08-06T12:49:54.995384Z","submitted_at":"2026-07-20T14:13:27Z","title":"RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T16:32:50.585508Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.17977"},"observation_digest":"sha256:608aae877a09668248d1b15fc35cc9879d20a1c88e67fd89747fd4a93c06510a","observation_id":"e68063ac-04dc-4b5f-9631-cedf5a97779f","resolution":{"observed_at":"2026-08-01T16:32:50.585508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-03T01:57:32.117952Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17977","last_updated":"2026-07-31T13:34:17Z","snapshot_observed_at":"2026-08-06T12:49:54.995384Z","submitted_at":"2026-07-20T14:13:27Z","title":"RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T01:57:32.117952Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.17977"},"observation_digest":"sha256:03d9b2b967b39bbeff105f38199e2da047e0dfe086ce824bf7e9e0097880a7a9","observation_id":"4271b470-c198-47e8-85e7-0c3390a4ece4","resolution":{"observed_at":"2026-08-03T01:57:32.117952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-01T07:09:04.165440Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-08T06:21:14.732992Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:04.165440Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:4a1ba58df90f59c372c074e286f64d04513b68bb2a0af9b121efbdf6d87577a7","observation_id":"1b1e1ac5-9340-47c9-9240-c51e842ff138","resolution":{"observed_at":"2026-08-01T07:09:04.165440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-07-31T06:18:55.948646Z","title":"Cosmos 3: omnimodal world models for physical AI.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-07-27T17:59:58Z","snapshot_observed_at":"2026-08-06T17:57:37.442251Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation","version":1},"reference_index":269,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.948646Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:4ce56547562c12a6941109b56db74f1732ea40013bfad23c3b731be3d36a5bdf","observation_id":"0b6f689c-cfce-48c6-a633-3a01b8441ea5","resolution":{"observed_at":"2026-07-31T06:18:55.948646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-01T02:13:12.652594Z","title":"Cosmos 3: Omnimodal world models for physical AI.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-08T23:11:18.983142Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.652594Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:66041e6187b590a761dc5167fae9dd809c896f1b93fb9b34b41f79006b4afd6f","observation_id":"88035d6b-db89-4b45-b581-abb7c189b321","resolution":{"observed_at":"2026-08-01T02:13:12.652594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-01T00:57:41.124597Z","title":"Cosmos 3: Omnimodal world models for physical ai, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26004","last_updated":"2026-07-28T17:20:00Z","snapshot_observed_at":"2026-08-06T23:03:28.359761Z","submitted_at":"2026-07-28T17:20:00Z","title":"Parallel Decoding Distillation for Fast Image and Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T00:57:41.124597Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.26004"},"observation_digest":"sha256:0bf732ac2a8c770a13456ad986f25261a1299cf2e4d45d0e1454a14f6bf739a0","observation_id":"21c106ba-8c33-44da-9b27-8b625c2c64fa","resolution":{"observed_at":"2026-08-01T00:57:41.124597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-01T11:27:05.644975Z","title":"Cosmos 3: Omnimodal world models for physical AI.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26657","last_updated":"2026-08-06T05:25:07Z","snapshot_observed_at":"2026-08-09T23:09:59.294226Z","submitted_at":"2026-07-29T09:17:33Z","title":"Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:27:05.644975Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.26657"},"observation_digest":"sha256:9535bfea1ed463ae7ff13af9039dc12a0bf8fcc4e6c8dc8c8a4d665022af016c","observation_id":"43e8959f-649f-43b1-9511-c109584963c0","resolution":{"observed_at":"2026-08-01T11:27:05.644975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-04T03:23:43.951163Z","title":"Cosmos 3: Omnimodal world models for physical AI.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26657","last_updated":"2026-08-06T05:25:07Z","snapshot_observed_at":"2026-08-09T23:09:59.294226Z","submitted_at":"2026-07-29T09:17:33Z","title":"Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T03:23:43.951163Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.26657"},"observation_digest":"sha256:519c999733ac9178d85715031cef2b2a65934a58ff72094df9647c1e8573afa6","observation_id":"a1cce6e4-7e97-4b7a-bcde-1d513273eb59","resolution":{"observed_at":"2026-08-04T03:23:43.951163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-07-31T14:03:34.637523Z","title":"Cosmos 3: Omnimodal world models for physical ai,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28226","last_updated":"2026-07-30T13:58:33Z","snapshot_observed_at":"2026-08-09T22:34:05.584118Z","submitted_at":"2026-07-30T13:58:33Z","title":"Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T14:03:34.637523Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.28226"},"observation_digest":"sha256:7ca2998b260b5959517c4c8970414e805f45b6b7b34a9015f2ecb1be7c56ee9f","observation_id":"7a7ef47b-6603-49b2-a56f-8cfc0b606d6f","resolution":{"observed_at":"2026-07-31T14:03:34.637523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-07-31T01:50:30.578485Z","title":"Cosmos 3: Omnimodal world models for physical ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28624","last_updated":"2026-07-30T17:59:46Z","snapshot_observed_at":"2026-08-06T18:18:01.456837Z","submitted_at":"2026-07-30T17:59:46Z","title":"PhiZero: A World Model Built Around Physical Language","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T01:50:30.578485Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.28624"},"observation_digest":"sha256:7db6f380c111706921f2c212e1a9d79628eff9475e8ce67aac152180a99add3b","observation_id":"dcd5bcfc-b7d5-4d95-863a-b365b362a3c1","resolution":{"observed_at":"2026-07-31T01:50:30.578485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-03T04:58:51.666200Z","title":"Cosmos 3: Omnimodal world models for physical ai,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29545","last_updated":"2026-07-31T15:38:56Z","snapshot_observed_at":"2026-08-08T15:30:03.649905Z","submitted_at":"2026-07-31T15:38:56Z","title":"MoRoute: Dynamic Routing for In-Context Multimodal Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T04:58:51.666200Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.29545"},"observation_digest":"sha256:c9a97f4bc138a5967b0772aaf5e5ed6ac719fc4dddfc4877863fdb5731ef8359","observation_id":"0e74a7d6-7e9c-4f72-aa44-f800f65e07b4","resolution":{"observed_at":"2026-08-03T04:58:51.666200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T00:46:23.328864Z","title":"arXiv preprint arXiv:2606.02800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00559","last_updated":"2026-08-01T09:42:45Z","snapshot_observed_at":"2026-08-08T15:42:31.128764Z","submitted_at":"2026-08-01T09:42:45Z","title":"Test-Time Curriculum for Open-Set AIGC Detection","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T00:46:23.328864Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.00559"},"observation_digest":"sha256:c7c1eb506cffe4375b7aeae94e0c1496eabcab440eb02ff4aed93677a29297e5","observation_id":"e1f898e5-30c6-47cd-9228-20be453563e1","resolution":{"observed_at":"2026-08-05T00:46:23.328864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T14:52:35.403325Z","title":"arXiv preprint arXiv:2606.02800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-05T05:24:32Z","snapshot_observed_at":"2026-08-08T23:10:49.792907Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T14:52:35.403325Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:e2146cb9af261a77af9f7c3af73ab4216bccf429e5f8c8010cb7cd4c13bb352d","observation_id":"77f3dfff-8583-4639-8069-a4090c0be9b1","resolution":{"observed_at":"2026-08-05T14:52:35.403325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-06T11:55:28.091892Z","title":"Cosmos 3: Omnimodal world models for physical ai, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.091892Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:e94c9c6383a71a8845a07600311aa58fb0ea1a773654e8b04ce98814e1b55fe6","observation_id":"5f3d1e73-e7c2-49a9-ae03-56bc78ba8200","resolution":{"observed_at":"2026-08-06T11:55:28.091892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-08T17:08:55.960160Z","title":"Cosmos 3: Omnimodal world models for physical ai, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:55.960160Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:aede41204ecd07a85dee90bc9976432866eadaacf0b41959269b628adec708b6","observation_id":"069a6161-a3b9-4834-8189-1a38a73cddac","resolution":{"observed_at":"2026-08-08T17:08:55.960160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-06T06:07:34.380165Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05070","last_updated":"2026-08-05T17:14:19Z","snapshot_observed_at":"2026-08-09T15:54:55.505623Z","submitted_at":"2026-08-05T17:14:19Z","title":"HelloWorld: Enabling Socially Interactive Characters in Video World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T06:07:34.380165Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.05070"},"observation_digest":"sha256:86f8f0f7baffbb5e0c3f16a7cafd9cec19648628a1537f071963785d323ae5c8","observation_id":"49e6124c-77a7-49d7-acd3-efdae777dd89","resolution":{"observed_at":"2026-08-06T06:07:34.380165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-08T05:52:17.210476Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05597","last_updated":"2026-08-06T04:43:53Z","snapshot_observed_at":"2026-08-09T23:11:09.928683Z","submitted_at":"2026-08-06T04:43:53Z","title":"Uncertainty-Aware World Model for Aerial Image-Goal Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T05:52:17.210476Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.05597"},"observation_digest":"sha256:914a2ff0c3f9579508e505c28fcc70e27c6a215c121f9165e8609167cd0a8cdc","observation_id":"d356f5bb-d61f-47db-95dc-b5ccc07656b0","resolution":{"observed_at":"2026-08-08T05:52:17.210476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-07T23:21:53.436914Z","title":"arXiv preprint arXiv:2606.02800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05799","last_updated":"2026-08-06T09:35:33Z","snapshot_observed_at":"2026-08-09T23:11:34.801815Z","submitted_at":"2026-08-06T09:35:33Z","title":"XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T23:21:53.436914Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.05799"},"observation_digest":"sha256:edfea7b2d33b82a4f63db6d0b0c500d0bf0224ce10388f5ea2b7a7e2b2d8e4d4","observation_id":"27895903-1322-4270-a88c-ac4e21329396","resolution":{"observed_at":"2026-08-07T23:21:53.436914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-07T20:36:25.642450Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05948","last_updated":"2026-08-06T12:19:38Z","snapshot_observed_at":"2026-08-09T23:12:35.041362Z","submitted_at":"2026-08-06T12:19:38Z","title":"GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T20:36:25.642450Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.05948"},"observation_digest":"sha256:a9aa1128859ab9e0d5581107ef3afd7145246b1dc52940b85d4dd6e55f2e5013","observation_id":"7638aba4-46c1-4a6a-95f2-3390386f3d08","resolution":{"observed_at":"2026-08-07T20:36:25.642450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-07T19:27:25.020729Z","title":"Cosmos 3: Omnimodal world models for physical ai,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06013","last_updated":"2026-08-06T13:18:24Z","snapshot_observed_at":"2026-08-10T01:08:03.605187Z","submitted_at":"2026-08-06T13:18:24Z","title":"OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T19:27:25.020729Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.06013"},"observation_digest":"sha256:7dfc74af82e560901662120f9bda55091e5495baa8c8bf9d43cdf039a363fe08","observation_id":"f93d8bf6-d09e-438f-9968-603c8bb60f13","resolution":{"observed_at":"2026-08-07T19:27:25.020729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-10T05:06:51.699806Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T11:12:44.455101Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.699806Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:2cc9fdb5400aeb1d093ca18df69cde3d691e8bcc95578c115a2f0352690c362f","observation_id":"91dddf21-8cd7-473a-a03a-66e3ae65cbcf","resolution":{"observed_at":"2026-08-10T05:06:51.699806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.02800/citation-record","integrity":"/paper/2606.02800/integrity","json":"/paper/2606.02800/citation-record.json","paper":"/paper/2606.02800"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:50f6e2e0bc754341d4ac0a67a2f88e6ca8b01b2b86a8808e60e6abde6b33c838","observation_id":"90ab2315-cd92-4d4c-b723-4373ad1efe21","resolution":{"observed_at":"2026-07-01T22:46:18.409103Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.02456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T11:29:50.781481Z","title":"Internvla-a1: Unifying understanding, generation and action for robotic manipulation","venue":null,"work_id":"b503bc61-19a8-4a18-99bc-5b86ac149193","year":2026},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:940da35c48716ec69b75ef6394aaf91ac93db61d28228753b9adef1705d41171","observation_id":"92d4c903-e3f6-41ab-b4b9-d406b0253b4e","resolution":{"observed_at":"2026-07-01T22:46:18.364550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:e28e2fc21f5fc65776b6a51564c11145632c5e547545394a498a753ed1257704","observation_id":"e3df3b5b-4aa8-4deb-9ede-690dc6f95bab","resolution":{"observed_at":"2026-07-01T22:46:18.382387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:08:33.957835Z","title":"Out of time: Automated lip sync in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:b40ea2895bae78d2f54a3dc1467de25abe34a75975a91c0f43acea39cb79bb0d","observation_id":"7fc89fb4-9072-4458-b829-3c7d59a981c5","resolution":{"observed_at":"2026-06-28T15:08:33.957835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2409.11402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-07-02T02:56:29.429018Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","venue":null,"work_id":"05897a70-23cd-425f-b903-02c1293c04a0","year":2024},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:57263f7515eb8cb80d4ff35c9fea0e73dc399620c8246ec258c0455c9023d3e4","observation_id":"82577fa1-45ae-4aa8-ba34-435ca39c7be7","resolution":{"observed_at":"2026-07-01T22:46:18.387412Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:61e524c9ab2c9f59aea2c07018b9a691eabfbb0b91abc4881799ba4966667f68","observation_id":"b7c293f8-d6ef-4633-9cef-b54d65c05d07","resolution":{"observed_at":"2026-07-01T22:46:18.392456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:08:33.957835Z","title":"VLMEvalKit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:9c89fd8a63dd74494e3a19e36a62e0fe19f5014f17bc53c7be6ddd81a5e685d4","observation_id":"26399458-3208-4e5f-ad80-20b554940130","resolution":{"observed_at":"2026-06-28T15:08:33.957835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09943","last_updated":"2025-06-11T17:10:36Z","snapshot_observed_at":"2026-08-08T16:25:33.048853Z","submitted_at":"2025-06-11T17:10:36Z","title":"CausalVQA: A Physically Grounded Causal Reasoning Benchmark for Video Models","version":1},"cited_work":{"arxiv_id":"2506.09943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09943","snapshot_observed_at":"2026-07-04T12:49:53.095154Z","title":"Causalvqa: A physically grounded causal reasoning benchmark for video models","venue":null,"work_id":"4545b7fc-2bcc-44f3-a395-c6684aede4c7","year":2025},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2506.09943","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:4f8623a75560dbc17a2240df487dbfc0a2ded2bc23cac3e6420a41ac4507b8a5","observation_id":"a1e8a19a-7040-462b-b9c1-5a55972fb968","resolution":{"observed_at":"2026-07-01T22:36:18.020144Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2404.02101","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-07-10T01:46:41.167891Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","venue":"cs.CV","work_id":"1c05c278-c023-4ef0-a359-25a41f1065eb","year":2024},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:40ecb00893bf62d76d6432f0bb43c786e2bb262e61a9d1562aceb9f234d91445","observation_id":"b47562f0-b06b-412d-a181-48b19ee21455","resolution":{"observed_at":"2026-07-01T22:36:18.034862Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:e37642f45a2acb5964172c848ecc109b96530db25ca4122c8d80a91f2483bc4e","observation_id":"3131c469-4361-4749-a281-04a1258d019f","resolution":{"observed_at":"2026-07-01T22:46:18.358146Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.09153","last_updated":"2026-05-30T15:43:04Z","snapshot_observed_at":"2026-08-06T08:23:01.498989Z","submitted_at":"2026-02-09T19:56:04Z","title":"SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes","version":2},"cited_work":{"arxiv_id":"2602.09153","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.09153","snapshot_observed_at":"2026-07-03T20:58:58.161042Z","title":"arXiv preprint arXiv:2602.09153 , year=","venue":"cs.RO","work_id":"fd9984dd-8d99-4683-a4c0-6a8450167c27","year":2026},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2602.09153","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:ae4e6aa6bb5318ab623b726875f354b5992f73ff7f1c222b41f33481f253d9eb","observation_id":"56a83cb6-2c8d-42b5-86c2-232b9e46d46c","resolution":{"observed_at":"2026-07-01T22:46:18.396613Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:1d573314b8324d87ab1321a3a5b8addcef97358e4adeedfb98342ab90c6d880b","observation_id":"3b55fcdc-a366-48ec-bb80-095cba4609f7","resolution":{"observed_at":"2026-07-01T22:46:18.405483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10812","last_updated":"2024-03-27T00:15:16Z","snapshot_observed_at":"2026-08-09T23:26:17.852639Z","submitted_at":"2023-12-17T20:39:54Z","title":"Learning to Act without Actions","version":2},"cited_work":{"arxiv_id":"2312.10812","doi":"10.48550/arxiv.2312.10812","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Jiang, M","venue":"arXiv (Cornell University)","work_id":"6ed164b1-6d4e-4cc3-a275-7afd9e7af691","year":2023},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2312.10812","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:37a68ada8084111b22e256076463f7758a79e854668b66f72289aae918dbf922","observation_id":"29b28eea-60da-4b26-8ade-f90d4a326b3a","resolution":{"observed_at":"2026-07-01T22:46:18.377940Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:875a44ce9eb3bf7412380011a6ed3153ac05bdd4ed7df03dd4796e1ba5f47a56","observation_id":"0ed2161f-86dc-48bf-80ec-fcf968de0120","resolution":{"observed_at":"2026-07-01T22:46:18.400971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2312.13139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-07-04T21:00:09.556391Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","venue":"cs.RO","work_id":"e92c2c13-4330-45fe-8231-34a6002626bd","year":2023},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:8defd27a46fae44c351b628c136a97f8cb4690cb8104d1fbaf9c07d5a1fbedf7","observation_id":"61e6f52a-62a4-41f7-bfa8-7662d99a7d2d","resolution":{"observed_at":"2026-07-01T22:46:18.371943Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":9,"parse_uncertain":0,"unresolved":2,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 52 inbound Pith citation observations for arXiv:2606.02800."}