{"as_of":"2026-08-09T19:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f26ffbdd1038bf467398440fdb884529c249587037b8bbe7272f7ec3b31cad0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:17:39.573335Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":45,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T03:31:08.155347Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2210.02303"},"observation_digest":"sha256:7a4d0e06640ba6d0cd5d564c874090043ea89f04a51548b699042029e3ae2b96","observation_id":"57cc9a3f-f86a-43d2-adff-6b8386c1e5af","resolution":{"observed_at":"2026-05-11T03:31:08.208010Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"reference_index":279,"source":"arxiv_source","source_observed_at":"2026-05-20T13:03:57.828598Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2308.08089"},"observation_digest":"sha256:2b8ae13c72cea90916a7bfcaef383fb0e10c86d77faa1f823a7fd74654c7cf22","observation_id":"322c753b-1eb5-40d0-83f3-73dfb8ca9b53","resolution":{"observed_at":"2026-05-20T13:03:58.131936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2309.16797","last_updated":"2023-09-28T19:01:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T19:01:07Z","title":"Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-16T08:12:30.984870Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2309.16797"},"observation_digest":"sha256:0dae086cd04e79f534804210199cc7f11437ac1193dc10cf22787a609f06a312","observation_id":"dd7a038e-511f-4579-860f-c97877746cf7","resolution":{"observed_at":"2026-05-16T08:12:31.533823Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-05-13T16:32:05.538507Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2312.13139"},"observation_digest":"sha256:22eebe4541abb36623d504e6b8c28ef90d13c2b048d9d750c470d16eb441845a","observation_id":"325101e5-1056-41ce-99e0-eb6b8f9b823d","resolution":{"observed_at":"2026-05-13T16:32:05.705964Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T17:51:05.465548Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2312.14125"},"observation_digest":"sha256:cfe7f09d9c4a9c4e8b840f3f738741011a25c2a2452e96ba41c5d2db46f74529","observation_id":"58b1e455-212d-4e5b-8210-49090e264496","resolution":{"observed_at":"2026-05-15T17:51:05.690665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-05-13T13:43:11.024069Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2402.17177"},"observation_digest":"sha256:c3980d7144d4c8e27bfd96ad18d064e09c9d24cdc194008ff311e7eee0136e08","observation_id":"29e36350-4b57-4f41-bfde-68b3ed2c54fd","resolution":{"observed_at":"2026-05-13T13:43:11.244642Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:32dda5ba2f4bd8f4538e129cdbb2799cb214ef97ef7b95b159fe4c880be981f2","observation_id":"d20b0b42-f77d-4a59-96a1-a9d30b90dd33","resolution":{"observed_at":"2026-05-12T01:09:34.008304Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-08T19:17:39.573335Z","title":"Maskvit: Masked visual pre-training for video prediction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.573335Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:2334cde0df7932adeb49d0333880bc9b60b40837288647e15fe35bfb3ea0ab50","observation_id":"f230e108-8784-43cc-9750-f5125c4111f8","resolution":{"observed_at":"2026-08-08T19:17:39.573335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-08T15:14:22.326566Z","title":"Maskvit: Masked visual pre-training for video prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07825","last_updated":"2025-02-10T14:49:09Z","snapshot_observed_at":"2026-08-09T01:46:25.522034Z","submitted_at":"2025-02-10T14:49:09Z","title":"Pre-Trained Video Generative Models as World Simulators","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:14:22.326566Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2502.07825"},"observation_digest":"sha256:f2fe4108d61204a4741c029e82e3606ff94aa4377b9f5499c49a3a704e42dbee","observation_id":"72503797-2ce4-4cca-ac27-8733d13e0d42","resolution":{"observed_at":"2026-08-08T15:14:22.326566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-07T11:58:47.859287Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00989","last_updated":"2025-06-01T12:44:53Z","snapshot_observed_at":"2026-08-09T14:50:38.429151Z","submitted_at":"2025-06-01T12:44:53Z","title":"Boosting Bot Detection via Heterophily-Aware Representation Learning and Prototype-Guided Cluster Discovery","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:47.859287Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2506.00989"},"observation_digest":"sha256:0c9f352da838d0fac4bf7ffc548bf6e090b9e67a89af34cf1e1be35df58af438","observation_id":"17c4a7e3-3912-4ab2-ad57-526f15ef0ecc","resolution":{"observed_at":"2026-08-07T11:58:47.859287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:14fd26b696cf3def19f692d28ce711546c1ee4a5b6ebd2d6eade5e08d571f7f2","observation_id":"c7a600d1-840b-4ff7-86ef-153bff29820d","resolution":{"observed_at":"2026-05-11T00:33:50.835310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-06T19:50:17.617134Z","title":"Maskvit: Masked vi- sual pre-training for video prediction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-09T15:11:32.122204Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.617134Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b45c1d5ddc82796fd9262b68b52a6c620414d8398ccecbd0fa1cd38e10b10c1e","observation_id":"87e16809-6d0e-4eda-b546-ff98c30ed626","resolution":{"observed_at":"2026-08-06T19:50:17.617134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-06T14:13:53.899947Z","title":"Gupta, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19773","last_updated":"2025-07-26T03:48:12Z","snapshot_observed_at":"2026-08-09T08:51:59.422686Z","submitted_at":"2025-07-26T03:48:12Z","title":"Self-Guided Masked Autoencoder","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:13:53.899947Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2507.19773"},"observation_digest":"sha256:1bbec2d74e8addcc493dfe7b0bafb0ebed1ad0849c78a9f5f78830733dce010d","observation_id":"e38e71c2-4420-4ca7-bd22-554c24bb8f86","resolution":{"observed_at":"2026-08-06T14:13:53.899947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-04T10:43:36.981496Z","title":"Maskvit: Masked visual pre-training for video prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.09036","last_updated":"2026-06-24T10:18:59Z","snapshot_observed_at":"2026-08-06T06:48:09.190707Z","submitted_at":"2025-10-10T06:15:42Z","title":"RoDyn: Taming Interactive Robot-Dynamic 2.5D World Model for Robotic Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T10:43:36.981496Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2510.09036"},"observation_digest":"sha256:7231b049a7da081e9d9975a8fe9c519d1c77b9cc341b5bd1b5891908deadac81","observation_id":"338d3494-bf24-40cc-ad35-4201a475fc80","resolution":{"observed_at":"2026-08-04T10:43:36.981496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2602.21668","last_updated":"2026-05-04T08:33:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-25T08:04:07Z","title":"Space-Time Forecasting of Dynamic Scenes with Motion-aware Gaussian Grouping","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T19:51:58.756605Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2602.21668"},"observation_digest":"sha256:5e569a47a2150702eaa7afeeb3500cd7569f02cd28d9260e2719f8c8562e33a1","observation_id":"477e305c-7ee3-4735-99a5-081ee04fde00","resolution":{"observed_at":"2026-05-15T19:56:33.933613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2603.14392","last_updated":"2026-05-19T22:32:16Z","snapshot_observed_at":"2026-08-03T02:51:25.795638Z","submitted_at":"2026-03-15T14:12:43Z","title":"WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for Diverse Robotic Systems","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T11:40:28.002606Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2603.14392"},"observation_digest":"sha256:8152b9e77be9de5afdf761178d3ff05d300828bfafc4f26c8de4ed3c96c855ad","observation_id":"a6a93d62-b548-42c8-b193-049e660006c1","resolution":{"observed_at":"2026-05-21T11:44:09.343612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2605.30542","last_updated":"2026-05-28T20:18:22Z","snapshot_observed_at":"2026-07-06T23:39:48.531480Z","submitted_at":"2026-05-28T20:18:22Z","title":"Physically Viable World Models: A Case for Query-Conditioned Embodied AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T06:55:57.801162Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2605.30542"},"observation_digest":"sha256:c22b9eb622dfd342c9fc738ea712dc4695f2914020b0cf553f8e745cb0fdb965","observation_id":"e7346973-d3c1-4f50-916f-c54499c48639","resolution":{"observed_at":"2026-06-29T09:13:16.484324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2206.11894/citation-record","integrity":"/paper/2206.11894/integrity","json":"/paper/2206.11894/citation-record.json","paper":"/paper/2206.11894"},"outbound":[],"paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2206.11894."}