{"as_of":"2026-08-11T11:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1130b5b6259919c0bc294a519a50f6d5aa1daaa66e0470ae8ec70d4f6598ff9d","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:18:08.598227Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:01:59.614460Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:36:39.313175Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05453","snapshot_observed_at":"2026-08-08T00:01:59.614460Z","title":"An empirical study of autoregressive pre-training from videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08646","last_updated":"2025-02-12T18:59:43Z","snapshot_observed_at":"2026-08-11T02:31:33.947489Z","submitted_at":"2025-02-12T18:59:43Z","title":"Poly-Autoregressive Prediction for Modeling Interactions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T00:01:59.614460Z"},"links":{"cited_paper":"/paper/2501.05453","citing_paper":"/paper/2502.08646"},"observation_digest":"sha256:390919a8b3954d54f82e6753df6ea32b357010c3998236367cd0922a3e6fbd5b","observation_id":"0ab97ceb-e762-42b1-88c2-25fb482fee79","resolution":{"observed_at":"2026-08-08T00:01:59.614460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"cited_work":{"arxiv_id":"2501.05453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05453","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2501.05453 , year=","venue":null,"work_id":"b62ba86b-2d51-47fd-bcfe-f8919a8a3cac","year":2025},"citing_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-13T22:21:15.681336Z"},"links":{"cited_paper":"/paper/2501.05453","citing_paper":"/paper/2504.13181"},"observation_digest":"sha256:006bb0796392374e58ac1240207addf162bceb222ae33fcb2f6de2afdc4545fd","observation_id":"50356802-4c7d-4a8a-a832-980328cf2c9b","resolution":{"observed_at":"2026-05-13T22:21:15.812012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"cited_work":{"arxiv_id":"2501.05453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05453","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2501.05453 , year=","venue":null,"work_id":"b62ba86b-2d51-47fd-bcfe-f8919a8a3cac","year":2025},"citing_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T21:22:36.902119Z"},"links":{"cited_paper":"/paper/2501.05453","citing_paper":"/paper/2506.01844"},"observation_digest":"sha256:151833b33ffef2ac1dcdbd9da9d69154de0860b12d2b5378771fbb4f82506ff8","observation_id":"c075b0bc-fdc5-4161-8d3d-a77885c85539","resolution":{"observed_at":"2026-05-11T21:22:37.506893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"cited_work":{"arxiv_id":"2501.05453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05453","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2501.05453 , year=","venue":null,"work_id":"b62ba86b-2d51-47fd-bcfe-f8919a8a3cac","year":2025},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2501.05453","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:f89b0288d8ba72c2d141e0a18f65dd8fc04a990260ddf072c483c75256a06770","observation_id":"93043d74-8061-46d9-9ec8-2118051a49ef","resolution":{"observed_at":"2026-05-11T00:33:51.155917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"cited_work":{"arxiv_id":"2501.05453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05453","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2501.05453 , year=","venue":null,"work_id":"b62ba86b-2d51-47fd-bcfe-f8919a8a3cac","year":2025},"citing_paper":{"arxiv_id":"2507.13942","last_updated":"2026-04-15T13:59:47Z","snapshot_observed_at":"2026-08-11T06:16:03.663561Z","submitted_at":"2025-07-18T14:14:19Z","title":"Frozen Forecasting: A Unified Evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T03:42:54.620069Z"},"links":{"cited_paper":"/paper/2501.05453","citing_paper":"/paper/2507.13942"},"observation_digest":"sha256:008441e78fb18eaf5464141958ed38a2fa403d3a12416ad90fbb805cbc3b988a","observation_id":"43be2391-8b97-4bb9-a60f-a74db1b4da80","resolution":{"observed_at":"2026-05-19T03:42:57.283557Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"cited_work":{"arxiv_id":"2501.05453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05453","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2501.05453 , year=","venue":null,"work_id":"b62ba86b-2d51-47fd-bcfe-f8919a8a3cac","year":2025},"citing_paper":{"arxiv_id":"2605.23033","last_updated":"2026-05-21T20:58:42Z","snapshot_observed_at":"2026-07-06T23:33:19.375527Z","submitted_at":"2026-05-21T20:58:42Z","title":"Uncovering the Latent Potential of Deep Intermediate Representations","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-25T05:36:24.743558Z"},"links":{"cited_paper":"/paper/2501.05453","citing_paper":"/paper/2605.23033"},"observation_digest":"sha256:6ae24ee42b2c0fb9081e41d723163457f0136d3efe5db661a2061a3d289fec02","observation_id":"61840861-5c14-40c3-8312-df09a22b62aa","resolution":{"observed_at":"2026-05-25T05:36:39.314533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.05453/citation-record","integrity":"/paper/2501.05453/integrity","json":"/paper/2501.05453/citation-record.json","paper":"/paper/2501.05453"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:09.064376Z","title":"Figure 11 µ-Parameterization Learning Rate: We show that µ-Parameterization (Yang et al., 2022), we can train all width Toto models, with an single optimal learning rate of 2−7","venue":null,"work_id":"57ff7ff3-cb22-456f-93bc-fc793dc61d60","year":2022},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.598227Z"},"links":{"citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:72856eaf2ea072f28ce0953211b7444b21589432fc4db3266111718e5a85abb9","observation_id":"125e0653-d6f5-458f-8695-c1b08967dcee","resolution":{"observed_at":"2026-08-10T21:18:09.071666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-10T21:18:08.404695Z","title":"A short note on the kinetics-700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.404695Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:932b4596dc84ac9e38f74ec2ee6f4f6116663d5c19dd6802fd8b9812be8ab533","observation_id":"dcb101e3-dee2-4aba-ae17-88454352a2c4","resolution":{"observed_at":"2026-08-10T21:18:08.404695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-10T21:18:08.440032Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.440032Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:a10a8a02b0aea2e496edd22c2668c67a6c9162da18b1709cc6135cbf85af6e9d","observation_id":"125c856e-165d-48cf-bc99-03264d6ea67a","resolution":{"observed_at":"2026-08-10T21:18:08.440032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-10T21:18:08.446082Z","title":"Scaling laws for autoregressive generative modeling.arXiv preprint arXiv:2010.14701,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.446082Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:d1258cc4de3f550af2dcb96be8412fc5bef92533ae026517f538a8b2fb6159ae","observation_id":"28df9a01-00f9-4805-8583-3ea9508be52f","resolution":{"observed_at":"2026-08-10T21:18:08.446082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:09.105652Z","title":"Perceptual losses for real-time style transfer and super-resolution","venue":null,"work_id":"8f6d3726-b9be-4490-b600-4c7d0c75e4f0","year":2016},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.454097Z"},"links":{"citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:ce5835bdcfb06bfde7c5e2a452672f9b0aa7efab62325811f35a0556a9244bb5","observation_id":"173044f7-051f-489e-afce-93349f30517c","resolution":{"observed_at":"2026-08-10T21:18:09.111669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.4400","last_updated":"2014-03-04T05:15:42Z","snapshot_observed_at":"2026-08-02T17:47:13.893077Z","submitted_at":"2013-12-16T15:34:13Z","title":"Network In Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.4400","snapshot_observed_at":"2026-08-10T21:18:08.466279Z","title":"Network in network.arXiv preprint arXiv:1312.4400,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.466279Z"},"links":{"cited_paper":"/paper/1312.4400","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:e93a4691299cafa81f242117e731161f533588ce1e30c5b2621883e02d19f426","observation_id":"c7e9951d-d7cc-4d3d-80e4-1c1c40c710b5","resolution":{"observed_at":"2026-08-10T21:18:08.466279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-10T21:18:08.480459Z","title":"In-context learning and induction heads.arXiv preprint arXiv:2209.11895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.480459Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:4f54eaab110fdf98d998c8640c6a2b68181c85b076f07a4e85b40e4f5837af1e","observation_id":"de9ade04-c8b0-444b-bf9b-d83bb87b79ba","resolution":{"observed_at":"2026-08-10T21:18:08.480459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-10T21:18:08.486951Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.486951Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:7ccf1c3f044d1f3d916b2006e506bbd529db81b5f401daf935e9d43d0c51d6b7","observation_id":"ba918768-af36-4d98-bca1-acfc8a857c47","resolution":{"observed_at":"2026-08-10T21:18:08.486951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6604","last_updated":"2016-05-04T14:01:42Z","snapshot_observed_at":"2026-07-06T04:04:18.621124Z","submitted_at":"2014-12-20T05:05:51Z","title":"Video (language) modeling: a baseline for generative models of natural videos","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6604","snapshot_observed_at":"2026-08-10T21:18:08.497076Z","title":"Video (language) modeling: a baseline for generative models of natural videos.arXiv preprint arXiv:1412.6604,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.497076Z"},"links":{"cited_paper":"/paper/1412.6604","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:c061a24dae0f2a9a54a5eb3ab0d36f61cd8e42dcf26789498a0946f3a2830e25","observation_id":"903a5970-8225-426e-950a-7dc653e6b249","resolution":{"observed_at":"2026-08-10T21:18:08.497076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-10T22:24:05.831832Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-10T21:18:08.513202Z","title":"Very deep convolutional networks for large-scale image recognition.arXiv preprint arXiv:1409.1556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.513202Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:5fdccb01482412b6b542c992eff2700342c234bfa35f3de6b1c95b77f4aa419b","observation_id":"2069eb2d-81af-456d-a1ef-0c1eb791918d","resolution":{"observed_at":"2026-08-10T21:18:08.513202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T21:18:08.518021Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.518021Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:2389cd5c2b277808a8846c1d3f18fbde2e293484e8152f7ccc56547d5d7649ca","observation_id":"5e1b2c61-5c8c-477a-91d1-e1a64246ce42","resolution":{"observed_at":"2026-08-10T21:18:08.518021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02634","last_updated":"2020-02-10T19:29:56Z","snapshot_observed_at":"2026-08-10T11:43:04.991423Z","submitted_at":"2019-06-06T15:06:21Z","title":"Scaling Autoregressive Video Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02634","snapshot_observed_at":"2026-08-10T21:18:08.532079Z","title":"Scaling autoregressive video models.arXiv preprint arXiv:1906.02634,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.532079Z"},"links":{"cited_paper":"/paper/1906.02634","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:ab846c7eea661bae45c0175da4371a99c11def5a80a3f58048015c697c3d39f5","observation_id":"28ce68f5-b37b-4853-9ffd-55225236cd83","resolution":{"observed_at":"2026-08-10T21:18:08.532079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-08-10T21:18:08.542978Z","title":"Masked visual pre-training for motor control.arXiv preprint arXiv:2203.06173,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.542978Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:ca63bc91a5f6da54f34d7954b21a74320ae4e9469d4798113ff89a3b580b4007","observation_id":"34ded5a1-c0ae-4b11-b6f1-e0e73f66d51e","resolution":{"observed_at":"2026-08-10T21:18:08.542978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05928","last_updated":"2022-03-11T13:58:05Z","snapshot_observed_at":"2026-08-04T03:46:30.396704Z","submitted_at":"2022-03-11T13:58:05Z","title":"TFCNet: Temporal Fully Connected Networks for Static Unbiased Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05928","snapshot_observed_at":"2026-08-10T21:18:08.557957Z","title":"Tfcnet: Temporal fully connected networks for static unbiased temporal reasoning.arXiv preprint arXiv:2203.05928,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.557957Z"},"links":{"cited_paper":"/paper/2203.05928","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:65579a5df30e95b4b27e46d1b18858b3597aacb18f4291f9470c9a0e116d70f9","observation_id":"f7754097-acf0-4569-b106-0bc45a05e8a2","resolution":{"observed_at":"2026-08-10T21:18:08.557957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-07-06T17:16:59.193820Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09417","snapshot_observed_at":"2026-08-10T21:18:08.581095Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model.arXiv preprint arXiv:2401.09417,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.581095Z"},"links":{"cited_paper":"/paper/2401.09417","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:d1991911ea767ce1a2f7b186d16e84da4ed7f4771279a11f58cd0dfb581b9923","observation_id":"7994cab7-3320-4d49-b9b2-b2bbd6e767b5","resolution":{"observed_at":"2026-08-10T21:18:08.581095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:09.086611Z","title":null,"venue":null,"work_id":"c1ab4587-ed79-4532-a1bb-79adeafbb33b","year":2017},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.591288Z"},"links":{"citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:71e796c7028e56f3a1cdfec8946485b7101c200dd9cab8a1fd7e12f0b55b7d73","observation_id":"3ce465dc-f3f4-477f-8982-9f026c46cf69","resolution":{"observed_at":"2026-08-10T21:18:09.092643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-10T21:18:08.507922Z","title":"Glu variants improve transformer.arXiv preprint arXiv:2002.05202,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":1951,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.507922Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:ae087a0bbf7271c20a417341165b268af2cda4e39d0574152a3bd4121ebe0a8a","observation_id":"19e7aba7-a982-4765-9198-3a9749b7aa97","resolution":{"observed_at":"2026-08-10T21:18:08.507922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-10T21:18:08.393198Z","title":"Beit: Bert pre-training of image transformers.arXiv preprint arXiv:2106.08254,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":1954,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.393198Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:d77ff3ba6d1af999f65663fbd4e102ed0ea0217093abef8dd6172a0335e48b9f","observation_id":"5a9326d3-f23a-4ee1-96ff-47a0dd24c251","resolution":{"observed_at":"2026-08-10T21:18:08.393198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T21:18:08.473512Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.473512Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:e916cb364e50330319c162dda41659cdd4ab46d8901999fa9eaa87e819c1bf53","observation_id":"8d14d8f7-e564-49d2-ae11-52a2216ad168","resolution":{"observed_at":"2026-08-10T21:18:08.473512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00989","last_updated":"2023-06-01T17:59:58Z","snapshot_observed_at":"2026-08-09T06:04:31.284029Z","submitted_at":"2023-06-01T17:59:58Z","title":"Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00989","snapshot_observed_at":"2026-08-10T21:18:08.503176Z","title":"Hiera: A hierarchical vision transformer without the bells-and- whistles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.503176Z"},"links":{"cited_paper":"/paper/2306.00989","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:c34397e30a05a5ab0147d1f4dd968cbf1945965eb03a8135291e65dd09130982","observation_id":"5edd0f72-243b-45dd-91bc-398f37e9ce29","resolution":{"observed_at":"2026-08-10T21:18:08.503176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-10T21:18:08.460067Z","title":"The kinetics human action video dataset.arXiv preprint arXiv:1705.06950,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.460067Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:803cd29073176cabb0a415aa2f01fbcb65b35f5b6b67eff158acdfa4e8973fdc","observation_id":"06619f79-214b-48fe-b95c-86df15aa6a53","resolution":{"observed_at":"2026-08-10T21:18:08.460067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T21:18:08.522588Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.522588Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:257927c2d2245bd7c59bfb7a5a40b36103b413d62df689be78642bd432111785","observation_id":"c63646bf-f532-4508-ba8d-8831ca267467","resolution":{"observed_at":"2026-08-10T21:18:08.522588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-10T21:18:08.492053Z","title":"The 2017 davis challenge on video object segmentation.arXiv preprint arXiv:1704.00675,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.492053Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:059539e3e00e5d6c6288d14e4a8c031b64905ae4e05e9cf9b298ec6a2b53bc52","observation_id":"4c7dd642-e5fc-40ea-be9d-2e2d5d59c165","resolution":{"observed_at":"2026-08-10T21:18:08.492053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08541","last_updated":"2024-01-16T18:03:37Z","snapshot_observed_at":"2026-08-10T12:43:26.428305Z","submitted_at":"2024-01-16T18:03:37Z","title":"Scalable Pre-training of Large Autoregressive Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08541","snapshot_observed_at":"2026-08-10T21:18:08.416521Z","title":"Scalable pre-training of large autoregressive image models.arXiv preprint arXiv:2401.08541,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.416521Z"},"links":{"cited_paper":"/paper/2401.08541","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:1eeb7ac17d115e75aca1d992e4d3c810106296911587e32107ea5ed980973ce4","observation_id":"dfc0a216-49f9-4de8-a788-9aa47949f5c5","resolution":{"observed_at":"2026-08-10T21:18:08.416521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-10T21:18:08.428054Z","title":"Data filtering networks.arXiv preprint arXiv:2309.17425,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.428054Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:1c29c36e9c60e49993669d73ea1228123dc23c874fcaf8a7dc77ec5be5508c8b","observation_id":"eee79cca-c31b-4d1e-bb49-349427a8ebb9","resolution":{"observed_at":"2026-08-10T21:18:08.428054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T21:18:08.398820Z","title":"Language models are few-shot learners.arXiv preprint arXiv:2005.14165,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.398820Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:ff824f73edf7e088651d394b43ba8af1241b089d8d6120c47c09ad5520adf7c4","observation_id":"8124c0fa-9850-4d79-9fed-f9856dae87d9","resolution":{"observed_at":"2026-08-10T21:18:08.398820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04744","last_updated":"2020-04-05T03:39:21Z","snapshot_observed_at":"2026-08-10T00:34:15.516446Z","submitted_at":"2019-10-10T17:52:19Z","title":"CATER: A diagnostic dataset for Compositional Actions and TEmporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04744","snapshot_observed_at":"2026-08-10T21:18:08.433520Z","title":"Cater: A diagnostic dataset for compositional actions and temporal reasoning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.433520Z"},"links":{"cited_paper":"/paper/1910.04744","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:44bf178b83a65d95931a23ba40a07e32b5b74dd77fd4934c2e320a02247e455a","observation_id":"ad3ab6d0-712e-41b8-933e-0cba572da75a","resolution":{"observed_at":"2026-08-10T21:18:08.433520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:08.410401Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.410401Z"},"links":{"citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:2d7597b3fb36798fc4712076dfed721bf237046358eb6238dbae817401e75943","observation_id":"c2568aca-c82d-40ee-89ea-7c92c58075f6","resolution":{"observed_at":"2026-08-10T21:18:08.410401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:09.124269Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"8d48ef43-4238-4156-8d2c-d62f1161c48a","year":2021},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.422538Z"},"links":{"citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:8c1bc1e1c453233cdcdd95399fd009d1fd44fc3e95feb5219362937647252a46","observation_id":"cf000250-c70d-4a25-8d36-818ad539de03","resolution":{"observed_at":"2026-08-10T21:18:09.130230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 6 inbound Pith citation observations for arXiv:2501.05453."}