{"as_of":"2026-08-18T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:649a794d0f7e91aea51279edf6d421cce542a672e4e66dec9191bfce20884da6","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:22:25.355326Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13683/citation-record","integrity":"/paper/2411.13683/integrity","json":"/paper/2411.13683/citation-record.json","paper":"/paper/2411.13683"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.014117Z","title":"Towards long-form video understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.014117Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:df4b9cc82fdc4a581019a0717f456cc000c94eb7d535897179dcf0b3d87b9db9","observation_id":"84cf1d58-7cf6-4e59-b24a-18365b0499be","resolution":{"observed_at":"2026-08-12T16:22:25.014117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.018939Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.018939Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:e78b7f74fcd78aa4bfd49ad33e99fc1fcf48604401e6f624be7e21db6bd3c463","observation_id":"57d954e0-e57e-4b91-834e-9520d8a00794","resolution":{"observed_at":"2026-08-12T16:22:25.018939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.438053Z","title":"Long movie clip classification with state-space video models","venue":null,"work_id":"06f41883-59c8-4f6d-9277-13d9a566cc33","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.023182Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:9bd6e0bf9655f1800ab2add05e699e02612733f84f5eaf73928cd09920cad11a","observation_id":"1e2090b2-dcc2-4824-91ac-5108d39886e7","resolution":{"observed_at":"2026-08-12T16:22:26.442059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.424221Z","title":"Selective structured state-spaces for long-form video understanding","venue":null,"work_id":"99fbf379-b343-4ac6-b6ec-b3c68df237ce","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.027369Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:8a8cee01337f8229d1b8482b08c95fb4cd98535695bdb56e9f1ce5d869f9d370","observation_id":"3abf5ab4-b5ec-4dfe-a7e7-e0e7e9f6434f","resolution":{"observed_at":"2026-08-12T16:22:26.428871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.410764Z","title":"Memory consolidation enables long-context video understanding","venue":null,"work_id":"62b4a85f-21e5-4ceb-9684-93e058ec2371","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.031425Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:040935741369d7df1aeab92be838f1ec6a1940c4047c1d215a12aba8ff2c6461","observation_id":"e1d2eb4b-a9ef-4679-8eb6-ccfb70df90db","resolution":{"observed_at":"2026-08-12T16:22:26.415408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.395583Z","title":"Memvit: Memory-augmented multiscale vision transformer for efficient long-term video recognition","venue":null,"work_id":"9c51d095-c2d3-4c1d-bfd6-c57ac2590c0e","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.036030Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:f8eb2d77357b8eef2231143121744b671e4f056f32f5cd73a71ea291fe98bd58","observation_id":"fad0160e-a622-46f0-8cbe-1ba5c085f687","resolution":{"observed_at":"2026-08-12T16:22:26.401384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.382425Z","title":"Token turing machines","venue":null,"work_id":"43a29f53-80ed-43d0-9406-9e4aabc20bb0","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.040506Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:cc50ad11e1ff65e739879125715e78a754df740b30b56d2c96b8ba3845b2235d","observation_id":"9136e534-9098-4a59-9d9b-2b43c8578db5","resolution":{"observed_at":"2026-08-12T16:22:26.386697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.369949Z","title":"Video recap: Recursive captioning of hour-long videos","venue":null,"work_id":"16e4ab91-eb5f-4ebb-93c2-d1234192645b","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.045808Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:a507cdd1c886a5c36423be2674b1a0675bb13c2fbe9008add85a7e652308947f","observation_id":"1ee8d817-2f90-4da5-b5ff-b16c8255302b","resolution":{"observed_at":"2026-08-12T16:22:26.374304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.356276Z","title":"A simple recipe for contrastively pre-training video-first encoders beyond 16 frames","venue":null,"work_id":"a0ec4339-eb7b-4c90-9822-210f917cf180","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.050401Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:7301f8495eade25e1b6e40cbae8b50fd962a414e601e3ed6bdb2f57909f3e2a8","observation_id":"15282ec6-ac03-48a8-bb04-1f898e7a3bc4","resolution":{"observed_at":"2026-08-12T16:22:26.360794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.054724Z","title":"A simple llm framework for long-range video question-answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.054724Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:c93345087037783725f166de49c0ef2a251d4e28c7d83ff670223c770decac52","observation_id":"96c04c42-cb02-4ce3-a8e5-aba75807fbeb","resolution":{"observed_at":"2026-08-12T16:22:25.054724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.336598Z","title":"Long-form video- language pre-training with multimodal temporal contrastive learning","venue":null,"work_id":"4cf67bcb-1652-42d5-a008-9cb6ffbb85a8","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.058702Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:182bd5be0841787597b069a5e816ce30c00df30be58fdf21e66bcb6d47e0333c","observation_id":"b28fee82-238e-451f-a888-05e92652f15a","resolution":{"observed_at":"2026-08-12T16:22:26.341094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.324285Z","title":"Koala: Key frame-conditioned long video-llm","venue":null,"work_id":"7e05e91a-bdc9-498e-8d5f-d0ce650c1a74","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.062400Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:962d76cc1ae2895ee39730d43001261d4d90ce16dd5b011f6a72bce50569d72d","observation_id":"4dc4e05a-4e81-45f9-ba36-ef5bdde63ccb","resolution":{"observed_at":"2026-08-12T16:22:26.328284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.313084Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":"b574607f-9917-4551-a9c0-88200c1dd6b3","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.066391Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:8d99f0b8513d92d9e7c6cde2b074ac33ce1ee5443d8e6b19f7ea572262f637cc","observation_id":"9104b8a1-ea81-4e5d-b003-51f7c116eb30","resolution":{"observed_at":"2026-08-12T16:22:26.316949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.299112Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"091e5dc1-f98d-4fb0-9390-0f0c18bf1e5a","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.071077Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:529d166a760ac3f27e1706d14dcbb32b88eff296d4b473644fd2637109133aa4","observation_id":"30a10d9c-6a53-456b-9d89-fc6543a31d37","resolution":{"observed_at":"2026-08-12T16:22:26.304662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.286236Z","title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"60e7c414-f426-4804-94d9-2b027547ed8d","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.074927Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:8c45c8788154549c8893003ae8295a0d310dd3b3048abafcc7b8ad684adfb96f","observation_id":"61aa62bd-3850-4120-ade0-88283e9a3003","resolution":{"observed_at":"2026-08-12T16:22:26.290950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.274400Z","title":"How can objects help action recognition? In CVPR, 2023","venue":null,"work_id":"40416d0d-d462-4f27-a014-49ab5b761dea","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.078492Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:e4e3c0bdb8f277c3ac5a84feccdd10926bc5777bb7e383ee3e09dd06f38c7f1c","observation_id":"cdd82006-37e8-4192-a1fe-5725f23d39cc","resolution":{"observed_at":"2026-08-12T16:22:26.278784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.262085Z","title":"Everest: Efficient masked video autoencoder by removing redundant spatiotemporal tokens","venue":null,"work_id":"c79821ff-d82a-4610-a73e-97648ab5176e","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.082930Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:b3b9654973a4aa5715fd69afba48893c49744473b86ada55f3cb1c0d62ffbe4d","observation_id":"2d832d9b-485e-4aca-8091-c506b8885877","resolution":{"observed_at":"2026-08-12T16:22:26.266111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.249264Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100","venue":null,"work_id":"538627ea-3ea7-4269-9adf-6145ea3ee2e5","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.086594Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:46879adcbceace0e7125707363fa0a09c9b7667ada9006f2792bc80b3c7ba5c1","observation_id":"9d1350a1-3813-4f80-bbf4-6a55f4baba20","resolution":{"observed_at":"2026-08-12T16:22:26.253869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.237136Z","title":"Resound: Towards action recognition without representation bias","venue":null,"work_id":"07d4ee45-463c-48d9-9068-3bfa44d29577","year":2018},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.090422Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:aa7260c7322b74b89b18f6b6fa3945f3828b703fbd0e959c0d3d455cf68fdec4","observation_id":"6c0d1bea-e94f-46af-ab04-b4c051bd18c1","resolution":{"observed_at":"2026-08-12T16:22:26.241287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.225327Z","title":null,"venue":null,"work_id":"44afc774-39a7-42cc-8ee5-14e87ea0204d","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.094637Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:e01f4ec2420474f1c3a8996f4dd430a19170bb512308d50be1fc3d33169125ec","observation_id":"21f1223f-011f-4832-ade6-2ee718f0afb4","resolution":{"observed_at":"2026-08-12T16:22:26.229238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.213786Z","title":"Bevt: Bert pretraining of video transformers","venue":null,"work_id":"f1b7d7db-bf6d-497c-831e-fab2094aabb3","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.098703Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:cde2c18d97caa9575a7690559fe47be9d428c7fb2757105263f387cb852cca9c","observation_id":"05497a92-60ff-443e-9f04-71f253a54044","resolution":{"observed_at":"2026-08-12T16:22:26.218024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.201328Z","title":"Girdhar, A","venue":null,"work_id":"ba6abf80-a880-41a9-91a0-0a4aed769e0c","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.103922Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:c3787758e67c7bb210589e6b00d857fe96e9240f24fcf8ed8e11baa096950d59","observation_id":"e5e7babb-2187-497a-af9d-76469a1373b0","resolution":{"observed_at":"2026-08-12T16:22:26.205639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.189624Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"dd5537cf-25ac-43e0-bd19-b9442463519a","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.107960Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:01bfb73e1c571b58e846657e9f2a3f68d83a2fdde5884c71835839485da5ebc7","observation_id":"713e89ef-4263-417a-b095-74a19c92e633","resolution":{"observed_at":"2026-08-12T16:22:26.193574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.178159Z","title":"Masked video distillation: Rethinking masked feature modeling for self-supervised video representation learning","venue":null,"work_id":"1f3313f3-1544-4ea5-86fd-f74f048230e0","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.111942Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:b4c418b6b368986186e779bb3b2f5d4b506245be84f5cfb1c969bf0f96e5ffd0","observation_id":"bc7e4fd2-2979-4311-a58b-b08529e687ad","resolution":{"observed_at":"2026-08-12T16:22:26.182211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.165040Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"611dccc6-acc9-494c-b2ce-117168e8f5cd","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.115504Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:2b904b1945d8c9ae773b74cf71db656082030b10c858c3f0b0e66569e37f58d2","observation_id":"e5511110-75f1-465e-bd26-2f2d846c7286","resolution":{"observed_at":"2026-08-12T16:22:26.170158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.139237Z","title":"Tokenlearner: What can 8 learned tokens do for images and videos? In NeurIPS, 2021","venue":null,"work_id":"299243d5-c0ba-4854-a8f7-0ee3407816b1","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.123089Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:e5c8c3198ec20bc795ad39f5976e25095259caa157b7b6a717a5327a0e16fd4b","observation_id":"929db5b8-04b5-4e3d-a6cc-91d48a12431c","resolution":{"observed_at":"2026-08-12T16:22:26.143450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.126398Z","title":"something something","venue":null,"work_id":"cb44bb7f-94a2-4c53-b6d6-65c222c98028","year":2017},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.126787Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:da06a387493c082ac0716c0dbc9f17a967630045ba2ffa81279deb33e928b941","observation_id":"9cd15a53-f043-4a68-9079-f5e6871c87d9","resolution":{"observed_at":"2026-08-12T16:22:26.130927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.114759Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"a925782b-f3cf-43b9-86db-a5ae1df40c89","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.130449Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:2a33e4e217ca004d57afe11b536bcf4e41a178ed8df30c7a565f4c830d739d98","observation_id":"319a40db-cab6-42ab-86cd-b86c83095958","resolution":{"observed_at":"2026-08-12T16:22:26.118986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.098921Z","title":"Mgmae: Motion guided masking for video masked autoencoding","venue":null,"work_id":"994fdae3-48ec-4d9e-a577-1e353dc8ed07","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.134329Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:a97ada0e1784d65ebf3e4405951f7e68d838d21c9e242530c0faba82240bf0ed","observation_id":"d87ef826-a40a-4764-958d-63623af7b0cc","resolution":{"observed_at":"2026-08-12T16:22:26.105953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.086801Z","title":"Motion-guided masking for spatiotemporal representation learning","venue":null,"work_id":"ae8aa3fa-edbb-4e1e-b78e-2f9c3dca0a02","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.138258Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:fc6d0de630521dcbeb87f72d22cb9fe8bde20b3a92a5a207f0d315367f594e58","observation_id":"b5b0e6f3-fc2d-408f-a232-3ca3c19afbf2","resolution":{"observed_at":"2026-08-12T16:22:26.091040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.072093Z","title":"Video codec design: developing image and video compression systems","venue":null,"work_id":"7639878d-9141-4705-b0e0-b6fb2aab76f2","year":2002},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.142170Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:c0e91a5f24e32d1702ca850ac09e377e662e10b622a23310b08ab70ae5e79d48","observation_id":"e32096bb-4f64-4512-ac99-52032f45532d","resolution":{"observed_at":"2026-08-12T16:22:26.077412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.058289Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"de5adbaa-825c-4501-9126-c3b2b79de5a8","year":2020},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.146065Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:f48dfe975265801a9aa53ad8c555368107a0e007c9f4d1eba6221eb66ce9533a","observation_id":"9a8ae6a4-ee82-4266-bced-f94d9ea68a02","resolution":{"observed_at":"2026-08-12T16:22:26.062271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.046571Z","title":"Videoprism: A foundational visual encoder for video understanding","venue":null,"work_id":"72932077-4725-48d7-9ba2-54951157cc0a","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.149577Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:d605f1d0d14508d6a6fa6734900107e76de75fb486b68564bb4a6f0261732ac5","observation_id":"d71d0fc2-7964-48d3-9875-5cb23baf2090","resolution":{"observed_at":"2026-08-12T16:22:26.050812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.033548Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding","venue":null,"work_id":"98e0e9f6-308c-4982-a6c2-330477e0aa0b","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.153989Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:8f2d72a204172ad696e3a6a6d6d4ca22e19e2dec44a8f2dc75ddd60313296903","observation_id":"0c81c503-ca16-426b-8f61-e24d49b7afd8","resolution":{"observed_at":"2026-08-12T16:22:26.037738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.019914Z","title":"Vivit: A video vision transformer","venue":null,"work_id":"a336dc12-89d0-4c8b-8eff-83a92a86d028","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.157567Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:621a8641b5133553341984c958e2d02d633257b4f9f8d65c52318051c769225f","observation_id":"55a81fcf-1c28-4640-b3d8-ce4c2b551f17","resolution":{"observed_at":"2026-08-12T16:22:26.024691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.007088Z","title":"Finite scalar quantization: VQ-V AE made simple","venue":null,"work_id":"f9432013-3858-44a3-99b8-32a9e0384053","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.161177Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:dbb6f7cb3d9b2ad189502fa1e7aaf81db0556caf332b1c207f1580c2b3f826da","observation_id":"07e3e8ce-9ff2-4a61-9d79-e761d97b7bfb","resolution":{"observed_at":"2026-08-12T16:22:26.011181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-08-15T17:51:24.030376Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-12T16:22:25.164843Z","title":"A short note about kinetics-600","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.164843Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:8d0596e2750763c33dac54ec8bac5c093ff6f5d7ac36114d57cec98930942cd0","observation_id":"02398460-7a6d-40c7-bf63-b314a15cce3f","resolution":{"observed_at":"2026-08-12T16:22:25.164843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-08-14T16:05:50.720818Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-12T16:22:25.168857Z","title":"A short note on the kinetics-700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.168857Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:33914c7360e771e188f7f9ac1678715408da5156fef4d99ccbe4052aff444ac1","observation_id":"95ecca2f-f416-4873-9e90-80143ff10102","resolution":{"observed_at":"2026-08-12T16:22:25.168857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.991929Z","title":"Multiview transformers for video recognition","venue":null,"work_id":"8784c769-46f7-41fc-8621-35e9c6d35323","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.172795Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:e8a147bce4f3872b5fd039bc710d460be11918f957acbe2372d8552626f9dbe0","observation_id":"a196cfee-b1a4-49b0-b4a2-0d09a82b791d","resolution":{"observed_at":"2026-08-12T16:22:25.997209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05787","last_updated":"2023-08-10T17:35:47Z","snapshot_observed_at":"2026-08-17T14:08:07.398912Z","submitted_at":"2023-08-10T17:35:47Z","title":"Temporally-Adaptive Models for Efficient Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05787","snapshot_observed_at":"2026-08-12T16:22:25.176362Z","title":"Temporally-adaptive models for efficient video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.176362Z"},"links":{"cited_paper":"/paper/2308.05787","citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:965a3eece1b4540e9d227fd6dc24d4452f8d8b623678b34b0ca3b4cc25c67960","observation_id":"33cfc5de-95ae-40d3-8b38-2227648e89d7","resolution":{"observed_at":"2026-08-12T16:22:25.176362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16669","last_updated":"2023-09-28T17:59:50Z","snapshot_observed_at":"2026-08-17T21:50:31.665565Z","submitted_at":"2023-09-28T17:59:50Z","title":"Training a Large Video Model on a Single Machine in a Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16669","snapshot_observed_at":"2026-08-12T16:22:25.180917Z","title":"Training a large video model on a single machine in a day","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.180917Z"},"links":{"cited_paper":"/paper/2309.16669","citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:7319eb5e7b82053fd2dab378c29e480c34fee95ef6329b23ca7a4235e6b06596","observation_id":"2f028e33-ae02-4d0b-8d47-ea889ce8eda2","resolution":{"observed_at":"2026-08-12T16:22:25.180917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.979307Z","title":"Imagenet-21k pretraining for the masses","venue":null,"work_id":"c3028c64-f15c-405c-99d2-f8a725ea0326","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.185019Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:7e03a9abd0ec1a4eb37833efa83618c5f46ab4fdad464708bcfdf4deee8541c4","observation_id":"72d5d421-0073-40e7-8db3-f1349385d633","resolution":{"observed_at":"2026-08-12T16:22:25.983302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.968262Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"6d17a31c-56e8-4ecc-8b81-f052e82e3ab4","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.188571Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:230840c4aec5781e17d3534cb94c5575a6fc3546c4f0f9bef41986c053ddc24b","observation_id":"45a79a2a-274c-496e-b7cf-87f33caffe1d","resolution":{"observed_at":"2026-08-12T16:22:25.972248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.957276Z","title":"Verbs in action: Improving verb understanding in video-language models","venue":null,"work_id":"710e7f3c-bc9f-4883-b072-d91b162010d6","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.192158Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:11a64bc77a2cbba3317d569beeb41da7bf49f7eee32009de9091deca4249866b","observation_id":"bdb7e0cb-169d-4786-bfcf-e6475c709066","resolution":{"observed_at":"2026-08-12T16:22:25.961247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.945910Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"03d75a74-b263-40e3-afd4-67233e30b2d6","year":2019},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.196373Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:0d92d303a68a6b5980abffa60fcf567c7ecd4f1977c785973786c145c853476e","observation_id":"ec83fec6-7af5-4875-aefd-eb8f725487be","resolution":{"observed_at":"2026-08-12T16:22:25.949510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.935400Z","title":"Interactive prototype learning for egocentric action recognition","venue":null,"work_id":"c2f0f094-3af2-49c1-aa0a-af36201120f6","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.200298Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:8a4d539df9a9285831ab9ff0157195f45713a02014232b56b11ad6bb4b4b3188","observation_id":"24b0f31e-184e-43ca-9067-4636c6be323f","resolution":{"observed_at":"2026-08-12T16:22:25.939197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.923874Z","title":"Movinets: Mobile video networks for efficient video recognition","venue":null,"work_id":"fed16499-3641-4a91-932d-c967dced75dd","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.203795Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:a032d56911af31c951a5898c94053bc6617fc1bece8fb423d6eabbce54c26423","observation_id":"0be7e6c2-5f50-4e9f-aa24-cd85927732bb","resolution":{"observed_at":"2026-08-12T16:22:25.928022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.911559Z","title":"Omnivore: A single model for many visual modalities","venue":null,"work_id":"75f83060-71b0-4923-96a7-e27c6846405c","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.207333Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:0d06ac04318605fc66915618f3c293fac4ca64c4a25d806fc671fe9bcd40e07d","observation_id":"a08bd723-c388-4787-9478-9e4cdde59e2d","resolution":{"observed_at":"2026-08-12T16:22:25.916079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.899351Z","title":"Learning video representations from large language models","venue":null,"work_id":"da3032df-9a75-4e57-8fe8-8df8828ae8e7","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.211110Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:8c46be72030f2aa1db245dd03847f907698ea408f664b7e74982fdbcd04da53f","observation_id":"08528d82-d877-41a5-ba58-e4c47280dda9","resolution":{"observed_at":"2026-08-12T16:22:25.903493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.887869Z","title":"Is space-time attention all you need for video understanding? In ICML, 2021","venue":null,"work_id":"0243811e-89f6-4d4a-91d3-ea22b4a0a6b1","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.214507Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:a95494226249f8fad2673d8aed31cddf4f138e0c0ca56685dc33011da9632fe5","observation_id":"994e1ecd-afde-4267-9eff-b2a21a9e9a74","resolution":{"observed_at":"2026-08-12T16:22:25.891843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.875903Z","title":"Video swin transformer","venue":null,"work_id":"d3357dbb-2756-457c-9eaf-8f74d469d69b","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.218269Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:414ef6e144952745f1741a4ea8eb06df2c817cc03c3100cf431defbe72c81a1a","observation_id":"62167356-5e55-4fb7-8620-e87d6e8f161f","resolution":{"observed_at":"2026-08-12T16:22:25.879718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.865156Z","title":"Can an image classifier suffice for action recognition? In ICLR, 2022","venue":null,"work_id":"cb23232c-0b15-4d30-b27e-c2296b201d09","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.221993Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:86e8d41aad3067abb9af5be2a13af7bafae67afd2c86bdf92c941a7d3c67591a","observation_id":"be25e975-2432-4536-8ce7-8d7427f0d842","resolution":{"observed_at":"2026-08-12T16:22:25.868902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.853321Z","title":"Object-region video transformers","venue":null,"work_id":"756092c4-4b53-4053-b29a-b8804a3f511f","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.225841Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:e1f576fcbcdceb31259dce2f14d75360556f62e77b2b621089ac73ceca722f47","observation_id":"5efa996f-7043-42bb-bb20-13945d3dc966","resolution":{"observed_at":"2026-08-12T16:22:25.857839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.841691Z","title":"Aim: Adapting image models for efficient video action recognition","venue":null,"work_id":"a14318e8-8fdd-42c9-ada9-54b3b1e17827","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.229883Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:dbb665931de1b7d2f8be2462d2b3369c7946af153adae12af4e6fc27c9d2d0dd","observation_id":"738d1098-9f5d-4766-8627-53e4d24a5d64","resolution":{"observed_at":"2026-08-12T16:22:25.845804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.828382Z","title":"Video-focalnets: Spatio-temporal focal modulation for video action recognition","venue":null,"work_id":"b7dbd5f8-ea3b-461f-b2a1-9cdbd0c3714e","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.233575Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:10c5a97398d9d4cd8586aad72690165650add02a056abc72f8a6dc4ad5a97c5a","observation_id":"26189b8b-33f3-4750-9990-c658006ca20a","resolution":{"observed_at":"2026-08-12T16:22:25.834222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.812457Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":"63c62585-f3d5-477d-9dda-b89162bd10e6","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.237643Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:d270843c361a780762b467d3ca1fd661720e07c338f8b8cbed113c0e8d920269","observation_id":"6d0e83f9-ab6a-4b0e-910c-dc8b000828e3","resolution":{"observed_at":"2026-08-12T16:22:25.819649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.798508Z","title":"Finegym: A hierarchical video dataset for fine-grained action understanding","venue":null,"work_id":"6458fb17-1ff5-43b9-ad16-1e92043d0bbc","year":2020},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.241462Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:6c53b5bd7e2555c20c47fba78d13b9be58b0dc36b2d3d8f5f5ec3e478e66bcad","observation_id":"35bf2940-3183-4085-8371-02c89b5ee713","resolution":{"observed_at":"2026-08-12T16:22:25.804450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.784872Z","title":"Learning temporal cues for fine-grained action recognition","venue":null,"work_id":"31928056-a81c-4c83-80bc-d9f0d21c63e5","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.245443Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:4bf2fa91d13b480360b56acae57301bda5c0ee55c462e802abc523cbaecd037c","observation_id":"c0e06bc4-9991-4702-8521-b65e8aa77aa3","resolution":{"observed_at":"2026-08-12T16:22:25.790238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.771118Z","title":"Tsm: Temporal shift module for efficient video understanding","venue":null,"work_id":"02ed60af-4516-4ef4-9cd5-5bd884c9323d","year":2019},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.249266Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:ab668e520ba13353b8518d62052485b2292770b325d873923974beca01fcd59b","observation_id":"b2aa5f83-862d-4df6-b1f7-ebe7564d0c09","resolution":{"observed_at":"2026-08-12T16:22:25.775928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.758420Z","title":"Temporal query networks for fine-grained video understanding","venue":null,"work_id":"bb3a6994-675d-4701-83e6-50667e6fbbc3","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.253411Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:5c19dbfbdc5f2b4cf60362061061a1f643b7ac7861f121503d6613901c0df5b9","observation_id":"33ddac3d-e7d2-4c61-85b0-c7df2c2651a0","resolution":{"observed_at":"2026-08-12T16:22:25.762566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.746347Z","title":"Combined cnn transformer encoder for enhanced fine-grained human action recognition","venue":null,"work_id":"51347a14-1797-411d-b610-f676fd7885bf","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.257990Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:28359289fdc79b8f86adcf5417c7afacc7e33abd7454f66928523eef9c3f9e5c","observation_id":"d5c37d89-8b6f-4e04-b893-76292cb9fbaf","resolution":{"observed_at":"2026-08-12T16:22:25.751023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.732957Z","title":"Going deeper with image transformers","venue":null,"work_id":"a7f99ccb-6aab-4bec-bfa0-42bd75360d8f","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.262106Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:2cfa68f9396e881ebf30d05749e305a53b288e80fa947f1e0f234cb5e67ca4d7","observation_id":"c1217cf0-e260-4354-a23a-649cf1548550","resolution":{"observed_at":"2026-08-12T16:22:25.738041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.713060Z","title":"Scenic: A jax library for computer vision research and beyond","venue":null,"work_id":"e92040b2-7f11-4968-9300-04de3c4a831b","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.266075Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:ac051d9fb8eb602c0e2f3d6e7fe72c9c7ee7d8cb0517b75642af2784f1371caa","observation_id":"e4c247d4-831e-46c6-a25f-64cfd87e3220","resolution":{"observed_at":"2026-08-12T16:22:25.722729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.694335Z","title":"We found this slightly improved accuracy ( +0.5 points on EPIC-Kitchens-100 Verbs and +1.2 points on Diving48)","venue":null,"work_id":"ff1a4b03-0519-4e7d-8641-c7e3eacdf931","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.270584Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:b3fcb3259bf13e065d4f091e45a10731cb89da34ceac0aff7a6cc35072c2ba76","observation_id":"0a74a736-5133-4c9c-a196-f891b24fb370","resolution":{"observed_at":"2026-08-12T16:22:25.700975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.676669Z","title":null,"venue":null,"work_id":"ca3309dd-05ec-47ff-ac7b-e3c166b5e5b7","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.274933Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:3c1c582c0ace60f35e6675e912f6b8779901164fc6981d4af8257c04e48afd71","observation_id":"e8883ef5-e7c8-4e61-a54c-8143413ce151","resolution":{"observed_at":"2026-08-12T16:22:25.681314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.662891Z","title":"17 Table 9: Model size vs frames","venue":null,"work_id":"a3f4fab8-69a6-4553-bc0e-1f9400598254","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.279010Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:de6d8e332b5b2f072649a8df01a98956587e12706222ca85af26cd081d8970a9","observation_id":"7121ac07-0f58-47f2-ad01-88e579276083","resolution":{"observed_at":"2026-08-12T16:22:25.667471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.648146Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"998fc9d0-015c-4f8a-871c-352ba5404734","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.283416Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:7133341c8c4b8dc35ef58510cb831239d1f8a00d47554e5cc8e89566e549c90f","observation_id":"13270ed7-aa41-42bd-a1da-25f5ef192c76","resolution":{"observed_at":"2026-08-12T16:22:25.653781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.630877Z","title":"Limitations","venue":null,"work_id":"6975e314-d5b4-4248-81b1-329baa01399c","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.287958Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:a42042b35d7d284986b876affded301476bfe98bc581d1b48e39098d30c1d494","observation_id":"fd7f5d79-0999-4578-ba91-897e965c755c","resolution":{"observed_at":"2026-08-12T16:22:25.636688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.614592Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"482b6821-78c3-484e-a2d8-2e35229444f7","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.292611Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:6eb68c0080083867b8e1be3cc8a327e75471e87f4de2c50d1ec64f4643b33c6e","observation_id":"10456fc6-93cc-44fe-982e-3888d20813f1","resolution":{"observed_at":"2026-08-12T16:22:25.619738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.598941Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"0eb07254-6d5c-4fc3-98ef-a4b7a1bb3d03","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.296935Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:c43274665d8c757b2123af1da631345b2a7b3c4afb3fd44667bf49396b36e6a6","observation_id":"955057ce-da5a-4eab-b8a1-3bb1e743a1f6","resolution":{"observed_at":"2026-08-12T16:22:25.605281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.582561Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"809681bf-4f54-4d10-b69f-de86e9db72b5","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.302631Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:21567431616a7da90140fa365c6f7c0a6d4d34a8a84441b7a5b05955ff9e17d0","observation_id":"05b446cf-6eb3-4330-affd-25d7dd01dfe0","resolution":{"observed_at":"2026-08-12T16:22:25.588626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.568064Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"5abc5d00-6a06-4c52-99e5-90242ec31ce6","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.307592Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:9e04fceb2376de7a013c4c70afe4febab202e8b8f07d974fcb22c763a691222e","observation_id":"903717b9-95c5-4a0b-ab71-e54f72805d1b","resolution":{"observed_at":"2026-08-12T16:22:25.572605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.552983Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"13400cfe-4a80-4e7e-bfd7-76a597e1991b","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.312618Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:d35cb5a2f099cf5d661a0263978d2a2feff45b911a2db500bb309b2726aff174","observation_id":"7504251a-762c-41d2-ad08-4e797b83ce0a","resolution":{"observed_at":"2026-08-12T16:22:25.559349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.539154Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"588189f8-4d47-4ec2-a300-0e5318d5e75c","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.318955Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:944d305b2eec588cc11aa127f5463e223c47c299eb310a3945cdbf2498ce9fbd","observation_id":"e409290e-ad8e-4ba9-95c5-8ff826b82976","resolution":{"observed_at":"2026-08-12T16:22:25.543694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.522501Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"75bf94bf-95c3-4a22-ad16-fe8a213c2bf7","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.323122Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:7fd3fffb7e5ec2ed68b984796485fa28801495a1ff8e136310a1b59920faad40","observation_id":"151092d4-fe23-4c42-8e99-94dce5af1702","resolution":{"observed_at":"2026-08-12T16:22:25.528011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.506402Z","title":"• If the authors answer NA or No, they should explain why their work has no societal impact or why the paper does not address societal impact","venue":null,"work_id":"d0fe0802-fef7-497f-acf2-676d8cc13fbd","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.327717Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:0a688c4a6b7a6553d39ed0e1130599625b23e46abe519deab05cdd6fdba943a3","observation_id":"27550e91-dc95-4ad8-834c-1d3ca347c615","resolution":{"observed_at":"2026-08-12T16:22:25.510829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.492409Z","title":"Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":"1093d8fc-c7b6-4bbf-b537-c846f80ca035","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.332877Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:127e6df145794bdcb7f465b5fd9d040c409a0cc8bc13bce0818e0f37d6048bfb","observation_id":"1832e7fb-510a-4c78-80da-e7490525eabf","resolution":{"observed_at":"2026-08-12T16:22:25.497541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.479831Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"73a08f1e-e9ae-47eb-9e73-ba12d9629e86","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.343151Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:9cf2d0f821caf4a892d017718dabc8bec0f01ab4154073e73f66f1ad01eab0ec","observation_id":"e87e9080-6d21-4d13-8e92-c9dc39889c6e","resolution":{"observed_at":"2026-08-12T16:22:25.484090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.347041Z","title":"Guidelines: • The answer NA means that the paper does not release new assets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.347041Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:c04eaea5ca6aaf2445b9fb2fc173c82e1998fc904f0c3c6aeb250bb511404f57","observation_id":"0f1ef82c-5084-4726-b5f5-3e7278d9683a","resolution":{"observed_at":"2026-08-12T16:22:25.347041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.459882Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"96e4c692-b098-4489-9b30-e842c5a0dd26","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.351339Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:b13386f0e1b0618f2b8d9330031b3a369e8b3267d6a5cf1c7586f3512a820017","observation_id":"32ea79b1-a7bb-4d37-9d42-eee4bc252c05","resolution":{"observed_at":"2026-08-12T16:22:25.464389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.442953Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"83291064-0128-4a9b-813e-d4db1e7ab645","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.355326Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:fc734acf35a9c56f772da3fb3946e78093164da64f36a9f9476e1be69d3a5c88","observation_id":"1f04bade-1819-48ac-ab45-49e80ce8e8d8","resolution":{"observed_at":"2026-08-12T16:22:25.450458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.151170Z","title":null,"venue":null,"work_id":"c8f922e4-f4dc-4ba8-9450-248809b21aa7","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.119455Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:d06df2b262aa3e1949d362aa49dd9323340eabb41cb8594a42b86137e6eab02f","observation_id":"17e2c672-1e70-46a4-a07b-68f28e108efe","resolution":{"observed_at":"2026-08-12T16:22:26.154889Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:50:12.105663Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":10,"verified_exact":0,"verified_fuzzy":71},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2411.13683."}