{"as_of":"2026-08-10T02:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02d99f40f2517c4cef16374b7af765869ab7bdb6d96fdc61dd60debb2589ec2a","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:17:39.829689Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:09:18.061419Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T18:16:30.548575Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"cited_work":{"arxiv_id":"2502.07811","doi":"10.48550/arxiv.2502.07811","metadata_source":"pith","pith_arxiv_id":"2502.07811","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","venue":"cs.CV","work_id":"86a6a47a-f7f0-4fda-9117-95bc376dc0bd","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.061419Z"},"links":{"cited_paper":"/paper/2502.07811","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:6e94cd5b7e7e8f37b642528a9f57abe50f8c46b2b9260d9306523e6f95240311","observation_id":"ff0a1ede-3856-4a74-ad1e-e3544cd0a8b4","resolution":{"observed_at":"2026-08-06T18:10:16.731929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07811/citation-record","integrity":"/paper/2502.07811/integrity","json":"/paper/2502.07811/citation-record.json","paper":"/paper/2502.07811"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.436477Z","title":"Self-supervised multimodal versatile networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.436477Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:38d06f76b5d11e791f14bd8ba58cfc4ffefc0115410ed6981aa53ab529294b71","observation_id":"aa31f2e1-7314-4142-8a0e-8c9e1ca4047e","resolution":{"observed_at":"2026-08-08T19:17:39.436477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.441116Z","title":"Self-supervised learning by cross-modal audio-video clustering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.441116Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:b51b60fc75574469c871bf5f57da814442fbbd485ba7e39a1d1305a68176fbdf","observation_id":"5c6b4a85-fdfa-49f7-8089-cc2eca4b9ba8","resolution":{"observed_at":"2026-08-08T19:17:39.441116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.445250Z","title":"Look, listen and learn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.445250Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:428c2d81f0961d80c415e4de8a70a72e97403d729e7a88c1057ca9ec554e32b8","observation_id":"514f8041-bb2a-4464-bd57-0a3a6b5da576","resolution":{"observed_at":"2026-08-08T19:17:39.445250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.449872Z","title":"Objects that sound","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.449872Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:65f2267c11915ece07d03ec62b934a5cea8aa180084e850c26dc5af5840d1d7a","observation_id":"a8586362-2712-4b57-8c07-76dd79501518","resolution":{"observed_at":"2026-08-08T19:17:39.449872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.453863Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.453863Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:58ac75f5837049c68f85f6f7553be54e681066fddb16d666cc71a7eb6c3bfba8","observation_id":"5f683016-7c5c-4ee6-9ad5-a37dcad2619e","resolution":{"observed_at":"2026-08-08T19:17:39.453863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.457906Z","title":"Adamae: Adaptive masking for efficient spatiotempo- ral learning with masked autoencoders","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.457906Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:3341736fad25c6e3a635ef97d80ce8aa673d68eeaa58726e735658886348e943","observation_id":"417c24bb-c924-400d-b216-af913765b5b8","resolution":{"observed_at":"2026-08-08T19:17:39.457906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.462043Z","title":"BEit: BERT pre-training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.462043Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:fb8765c90c8a46e2ca4ec143818b5789f0029e50d20a328995b490e2c448bc41","observation_id":"e49641c3-d57b-4f0a-9d1b-5c40625657aa","resolution":{"observed_at":"2026-08-08T19:17:39.462043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.466647Z","title":"Speednet: Learning the speediness in videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.466647Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:cc35811821ba3f20955af4b0a3002171daf04873b9c891349d7e5c538cf7cf24","observation_id":"6611a668-d9f4-4c85-a89b-53f609f485a1","resolution":{"observed_at":"2026-08-08T19:17:39.466647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.470804Z","title":"Is space-time attention all you need for video understanding? In Proceedings of the 38th International Conference on Ma- chine Learning (ICML), pages 813–824","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.470804Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:67386be2321a3cef8c8ea0d28883801d2be6619d247e96183d10bc2f2eaca31b","observation_id":"0b2949be-ce36-4de2-b3ea-b842c2f58b5e","resolution":{"observed_at":"2026-08-08T19:17:39.470804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.475016Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.475016Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:9551f33080aae1ddd42005a5b6e9424843c4baca467484149523e134f9527d67","observation_id":"6668cefe-edd9-4bd6-9124-7a21f1422748","resolution":{"observed_at":"2026-08-08T19:17:39.475016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.479038Z","title":"Learning aligned cross-modal representations from weakly aligned data","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.479038Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:374c7e86356341aaaaf0d3b7ae400da38d063e5afabdfc1e0db9379ac249de1b","observation_id":"65788d6c-4189-41e8-8422-35b2a69464e0","resolution":{"observed_at":"2026-08-08T19:17:39.479038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.483141Z","title":"Generative pre- training from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.483141Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:d5a357caacf874bca8b8720268821ceaf8979dffce94d867d3b95e1bc20ffee4","observation_id":"17edde5c-77e6-4dd2-ba52-2736aa6f6c61","resolution":{"observed_at":"2026-08-08T19:17:39.483141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.487073Z","title":"Rspnet: Relative speed perception for unsupervised video representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.487073Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:f03c34ea72f4b601229e73de6fa6ccb81f71fd613cb04a9d5067e44e7a31ecdb","observation_id":"5539f8f5-1b13-4a00-9020-c74c0b3e8240","resolution":{"observed_at":"2026-08-08T19:17:39.487073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.490967Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.490967Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:d42a99b40dc507976c1d26ac2a2768b779e7fa623c000b01a59ea2b1982809e4","observation_id":"75f840e0-2139-4217-8264-8cf28e8a5d9e","resolution":{"observed_at":"2026-08-08T19:17:39.490967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.495458Z","title":"Electra: Pre-training text encoders as dis- criminators rather than generators","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.495458Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:0bc28e2f8d608e9dbc9b3004b68140fd0a0324007dfb812e1c63be78b65bd148","observation_id":"f3e82289-834d-4ddd-ae23-8b5524d2c663","resolution":{"observed_at":"2026-08-08T19:17:39.495458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.499741Z","title":"Randaugment: Practical automated data augmen- tation with a reduced search space","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.499741Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:008ad0d16512c92acb03458001649599aa424453ea27ce70bc892357b73c111e","observation_id":"959bdc18-f39f-4383-bf50-293dafaa4dd7","resolution":{"observed_at":"2026-08-08T19:17:39.499741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.503662Z","title":"Unifying video self-supervised learning across families of tasks: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.503662Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:2ed4b1650e68382ca586be081ce48f26b28b30670f2777917b77c98bffd1b50c","observation_id":"155e3fce-1ef4-475f-8c7a-dd0a7ab896b7","resolution":{"observed_at":"2026-08-08T19:17:39.503662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.507721Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.507721Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:54921ffda1964f456248853ca21b5ca69766c69072b66f857237ed0bf9f22c87","observation_id":"ea42b726-5ceb-4e61-8f21-4b2dec2cd59f","resolution":{"observed_at":"2026-08-08T19:17:39.507721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.512352Z","title":"Virtex: Learning visual representations from textual annotations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.512352Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:15e34efc3482297a75880f6d17fc10768e4a4cdd117d5d675cccbbc67d2f8e28","observation_id":"312f0708-8db9-4eb9-857c-05931df10a21","resolution":{"observed_at":"2026-08-08T19:17:39.512352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.516832Z","title":"9 Vi2clr: Video and image for visual contrastive learning of representation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.516832Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:fddd3f429d37f5236f0307ff4c241bbe97ba0b80e63015594da2a0d7dbb3634a","observation_id":"139a9f0e-f182-4047-a18f-4ec727dfb35e","resolution":{"observed_at":"2026-08-08T19:17:39.516832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.520528Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.520528Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:62eb5dbeff03596807091c9059a6fe1e2d11bc1f3bf1be2cf738536eb3898129","observation_id":"43e118a0-44e5-4587-aef1-6d255efc6c90","resolution":{"observed_at":"2026-08-08T19:17:39.520528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.524439Z","title":"Multiscale vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.524439Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:c24bb331818b48c297d6e81edd733052ce74473aefd74dbab581c3157967f919","observation_id":"20cab6dd-82ee-4f9d-9672-fc366b2f2c78","resolution":{"observed_at":"2026-08-08T19:17:39.524439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.528415Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.528415Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:648c685fa25f96a119f35776f4ea52f8bf0e43f4a5a723de87f8dc97ac848f60","observation_id":"96353754-9cec-44fc-a127-806e7f99f547","resolution":{"observed_at":"2026-08-08T19:17:39.528415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.532554Z","title":"A large-scale study on unsuper- vised spatiotemporal representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.532554Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:27ada2c8fd2b7e3fdf532a79dd189c6cf2b70c9336277889bce9a876f2792141","observation_id":"0bcce743-4f81-45bd-bdd4-f3b969a60443","resolution":{"observed_at":"2026-08-08T19:17:39.532554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.537655Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.537655Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:b16e43a4745be52d7cf4e6e74fa4229a0a5bab259f1fe736ee67623cb29d0fab","observation_id":"901d0767-fcc8-42e2-ac84-f82b43be35f0","resolution":{"observed_at":"2026-08-08T19:17:39.537655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.542371Z","title":"Mcmae: Masked convolution meets masked autoencoders","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.542371Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:869ed9aeaf4cffab690f5bf61d437bb3e56f27cd462f5ccd039ca9a12dce7c1a","observation_id":"63f6a578-731e-49e2-8427-51835d2d17e4","resolution":{"observed_at":"2026-08-08T19:17:39.542371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.546400Z","title":"Revitalizing cnn attention via transformers in self-supervised visual representation learn- ing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.546400Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:dc1964613cab51b17eb346325c5868dd4093e48f4eb8feb9423f8b02925c2293","observation_id":"8466d3cb-f8e2-40a2-b371-f9372e09c879","resolution":{"observed_at":"2026-08-08T19:17:39.546400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.549998Z","title":"Omnimae: Single model masked pretraining on images and videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.549998Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:ae046dca1c7dd4f5390bf6c721e2da96845890feb2d14b0315986108eae2b6b5","observation_id":"902a23cd-ffc7-42aa-83fd-437ffbfaaf93","resolution":{"observed_at":"2026-08-08T19:17:39.549998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.553347Z","title":"Improving image-sentence embeddings using large weakly annotated photo collec- tions","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.553347Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:a6dcf9f5b3de720122f704fe274a48b5d2c557210ca2af01575b32537ca98c47","observation_id":"cd0451dc-47d5-41b0-b9eb-34aed2a78ebc","resolution":{"observed_at":"2026-08-08T19:17:39.553347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-08T19:17:39.557394Z","title":"Accurate, large mini- batch sgd: Training imagenet in 1 hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.557394Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:836a0233ddddda79ec3b296afec86704d1f564e7f1a88f7459d7add7db78c119","observation_id":"00ed9763-81a6-48b8-a699-eb1a39e57c45","resolution":{"observed_at":"2026-08-08T19:17:39.557394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.561828Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.561828Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:ea70eac662dc770d46ca6c0169500a6c3d79547b7a84b82fe928b167635ab7bd","observation_id":"226ba7d6-3b09-4de9-ad54-5722c4e210c3","resolution":{"observed_at":"2026-08-08T19:17:39.561828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.564924Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.564924Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:eaf29237e805006f3f6ad1a5ab533e7cb14aba0baca37eee32ea4239a7a7ee42","observation_id":"a1541263-211e-48db-aaec-9b861248f306","resolution":{"observed_at":"2026-08-08T19:17:39.564924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00498","last_updated":"2024-09-25T05:32:25Z","snapshot_observed_at":"2026-08-08T18:24:29.779637Z","submitted_at":"2024-08-01T12:08:20Z","title":"How Effective are Self-Supervised Models for Contact Identification in Videos","version":2},"cited_work":{"arxiv_id":"2408.00498","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.00498","snapshot_observed_at":"2026-08-08T19:17:40.105129Z","title":"How Effective are Self-Supervised Models for Contact Identification in Videos","venue":"cs.CV","work_id":"8a71e288-8820-4a16-a0cf-6218c49533c3","year":2024},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.568572Z"},"links":{"cited_paper":"/paper/2408.00498","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:e6eba31f8e714c58df478d64cf2f7e11a9c3622fed331ed937348d738170d7a1","observation_id":"191c8262-b90c-4e24-bd6d-88c7ebdf13a6","resolution":{"observed_at":"2026-08-08T19:17:40.109081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-08T19:17:39.573335Z","title":"Maskvit: Masked visual pre-training for video prediction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.573335Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:2334cde0df7932adeb49d0333880bc9b60b40837288647e15fe35bfb3ea0ab50","observation_id":"f230e108-8784-43cc-9750-f5125c4111f8","resolution":{"observed_at":"2026-08-08T19:17:39.573335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.819638Z","title":"Memory- augmented dense predictive coding for video representa- tion learning","venue":null,"work_id":"d306c675-5d4f-48c9-a747-79ab4be933f4","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.577840Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:a123b123531d3ce047abbb1d66f7b3e7aec0bd5756c40e724711e30b1f8b08fd","observation_id":"43e74f4b-1dca-4739-924b-b2392e12b043","resolution":{"observed_at":"2026-08-08T19:17:40.823654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.809095Z","title":"Self- supervised co-training for video representation learning","venue":null,"work_id":"5b45c274-7bb7-49d9-a2f3-c81c645cbc71","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.581200Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:d929ca2a0802b2cd3a0f283f981a2f45e3df59c1e8d79049a872b724747f3127","observation_id":"3d180f1e-242b-40fb-ac7a-1ba0012db08a","resolution":{"observed_at":"2026-08-08T19:17:40.813186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.798901Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":"aa339a3d-3c79-4838-9092-598741429f5f","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.584842Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:4a66b10499c4c8a54bcefc43c96957e13a73273eaaa20b254f5d8f5075fca338","observation_id":"85459afd-c541-4341-82f4-2a7c78a58e0a","resolution":{"observed_at":"2026-08-08T19:17:40.802759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.787347Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":"4c8a616e-1560-43b0-8052-840e68cf2a09","year":2022},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.588393Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:72cc46d13d99123746b6e4e922c11fe205e40ceeb80ce8b3da570061f900e2e7","observation_id":"04165458-3c61-40e2-a83c-6295736d3104","resolution":{"observed_at":"2026-08-08T19:17:40.791735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.776855Z","title":"Human gaze control during real-world scene perception","venue":null,"work_id":"dd259bf1-a53c-49b3-b1d3-711d7780d9cc","year":2003},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.591639Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:cc512bb1ff1d175ebbdfd3c57c0f2c7a81baa0b86a5c82e82cdeb20d947bfac0","observation_id":"0de94c77-96c4-45f6-9dbf-983a67480395","resolution":{"observed_at":"2026-08-08T19:17:40.780607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12001","last_updated":"2024-10-02T21:58:04Z","snapshot_observed_at":"2026-07-06T15:06:15.576863Z","submitted_at":"2023-03-21T16:33:40Z","title":"ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders","version":3},"cited_work":{"arxiv_id":"2303.12001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.12001","snapshot_observed_at":"2026-08-08T19:17:40.082731Z","title":"ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders","venue":"cs.CV","work_id":"b87590f5-fa7d-42a2-97a2-019fc63f10cf","year":2023},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.594919Z"},"links":{"cited_paper":"/paper/2303.12001","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:1d362bcd637c6c6a8265fb8bbe4b7eec24f3190ee448d5b546d75a626631cc24","observation_id":"68eaaf99-ec76-43fc-a872-bc7721e897d7","resolution":{"observed_at":"2026-08-08T19:17:40.087326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.766863Z","title":"Augment your batch: Improv- ing generalization through instance repetition","venue":null,"work_id":"4b80db1f-c27c-47ff-9a2c-25efde574c1d","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.598583Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:6c9b3851d2ebe62bf1ff5ce47dad791c77beee0ab4945fdb0a7c562ab5247bc6","observation_id":"f3fe09b1-b083-491d-bedb-dc09a8ea5e3a","resolution":{"observed_at":"2026-08-08T19:17:40.770627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.757330Z","title":"Contrast and order representa- tions for video self-supervised learning","venue":null,"work_id":"c3b4bba2-c81b-4bcc-9a71-c4eacebbb484","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.601608Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:796a122aa94201026cf5650fa72738d89ef0adffcf457f58cd29cca3e88e4145","observation_id":"b906e515-298f-40f0-bbf5-b0ce88e3aab6","resolution":{"observed_at":"2026-08-08T19:17:40.761185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.746446Z","title":"Mgmae: Motion guided masking for video masked autoencoding","venue":null,"work_id":"853df96a-205e-4c6a-857e-946ba6e2e82c","year":2023},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.605271Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:ced50557d0be1878d07ce3f5008a66cf29ac44f6a591d92329b560da4e6d1759","observation_id":"6e6c79f1-2abf-4621-b7f9-5d30f07241d9","resolution":{"observed_at":"2026-08-08T19:17:40.750253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.735534Z","title":"Self-supervised video representation learn- ing by context and motion decoupling","venue":null,"work_id":"85d54da5-3849-4d24-ab0a-644af1fe20fb","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.608840Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:9161241bf6fdded1856e4bbf81be0746ce0a6d08829692f2a1ecb6773c839dec","observation_id":"fe7d86f1-dd41-43b5-a621-217655a7b909","resolution":{"observed_at":"2026-08-08T19:17:40.739266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06178","last_updated":"2022-03-17T15:14:37Z","snapshot_observed_at":"2026-08-08T23:32:04.925234Z","submitted_at":"2021-10-12T17:25:07Z","title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06178","snapshot_observed_at":"2026-08-08T19:17:39.612598Z","title":"Tada! temporally-adaptive convolutions for video understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.612598Z"},"links":{"cited_paper":"/paper/2110.06178","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:8f86a0194386ebb9a1edde6af11f578a29bfcebf81f0a857b3ca3f9f576ee286","observation_id":"738c14af-7d8d-4dc7-b1ec-4b44aeab3eed","resolution":{"observed_at":"2026-08-08T19:17:39.612598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.11387","last_updated":"2019-04-04T02:51:59Z","snapshot_observed_at":"2026-07-06T07:17:31.201039Z","submitted_at":"2018-11-28T05:04:34Z","title":"Self-Supervised Spatiotemporal Feature Learning via Video Rotation Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.11387","snapshot_observed_at":"2026-08-08T19:17:39.616909Z","title":"Self-supervised spatiotemporal feature learn- ing via video rotation prediction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.616909Z"},"links":{"cited_paper":"/paper/1811.11387","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:bc3e06e33a96543e42210b2bbb7cb7becb198c66f33e6c012b32625bb35d81d7","observation_id":"871e1068-622d-4070-998b-01da2f9af763","resolution":{"observed_at":"2026-08-08T19:17:39.616909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.725940Z","title":"Hard negative mixing for contrastive learning","venue":null,"work_id":"e304febe-e9fd-4c51-8684-970cbfdc8d1b","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.621618Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:1b2418ee308bf303990b31c7219473aac72c3c609c5b301db78d10564a9feb61","observation_id":"4cc14dd9-12dc-4812-83e2-50e587072d44","resolution":{"observed_at":"2026-08-08T19:17:40.729598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.716619Z","title":"Deep visual-semantic alignments for generating image descriptions","venue":null,"work_id":"b459914f-cdc6-4c8a-9f77-9227fa9f5a76","year":2015},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.625420Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:6d859c9199bbe9ee8d1154e56dce61d18b17a4ddcb92ebeae218a83911eb711e","observation_id":"d283f6db-8757-4960-b160-66b335ad927e","resolution":{"observed_at":"2026-08-08T19:17:40.719841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-08T19:17:39.629499Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.629499Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:bbdaa821625fcbbca4d090e306fc940f07f2f25e5e68aca4b7dd3ebf9ac5e889","observation_id":"c873d323-5d1e-45bd-805a-8dcc16c1fcc4","resolution":{"observed_at":"2026-08-08T19:17:39.629499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.707794Z","title":"Fusion attention for action recognition: Integrating sparse-dense and global at- tention for video action recognition","venue":null,"work_id":"35defcc9-82f6-4008-918d-a7a25696b190","year":null},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.634738Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:a9d771d2b4acd59a70302e16f3c2db298e623d527e1c38a8c9122de6e2cb0a57","observation_id":"5baf0a28-b25a-4b8c-9b71-3cfbecb9a128","resolution":{"observed_at":"2026-08-08T19:17:40.711257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.698214Z","title":"Co- operative learning of audio and video models from self- supervised synchronization","venue":null,"work_id":"c992a4e3-97d1-4c61-8003-81b9833fdf30","year":2018},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.641055Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:3c3c8541a6672600268c476b29694c5e1a739727b039592226f37a53a859b7e6","observation_id":"9813b497-3a07-4597-a37d-0bf3bf129886","resolution":{"observed_at":"2026-08-08T19:17:40.701974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.688756Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":"e50d5417-2c46-4de3-a5dd-d646d2c8e08f","year":2011},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.645261Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:8915c941530c74694ea2e506215b7cd16a92e825527e7f0003f90db9bca984fd","observation_id":"500f507f-515d-4222-b5a5-7434d5fd9663","resolution":{"observed_at":"2026-08-08T19:17:40.692379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.678487Z","title":"A large-scale analysis on self- supervised video representation learning","venue":null,"work_id":"ad08eec3-97f6-4a41-9f23-0e39c2dbc5bb","year":2023},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.649317Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:89f6a10e8b207bf4aa17cdab0718931ca3591724fee3723910e18a2e49f2866b","observation_id":"7e6406a4-b4dd-4641-9d63-875b5c9f1d29","resolution":{"observed_at":"2026-08-08T19:17:40.682078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.667849Z","title":"Semmae: Semantic-guided masking for learning masked autoencoders","venue":null,"work_id":"4aa04a87-2322-4c5f-b3ce-774aa19d4cf5","year":null},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.653578Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:bd4fe7d9261a71bdfd85992edd55c3c22995b7a17369196bfb28d623d437bb93","observation_id":"0799014a-b89c-478a-a0c5-1b1021f610dc","resolution":{"observed_at":"2026-08-08T19:17:40.671868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.658086Z","title":"Improve unsuper- vised pretraining for few-label transfer","venue":null,"work_id":"e72e2f12-c2fc-4b8b-85ce-7755a221433a","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.657779Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:841c09f1fef50f5b7e1515d10de089f71e416d1543297537eabfa6efc004a38a","observation_id":"4bd49512-7c46-4fb3-b6b2-8f2c829f6e61","resolution":{"observed_at":"2026-08-08T19:17:40.661450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.05691","last_updated":"2021-01-28T01:43:34Z","snapshot_observed_at":"2026-08-08T10:59:14.586972Z","submitted_at":"2020-01-16T08:28:57Z","title":"Learning Spatiotemporal Features via Video and Text Pair Discrimination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.05691","snapshot_observed_at":"2026-08-08T19:17:39.665769Z","title":"Learning spatiotemporal fea- tures via video and text pair discrimination","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.665769Z"},"links":{"cited_paper":"/paper/2001.05691","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:88fb59e41bb2ae158e54824d4c1c409b639747a0ed453fb405008c52af609007","observation_id":"b6fa720b-5e50-44cb-8783-ce9ae101ed0f","resolution":{"observed_at":"2026-08-08T19:17:39.665769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.647116Z","title":"Tsm: Temporal shift module for efficient video understanding","venue":null,"work_id":"ff96ae2a-ea29-4ce4-a7c0-4adcb1a67f86","year":2019},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.670766Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:f16eac32a34f6f3d4bbadbe970df02d795f3c9b84815a9876179ebf0a4c21cb5","observation_id":"dd473744-3a29-415c-9c46-0d7152670e70","resolution":{"observed_at":"2026-08-08T19:17:40.650601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.636789Z","title":"Self-supervised video-based action recognition with distur- bances","venue":null,"work_id":"37e30ba8-893b-4d86-9fe9-f353893b9c95","year":2023},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.674852Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:8a91e3a5a3daaa0743f2ce4c6475d8f57d1b10863cd2ad778124c2111ac1f5be","observation_id":"b0003748-d48d-4714-b611-efbcedd98d0b","resolution":{"observed_at":"2026-08-08T19:17:40.640547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09057","last_updated":"2024-01-17T08:46:47Z","snapshot_observed_at":"2026-08-03T02:10:50.291388Z","submitted_at":"2024-01-17T08:46:47Z","title":"CrossVideo: Self-supervised Cross-modal Contrastive Learning for Point Cloud Video Understanding","version":1},"cited_work":{"arxiv_id":"2401.09057","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09057","snapshot_observed_at":"2026-08-08T19:17:40.021939Z","title":"CrossVideo: Self-supervised Cross-modal Contrastive Learning for Point Cloud Video Understanding","venue":"cs.CV","work_id":"5f26e76d-e56a-45ca-a8bd-0846bbcc32a0","year":2024},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.679785Z"},"links":{"cited_paper":"/paper/2401.09057","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:2ef4b22df1382f82f9746e66327baae448333804ee4f4bd0d6e44e10302315ba","observation_id":"5d93b97f-445d-4dba-83ad-edd6c0a371c7","resolution":{"observed_at":"2026-08-08T19:17:40.026614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.625279Z","title":"Teinet: Towards an efficient architecture for video recognition","venue":null,"work_id":"5444b3c1-b807-43f7-a2c0-268cdc06713c","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.683826Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:561b51c9444eca073485b39ad6813d8f5381b88f4b0bc13d53b42a34b9a05ea7","observation_id":"f63ef84d-b5e8-45f5-84ff-585c00b310ff","resolution":{"observed_at":"2026-08-08T19:17:40.629344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.614336Z","title":"Tam: Temporal adaptive module for video recog- nition","venue":null,"work_id":"1a0821f8-23df-44bc-8a4c-6d25b4b27361","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.687932Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:1189b3e0a17fdd477c959382f1ff05dfad30487afee62ae9305641f787c17377","observation_id":"792fa445-64f4-4b00-8df2-15369d8e8ddd","resolution":{"observed_at":"2026-08-08T19:17:40.618146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.603702Z","title":"Video swin transformer","venue":null,"work_id":"75f3314a-2208-4f15-b681-41a5596c196d","year":2022},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.692108Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:c93a3aa4b9725b18dc0990c2b6460aec88c32bb31a3c417408a680e2c8a4f9c0","observation_id":"03ae3348-07ab-4823-9671-0e5c13c61487","resolution":{"observed_at":"2026-08-08T19:17:40.606934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-08T19:17:39.696217Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.696217Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:65447a6f9709f071e58ab6dd4ffdf1646a36e3bad20608a4b4bebfdfe78f49ab","observation_id":"4ad99798-c765-4d09-ba86-c350fc00c566","resolution":{"observed_at":"2026-08-08T19:17:39.696217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.593401Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"2e9ad170-4150-42fd-b02b-c997f3fc643f","year":2019},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.700346Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:0ce5b1330621178734517a6b7f016ec7b581ca52a98cef6cd1b6c7abfb16b992","observation_id":"9d1f7e83-dfba-417d-abda-a809af85e874","resolution":{"observed_at":"2026-08-08T19:17:40.597155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.06018","last_updated":"2023-01-15T05:07:41Z","snapshot_observed_at":"2026-08-05T17:09:13.813190Z","submitted_at":"2023-01-15T05:07:41Z","title":"CMAE-V: Contrastive Masked Autoencoders for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2301.06018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.06018","snapshot_observed_at":"2026-08-08T19:17:39.986870Z","title":"CMAE-V: Contrastive Masked Autoencoders for Video Action Recognition","venue":"cs.CV","work_id":"eff3fe01-98bc-4fba-a1f4-eef29247130b","year":2023},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.703294Z"},"links":{"cited_paper":"/paper/2301.06018","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:5a4e7e9448eb7c6ba67b2f8ae4672eab94600883aad3ece8f023de78b0f7e14f","observation_id":"fbe91960-dfe9-40cf-9114-eba79172bcb1","resolution":{"observed_at":"2026-08-08T19:17:39.991655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.582682Z","title":"12-in-1: Multi-task vision and language representation learning","venue":null,"work_id":"792e3686-dd72-4ffd-aa5a-ffd45827e46d","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.707292Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:216154d2cc0b7800b6b88a456a3c34eaf46eb977d3a0d7c8e733b23d028d8bfe","observation_id":"e280b4a2-9b2c-4658-ac55-94cd84302cda","resolution":{"observed_at":"2026-08-08T19:17:40.586283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.571586Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":"c83140b3-0a6f-4fcb-a8fa-d06a688f4681","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.711733Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:808de7eb56beababc3ca82003f45a93e23cbfa9592f9032cc26d8434de315e97","observation_id":"c2c981d9-c97d-41a6-96a6-d97c93d2512d","resolution":{"observed_at":"2026-08-08T19:17:40.575610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.558865Z","title":"Self-supervised learning of pretext-invariant representations","venue":null,"work_id":"b1bda905-971c-4274-84c0-550b4d23e9a6","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.715441Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:f94d6752fe167efe6cf183314cdc9775f38e0121729ee80c01fdc76b576c9c0e","observation_id":"084a12c4-3429-471b-bfa8-7986637c7087","resolution":{"observed_at":"2026-08-08T19:17:40.563057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.547708Z","title":"Shuffle and learn: unsupervised learning using temporal order verification","venue":null,"work_id":"34a10da4-5656-472e-93ce-b7a8fe5b1524","year":2016},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.719271Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:a8386321fd68a1f9b19585c9043244766c5c2b7ee96a1fccda46e0899430e333","observation_id":"13389bba-7981-4c78-ab3a-5b9f71333ee5","resolution":{"observed_at":"2026-08-08T19:17:40.551556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.535182Z","title":"Ro- bust audio-visual instance discrimination","venue":null,"work_id":"7875d69f-4243-4c7f-8895-4e3b21a37cbc","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.722912Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:9f2085316e8a5811a2cf5fbe3c7da855091e5ad710428c324ddb63c8a5d6be9f","observation_id":"72dca34f-316f-4a03-b152-e32f1f507d0d","resolution":{"observed_at":"2026-08-08T19:17:40.539755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.523508Z","title":"Audio-visual instance discrimination with cross-modal agreement","venue":null,"work_id":"25e8c72f-c5a5-4146-9956-e01cde7cbeb0","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.726729Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:d9c6fbcd81ec3c50ee55faf239ddfa83c6ade5c7073cf4a4a06be9571a38fa35","observation_id":"8b33199a-aaee-47d7-a634-907428509832","resolution":{"observed_at":"2026-08-08T19:17:40.527661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:39.730563Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.730563Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:68c43ec58b10af6c868398a5814416adf675afac18e0e9d41dddba10ee704121","observation_id":"7c5b6ad5-ee64-4192-b19c-21661f1d02e8","resolution":{"observed_at":"2026-08-08T19:17:39.730563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.502537Z","title":"Videomoco: Contrastive video representation learning with temporally adversarial examples","venue":null,"work_id":"da29ed62-bcbe-4970-b56d-598cdf143335","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.733882Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:667a4d6374de21438cac33a221df052a0980d6057ce969378946a0a079271b83","observation_id":"c739f4a5-045d-40b1-9468-201f92560579","resolution":{"observed_at":"2026-08-08T19:17:40.505976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.491484Z","title":"Multi-modal self-supervision from generalized data transformations","venue":null,"work_id":"6ed270d9-7267-4a20-a6ad-84e696744684","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.737476Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:fee0d61147f0d0eaf866c64460bb326e53b7ebc41b2dde79e9cab52f9f9abe76","observation_id":"a7a40403-6a6d-4c2e-8fdf-d059a87425f1","resolution":{"observed_at":"2026-08-08T19:17:40.496205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.480600Z","title":"Keeping your eye on the ball: Trajectory attention in video transformers","venue":null,"work_id":"cbcf5e10-7db6-4a6e-bfcc-8e1b307ad684","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.742292Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:6525321c753e92e5a7e8e8e3c9df061a7d284d3d56190f41ba22f1013219235e","observation_id":"7cb4e5ca-9546-4928-ba59-a484f56495c9","resolution":{"observed_at":"2026-08-08T19:17:40.484561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.469468Z","title":"Evolving losses for unsupervised video representation learning","venue":null,"work_id":"89ef8e62-c10b-4a11-88fa-4e0bfa48fab1","year":null},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.745476Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:fec48cfcac5ad72f876fefa11fa9ced3ec424675d908b1e8670308b6b86e63a4","observation_id":"59e4f32a-76b0-4639-861e-d44248bd2633","resolution":{"observed_at":"2026-08-08T19:17:40.473778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.455243Z","title":"Spa- tiotemporal contrastive video representation learning","venue":null,"work_id":"f1574f32-8460-4539-83f2-572741f062e0","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.749310Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:d322ad12cd8cf4a6563a01dc932b43437bd1f394afd0fd2f66cf00fdc428a88c","observation_id":"b3be13be-da0b-4586-bcdd-c7d238515bd0","resolution":{"observed_at":"2026-08-08T19:17:40.459220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.440861Z","title":"Learning from untrimmed videos: Self-supervised video representation learning with hierarchical consistency","venue":null,"work_id":"f6b28ec8-e49b-4ecf-9240-b21008fa01d8","year":2022},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.752423Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:77715064b539621899e1249f0ddb754f221057b87a38a8458599970a823e3e8c","observation_id":"2e6d248a-812e-4f05-b38a-3b4fec0a1a50","resolution":{"observed_at":"2026-08-08T19:17:40.445236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.428563Z","title":"Mar: Masked autoencoders for efficient action recognition","venue":null,"work_id":"6e1a4986-9314-4674-b2c9-97b28a0a4b9c","year":2023},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.755665Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:628b7b277ce5ab4a7d5178dfdbfe258b046ea2c23486e4e0ee795f24e1ef3852","observation_id":"d8fa6935-4bef-4384-aef3-57926f397d74","resolution":{"observed_at":"2026-08-08T19:17:40.432594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.414967Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"9462eae3-dcfe-436c-94f6-84216c5aaccb","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.759382Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:171ab559b619215a4b7f7916829704a135af237a46759726d47938e44e1df467","observation_id":"05e5e519-21f4-40e6-a1a8-789046110996","resolution":{"observed_at":"2026-08-08T19:17:40.420141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.402316Z","title":"Self-supervised video transformer","venue":null,"work_id":"42f882d1-b6e3-4542-8ebb-47149c7a58a1","year":2022},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.762718Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:66d3058c6642164eab5bf0ecc888106ae94110ae8e747726618b6208131f06cb","observation_id":"adf4fcdb-1454-4f16-acf8-4b9dca135e39","resolution":{"observed_at":"2026-08-08T19:17:40.405711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.390239Z","title":"The development of visual attention and the brain","venue":null,"work_id":"da0e9c1c-563d-4c4b-93c6-6ac6126528fc","year":2003},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.766117Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:527b3189f9594d0f0144fb4b037ca872542310aa8e04fb620a51cae6a5c8a97e","observation_id":"f272e378-e5b7-42cc-ba3c-20e64d8078f4","resolution":{"observed_at":"2026-08-08T19:17:40.394787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.377913Z","title":"Im- agenet large scale visual recognition challenge","venue":null,"work_id":"4ac5dafd-18d3-4538-bf94-abfa16dadc9b","year":2015},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.769664Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:dceec3e0bce29a055b58d0af9946e1b76b5e96e8dbd76271bab32478b16471dd","observation_id":"ac81765d-19a8-4a6f-82ed-ebc0f7a27dd9","resolution":{"observed_at":"2026-08-08T19:17:40.382306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.365942Z","title":"Learning visual representations with caption annotations","venue":null,"work_id":"8ca6f910-e061-432e-a87d-ccb618e8d4f9","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.773677Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:6f4dc6d17fb7a3026f6cda416460f3da039872b858be848f87a8964dca511143","observation_id":"aacb1bdb-4c33-43d1-8c50-b1e8c18e2730","resolution":{"observed_at":"2026-08-08T19:17:40.370700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.354843Z","title":"Two-stream con- volutional networks for action recognition in videos","venue":null,"work_id":"7dd34023-cf32-4fff-bea5-a0edd8f3808b","year":2014},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.777062Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:e4da61b9bda7ed84a187b0404ac5dd6a2a457ff3733387c1b917b2efc34b5c16","observation_id":"57cc4b17-a994-4024-b402-77c003c9f91a","resolution":{"observed_at":"2026-08-08T19:17:40.359348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-08T19:17:39.780236Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.780236Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:57ec9a5a14176e182ee8d0080b3cc83a8f039ecfffadba1e0340c534fa79fddd","observation_id":"c2bb9469-7334-4d1b-bdfe-745d0885e127","resolution":{"observed_at":"2026-08-08T19:17:39.780236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.343333Z","title":"Masked motion encoding for self-supervised video representation learning","venue":null,"work_id":"589b5497-f6a8-41e5-9166-368e8827fbc9","year":2023},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.783726Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:1b52cc52bb763394cee1379df91dee054d7f189f215e1bc39c4c67af0add9d2d","observation_id":"0cf22c64-cdd8-4834-9d4f-d56f4bd303b9","resolution":{"observed_at":"2026-08-08T19:17:40.347994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.331578Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":"cc5b2836-6225-4d2a-8e19-f350f60da1f3","year":2016},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.787937Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:c580b6c7babc6e7b6b1e10d30a452d14ca856c2e8caa66fa291efedb79c8874e","observation_id":"45d830d2-4e75-4bdc-a2a2-8feb0d6a47a2","resolution":{"observed_at":"2026-08-08T19:17:40.335542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11250","last_updated":"2021-06-21T16:48:19Z","snapshot_observed_at":"2026-08-06T20:27:48.357708Z","submitted_at":"2021-06-21T16:48:19Z","title":"VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11250","snapshot_observed_at":"2026-08-08T19:17:39.791309Z","title":"Vimpac: Video pre-training via masked token prediction and con- trastive learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.791309Z"},"links":{"cited_paper":"/paper/2106.11250","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:8db3d4289645a76e8429a4189523b3914cefc1e952c08ee50c652d7f558ed74b","observation_id":"090a7cd6-6cc6-48d3-9c96-edda12c8ba7e","resolution":{"observed_at":"2026-08-08T19:17:39.791309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.319943Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"fb45b16a-adad-48a5-9eba-6fedf9ec7374","year":2022},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.794882Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:ab19a27555320f4039d3d781eeafcadac3b124f2273a2c164000e22a8df3039f","observation_id":"33997c7c-e833-473b-8077-43da076bacfd","resolution":{"observed_at":"2026-08-08T19:17:40.324599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.309696Z","title":"Learning spatiotemporal fea- tures with 3d convolutional networks","venue":null,"work_id":"bb9765c7-bb3d-4b8d-9c0b-ef0385fc8910","year":2015},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.798379Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:4dae0c7e1cdae35e486c4469740618927a5f001cc31d1a8d3bc5e90b516d7480","observation_id":"ec8c52c4-5395-4d2d-80de-931e41f183ef","resolution":{"observed_at":"2026-08-08T19:17:40.313412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.299148Z","title":"Video classification with channel-separated convolutional networks","venue":null,"work_id":"3cc40b09-b7bd-4448-9c93-e12793de6512","year":2019},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.801539Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:b106a9ef957873df5a466105475a3c8f298579cb25b7a634a7decab69df78acb","observation_id":"40feb0f8-378a-4761-a06b-4345b2024495","resolution":{"observed_at":"2026-08-08T19:17:40.303081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.288649Z","title":"Spa- tiotemporal integration and object perception in infancy: Perceiving unity versus form","venue":null,"work_id":"6c83f6f4-73f3-4be9-9965-a04a295412d0","year":1996},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.804641Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:01c0c0c054b0635dc2385ba5edd8ee56a4dc2c045ff157e70643e1a866af87f9","observation_id":"1a1311ce-37c9-4453-ac70-7e0d9043c430","resolution":{"observed_at":"2026-08-08T19:17:40.292395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.277688Z","title":"Generating videos with scene dynamics","venue":null,"work_id":"a02c5d60-1a03-44a9-aeec-bd03ade96648","year":2016},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.807748Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:a545e7c288a1d13fa0bfa9edecab32a9ef691c20487777d2e6edcfd0d6148b03","observation_id":"a09874af-8021-4a54-9bc8-254dfdd7e0a9","resolution":{"observed_at":"2026-08-08T19:17:40.281255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.266826Z","title":"Unsupervised visual rep- resentation learning by tracking patches in video","venue":null,"work_id":"6ac34fa0-f14d-4768-9421-e5fb72968f20","year":2021},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.810778Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:8966b42b338faf4315584a63007812f729aa929c2bd9ee491781fe8b22fb2335","observation_id":"4c8b68c1-5415-4cc2-ad1b-714acea31bb0","resolution":{"observed_at":"2026-08-08T19:17:40.270594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.255824Z","title":"Self- supervised video representation learning by pace predic- tion","venue":null,"work_id":"194c4a96-1fb1-4f9b-8f68-e59b4f4b66b7","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.814884Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:58201c0d1ad597f327223c57c74ccf4ad23eed3b415f1b7499a4b399966910eb","observation_id":"1dc366f0-d074-4d3d-8f04-608407d27283","resolution":{"observed_at":"2026-08-08T19:17:40.259895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02129","last_updated":"2020-08-05T13:36:59Z","snapshot_observed_at":"2026-07-06T09:44:45.734730Z","submitted_at":"2020-08-05T13:36:59Z","title":"Self-supervised Temporal Discriminative Learning for Video Representation Learning","version":1},"cited_work":{"arxiv_id":"2008.02129","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.02129","snapshot_observed_at":"2026-08-08T19:17:39.944284Z","title":"Self-supervised Temporal Discriminative Learning for Video Representation Learning","venue":"cs.CV","work_id":"96fdb59b-a14d-40f0-9707-2dd6ef18c088","year":2020},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.818340Z"},"links":{"cited_paper":"/paper/2008.02129","citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:aa02e0375efc34d59e64996b3d1e973f3d9831273514fea8d715a252748cf41d","observation_id":"ccc4a9ca-1992-4714-8caf-4a8ddcac3375","resolution":{"observed_at":"2026-08-08T19:17:39.950848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.245442Z","title":"Temporal segment networks for action recognition in videos","venue":null,"work_id":"63493c4e-7bfd-48e6-88eb-64d200f39438","year":2018},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.822225Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:f9511b4c3ac5662ddc428ebe5968d940e5e0303db93014ae2ac660926da3c80f","observation_id":"d6d43169-c1ea-4ac8-9025-d1a943d08a96","resolution":{"observed_at":"2026-08-08T19:17:40.249145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.235555Z","title":"Tdn: Temporal difference networks for efficient action recog- nition","venue":null,"work_id":"ee18001d-6110-4ef9-afae-8498ca422e86","year":1904},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.825930Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:eacf722f2e91029895a677a3fbc5d25d331a5540f07fe503a48aaf0b5735fc0e","observation_id":"3aa3cc15-d187-430b-8e3b-d61f85b8e5b8","resolution":{"observed_at":"2026-08-08T19:17:40.239461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:17:40.225369Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"6feda6af-31f0-4066-b4a9-e76706a4c59a","year":2023},"citing_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T19:17:39.829689Z"},"links":{"citing_paper":"/paper/2502.07811"},"observation_digest":"sha256:810bf0c62bb3ec3d845235e7f6abdc738b45ee970a2c0474c7675e2ce22d6645","observation_id":"6e06deb0-1d76-4d4b-9eae-ce9c0bfb6918","resolution":{"observed_at":"2026-08-08T19:17:40.229038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T19:11:38.138807Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":5,"verified_fuzzy":54},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 1 inbound Pith citation observation for arXiv:2502.07811."}