{"as_of":"2026-08-18T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24ab7ce98161632bc5bfe0f23915cf2b679cbbf482a86abb657410707b80a9ef","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:49:24.574574Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12270/citation-record","integrity":"/paper/2411.12270/integrity","json":"/paper/2411.12270/citation-record.json","paper":"/paper/2411.12270"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.193398Z","title":"Model selection and multi- model inference","venue":null,"work_id":"f5b8d97d-ec63-4b5c-b9ac-704d24939d1f","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.365364Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:500470a91b62905ec79609aac0791f49b59b015cb60c1f43026d354649a2463c","observation_id":"03170bb8-772a-4245-9522-a02ed23ddedf","resolution":{"observed_at":"2026-08-12T17:49:25.197918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.183632Z","title":"Adamae: Adaptive masking for efficient spatiotempo- ral learning with masked autoencoders","venue":null,"work_id":"2bdbc60e-8628-4535-b219-78bdd76bd717","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.369049Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:17a74bbd83b4cf3a44cc9798de71b3763b5aafdd41162446d025ce51d164b667","observation_id":"66c07592-1931-45ba-a0bb-4d7262b22c1b","resolution":{"observed_at":"2026-08-12T17:49:25.187233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.173069Z","title":"Self- supervised learning across domains","venue":null,"work_id":"5aaaffb2-90da-4fdf-83f7-f84ff51e1939","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.372767Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:da7172754c99c04ec779b5cb7120098435b9c3e4bd62eaaa20b292bee564de22","observation_id":"926a74d6-2076-4e59-a09e-470510af997b","resolution":{"observed_at":"2026-08-12T17:49:25.176797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03670","last_updated":"2022-02-09T18:33:57Z","snapshot_observed_at":"2026-08-16T17:22:55.292261Z","submitted_at":"2022-02-08T06:15:07Z","title":"How to Understand Masked Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03670","snapshot_observed_at":"2026-08-12T17:49:24.376251Z","title":"How to understand masked autoencoders","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.376251Z"},"links":{"cited_paper":"/paper/2202.03670","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:aa34954df047fc8a11dc1b3b4102347fecf4d8be032c18a7ff71f08f68e8becc","observation_id":"a3c5e7b1-6ace-4bee-8eab-cb5f4a8acb82","resolution":{"observed_at":"2026-08-12T17:49:24.376251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.379790Z","title":"Domain generalization by solving jigsaw puzzles","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.379790Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:e8c4fe1e9658bc5d7bc343ff309306b4912b5077e2c9550fc1826ef843a9476d","observation_id":"8b7012fd-9287-4eee-89a8-133c200af252","resolution":{"observed_at":"2026-08-12T17:49:24.379790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.157644Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"c27e631a-64cf-4c43-9935-fe739ea71f8e","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.383209Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:72476bd8efab6bc96cb4daef59be681035600a4c0febbc2972917637c5159156","observation_id":"0c6315da-8e48-49e0-94cb-02a875e4ed62","resolution":{"observed_at":"2026-08-12T17:49:25.161348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.147664Z","title":"Contrastive learning of global and local fea- tures for medical image segmentation with limited annota- tions","venue":null,"work_id":"50013edf-6274-444f-9be4-907072e3d212","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.386730Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:e8f5470a8dc1af2c53a11dc25f7a00c09fc27085f8c39eb18b320e2b5d48baa6","observation_id":"07b83363-99b9-495b-9842-5c780efbf9fa","resolution":{"observed_at":"2026-08-12T17:49:25.151309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.137354Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"a9242dde-c620-4f61-9bf4-53e5d9bfea45","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.389820Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:b646bf44ac1daff9f62556e33c74887ca35040aa3a87a6640e6432feaf3e2872","observation_id":"d9b73c4f-2236-49b7-8d63-d82dfdf9acb2","resolution":{"observed_at":"2026-08-12T17:49:25.141032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.127838Z","title":"Sdae: Self- distillated masked autoencoder","venue":null,"work_id":"78125911-d44a-42a3-a9a8-bfca6d2446f3","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.392634Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:b0bca72e4e2bec683a0c742ecb049601c85c457a41e8eec345c3813139ca354d","observation_id":"f3c29583-242f-4145-ac36-cf1b8b1c5a5c","resolution":{"observed_at":"2026-08-12T17:49:25.131449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.117823Z","title":"Similarity contrastive estima- tion for self-supervised soft contrastive learning","venue":null,"work_id":"6622281c-5a92-465c-8d26-6d642f552a74","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.395659Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:46359ee24cea9fbb49d5dd7499237b726877b8b8415373ac40e5c36f1a99df26","observation_id":"28a5c985-90ab-443a-8dae-48403f2ccc97","resolution":{"observed_at":"2026-08-12T17:49:25.121871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T17:49:24.398730Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.398730Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:48b0824ee19fd9d84cce580aca3e66aa014e3d07c9b043bc05fe19ac667e3abf","observation_id":"df1721c8-55a6-4010-b17e-ad521c68915c","resolution":{"observed_at":"2026-08-12T17:49:24.398730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.107230Z","title":"A large-scale study on unsupervised spatiotemporal representation learning","venue":null,"work_id":"e72071ec-8bc5-4185-a06a-4624855a9857","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.402137Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:00675fa80f422eda9bf5b53146b1ae175f0041925867f89ca55601cb388ee69e","observation_id":"a90e9fdb-9ce0-4fc4-8dc6-000f0e20f464","resolution":{"observed_at":"2026-08-12T17:49:25.111232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.405197Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.405197Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:c40104ded478e1de0b6f047d9be91a1ae63a80a8cde761996c9095f23d111f89","observation_id":"8fb3292b-3107-4fb3-9d4c-0f4a7a21e33b","resolution":{"observed_at":"2026-08-12T17:49:24.405197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.089752Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":"eaf55180-1734-4722-add4-a8ad1e3e9a44","year":2017},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.408836Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:98fd567f3bc0686206c0a60d643a1625f89de2b74b8addd11e3ae67761169b20","observation_id":"cfdc1542-1bb7-4cd4-aa14-d828fd3d0089","resolution":{"observed_at":"2026-08-12T17:49:25.093292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.079124Z","title":"Audiovisual masked autoencoders","venue":null,"work_id":"40f952b7-cfda-49b6-88ca-dac5b425065a","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.412244Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:6ce9298e868f6729e6fcfc1a903a74e26e3d8e044e40849a8d3966160bf0cbfa","observation_id":"3586966a-f4a4-4eff-ad1d-35b34c0449d6","resolution":{"observed_at":"2026-08-12T17:49:25.083130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-16T16:27:33.126113Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-12T17:49:24.415073Z","title":"Contrastive audio-visual masked autoencoder.arXiv preprint arXiv:2210.07839, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.415073Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:206cc7314065aa69367e013b4abe6d1f4b32b9bf0d626c841cfb77ab6d6bc387","observation_id":"2cb8e19a-25b3-495a-91d9-2549a660af15","resolution":{"observed_at":"2026-08-12T17:49:24.415073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.069533Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":"1c7dfc9e-3c33-4e4b-a245-52a61e0a853e","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.418022Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:e46f56f851cb6f9d949745b8addb2b9bacd72f5149bb633d7674f6e2bf7f495e","observation_id":"44df7519-8d68-4230-8d98-8bf9e36693e9","resolution":{"observed_at":"2026-08-12T17:49:25.072910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.058747Z","title":"Noise-contrastive estimation: A new estimation principle for unnormalized statistical models","venue":null,"work_id":"59f7a645-253a-42f9-8232-701a1d52bd2a","year":2010},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.420572Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:9c081520a0021e04d6cf8f9793dca7f0a21c8e5015814f9f6e88cf090b5ddfb3","observation_id":"b05b76d1-e43a-4dba-8402-ca1094acfd71","resolution":{"observed_at":"2026-08-12T17:49:25.062158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.049295Z","title":"Self- supervised co-training for video representation learning","venue":null,"work_id":"fd72b03f-8b18-45b5-b42c-7e9e88dd5bbb","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.423085Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:baed245c78db4fc5c300ddbb92f968c4eccade5996230c6511343743b2ca8f7d","observation_id":"5ccdfec7-c0dd-41fd-b090-eff61f466d9e","resolution":{"observed_at":"2026-08-12T17:49:25.052693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.039069Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"195363f6-46cc-4780-b2cd-1921444c95b2","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.426601Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:488b27905516f0281618a95ee4c8f635e40dea7703dd6a08a83121080ae98cd9","observation_id":"f4820904-9951-4bf5-b96a-efc8468aa179","resolution":{"observed_at":"2026-08-12T17:49:25.042592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.029323Z","title":"Mgmae: Motion guided masking for video masked autoencoding","venue":null,"work_id":"b8bd52b4-c1a4-4ad4-aeef-230b57e2a416","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.430057Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:aa18dda8231f2858a41580bc5a45e4eb17a851435bea2ed86387e99aaf920de2","observation_id":"6511cd3a-13f4-46e7-a9f3-4d0d74050c53","resolution":{"observed_at":"2026-08-12T17:49:25.032780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.019784Z","title":"Let there be color! joint end-to-end learning of global and local image priors for automatic image colorization with simulta- neous classification","venue":null,"work_id":"3a530eb2-303f-474e-b588-22196c58c8b6","year":2016},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.433294Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:42d3ceca2e710c01c5342c9133af967220a7b41f96b4e19d4c87ccf112b986a9","observation_id":"16af3633-fe5a-47ad-be8f-cd74be696603","resolution":{"observed_at":"2026-08-12T17:49:25.023353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.437173Z","title":"A survey on contrastive self-supervised learning.Technologies, 9(1):2,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.437173Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:3e7504f6870989ebeea8ef68a8077cb10fc5ba35fb0e2947bbcca291a2ecb39a","observation_id":"110d5e02-c323-42a0-b622-d1f6d2176ee1","resolution":{"observed_at":"2026-08-12T17:49:24.437173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-12T17:49:24.440680Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.440680Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:a1b18052918f4ac89e0a7164b161b756630352c94bb187aa1b3eb855c105ffe4","observation_id":"a8e4bc8d-fa97-404b-a061-e55d81f5015f","resolution":{"observed_at":"2026-08-12T17:49:24.440680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.002922Z","title":"Learning image representations by completing dam- aged jigsaw puzzles","venue":null,"work_id":"effc5a61-c182-4f53-80e8-1977d24ad590","year":2018},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.444176Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:6b8c4004b4d12957b978919fa6e2d5c26dabc008bd1b0fccae48bfda4a5cba86","observation_id":"16bdbbf0-063e-46d1-aa3f-5ae61e8620d1","resolution":{"observed_at":"2026-08-12T17:49:25.006298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.993332Z","title":"Temporally coherent embeddings for self-supervised video representation learning","venue":null,"work_id":"d52cda0d-a83a-4953-9f1c-8f979cee0736","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.447443Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:e3ddb50433ccc7f6652485ad50acf0ff3b7daeed8c16e05b9767cdb315cc13de","observation_id":"dc5e350a-f7ed-4ece-b53a-f5bbacafa182","resolution":{"observed_at":"2026-08-12T17:49:24.996843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.983683Z","title":"Self-supervised video similarity learning","venue":null,"work_id":"52db60f9-6e59-4eaf-90ed-cf6f2c0feab2","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.450570Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:c2a48fc7a58c1687220eaf01edd657e054e35dd406751710d480f24db345cbc1","observation_id":"11101b6c-0d95-4fef-8caf-50aa4ccfc0e0","resolution":{"observed_at":"2026-08-12T17:49:24.987404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.972900Z","title":"Learning representations for automatic colorization","venue":null,"work_id":"64efb3ba-f800-46a3-bb5d-b0811788c003","year":2016},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.453994Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:ab668bc3a26edfe01bc30700665ec85a6b7c9b04f72e43284538a286778ddf42","observation_id":"b5919228-f576-4dbc-bcb1-6c3c728a6955","resolution":{"observed_at":"2026-08-12T17:49:24.976585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.963190Z","title":"Colorization as a proxy task for visual understanding","venue":null,"work_id":"09317c4b-48d1-4117-8b14-ee00682a3650","year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.457214Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:8496df1eb8c10cfbae9ccada5116d1245dc5903167be4df575f79e5b36c13916","observation_id":"3a6db295-cf8e-44a1-ab10-b1bda27dc815","resolution":{"observed_at":"2026-08-12T17:49:24.967012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.953230Z","title":"Predicting what you already know helps: Provable self- supervised learning","venue":null,"work_id":"1fe1173f-946d-4014-adc3-35d4b8dccdf9","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.460827Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:48daaffe9983e9f14e085783387ccd54be064ea1092635406b9895c80ac9cbc5","observation_id":"7bc7ca20-13d8-4444-9d3b-4e39dedcc7c3","resolution":{"observed_at":"2026-08-12T17:49:24.956737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-08-17T18:55:29.627886Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-12T17:49:24.464193Z","title":"Pytorch distributed: Expe- riences on accelerating data parallel training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.464193Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:672dce5f9c786bd03ebbbc2ed924ec1c3eabee72670bb226c35eeaebe540907f","observation_id":"1f0bb04b-ac30-4c94-b96a-7a28c4a03f30","resolution":{"observed_at":"2026-08-12T17:49:24.464193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.943288Z","title":"Audio self-supervised learning: A survey","venue":null,"work_id":"2294a770-8736-4663-84b6-c9dd0b6aecbb","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.467724Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:a2b6f2c3568c5f28f98ae32cdc611ca03eae646a9e03110bc4da8c9d57dec937","observation_id":"8c39154f-13fe-4e9a-846a-95d9d3b77155","resolution":{"observed_at":"2026-08-12T17:49:24.947096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.932562Z","title":"Temporal contrastive pretrain- ing for video action recognition","venue":null,"work_id":"53eb203f-1078-440e-bc6a-3d4f8c53c8cb","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.470659Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:7853692cb1db1ae724ff27cda41da0e840afee66066fb90be7430e1e509140d1","observation_id":"83669153-11e7-4802-9e01-e75a1efb8629","resolution":{"observed_at":"2026-08-12T17:49:24.936030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.923553Z","title":"Learning word em- beddings efficiently with noise-contrastive estimation","venue":null,"work_id":"26a9303e-4acd-468e-9cd3-35b3da6a931a","year":2013},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.473524Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:8bc06f7bdd9fbfa50cc65d7908fa2c3a746a391d2c2d39061fd4121ef5b845af","observation_id":"5c479433-e04c-4f28-adb6-7096eba90b35","resolution":{"observed_at":"2026-08-12T17:49:24.926872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.914555Z","title":"Joint self-supervised image-volume representation learning with intra-inter con- trastive clustering","venue":null,"work_id":"da389fd3-642a-442a-a46c-ae287da7eec7","year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.476890Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:a91f0796fd36bab639fbb82512683a0dc23a5d3d285aee0f44078712dd19ee93","observation_id":"c24aa7dc-f589-4ed2-985b-0b464e57f385","resolution":{"observed_at":"2026-08-12T17:49:24.917670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.480305Z","title":"Unsupervised learning of visual representations by solving jigsaw puzzles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.480305Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:d7306d85c2e7de3545dd61d67903bc0325ed91a7d7fb034bac28565b97542ff7","observation_id":"b2f74a77-3d39-4ec2-b0db-3f38420e70ab","resolution":{"observed_at":"2026-08-12T17:49:24.480305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.899238Z","title":"Boosting self-supervised learning via knowledge transfer","venue":null,"work_id":"73fef1dd-2177-490c-9739-fb123f5a9c8e","year":2018},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.483691Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:dee105f445c03c0cff0167c0f783f45a8beda2ccaf3dd31822b67d335f3f7015","observation_id":"34ab244a-d33c-4086-bfc2-a04b3b6b9a1e","resolution":{"observed_at":"2026-08-12T17:49:24.902748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T17:49:24.486636Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.486636Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:7a9177ad980892a71a46e992c3b8a9b73d26595eb1b5d98b5f7ee70f775126f2","observation_id":"0908b06a-0ed4-4dff-bbba-2ebd52a208ef","resolution":{"observed_at":"2026-08-12T17:49:24.486636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.888616Z","title":"Spatiotempo- ral contrastive video representation learning","venue":null,"work_id":"b515a0c8-0b10-4003-9173-64862b4144d6","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.489809Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:3e48533e902c04dea7bf43dc37bebdf8dd343a1b1375f9790d5dadfb89bbe4ad","observation_id":"f124eb39-0b47-411e-bfee-fe841d277665","resolution":{"observed_at":"2026-08-12T17:49:24.892582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.879457Z","title":"Self-taught learning: transfer learning from unlabeled data","venue":null,"work_id":"f15d3623-9f9f-4bdb-bbf3-e53bba71ad8d","year":2007},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.492228Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:738d62a8495c58eb42a320e59d092f5514372d7ca390f32e98a3c4f18ba18925","observation_id":"f49b0ab1-245b-486c-afd2-d682594fc4c1","resolution":{"observed_at":"2026-08-12T17:49:24.882984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.870058Z","title":"Masked jigsaw puzzle: A versatile po- sition embedding for vision transformers","venue":null,"work_id":"a4c1e455-ad32-4998-82c4-2f645e238632","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.494862Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:79fd7f16444dee411dc7ced87e769b91e1517e74d5484e8b8b7a2ca0d0c219b8","observation_id":"ab1d1130-b99d-425a-a9ec-ee55f2cd78a5","resolution":{"observed_at":"2026-08-12T17:49:24.873437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.860466Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"940f082c-66a4-45bf-9ff2-776129fa1bf2","year":2015},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.497569Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:78109fff22467d2f38a33e38edc4768f6acbcd50dc8cb8ed88cba7461b18e191","observation_id":"e26ec018-ecac-489e-a88d-ed4678b6880f","resolution":{"observed_at":"2026-08-12T17:49:24.863782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.12959","last_updated":"2022-02-10T21:06:05Z","snapshot_observed_at":"2026-08-16T08:22:42.479717Z","submitted_at":"2020-08-29T10:53:55Z","title":"Puzzle-AE: Novelty Detection in Images through Solving Puzzles","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.12959","snapshot_observed_at":"2026-08-12T17:49:24.500247Z","title":"Puzzle- ae: Novelty detection in images through solving puzzles","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.500247Z"},"links":{"cited_paper":"/paper/2008.12959","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:82db8e69d5a0166176392f1320640a438294fd1abca434bb2d1ee3519f6634aa","observation_id":"c439b712-d32e-4b2b-86a3-7e44898e3ad2","resolution":{"observed_at":"2026-08-12T17:49:24.500247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.850798Z","title":"Self-supervised learning for videos: A survey","venue":null,"work_id":"52b726fd-7daa-49ea-9cea-819d4c60867b","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.503175Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:2d3a15dd84aca2ca9338d27418554b3888f0526800ec603d4465a4347a418184","observation_id":"8dbb85e4-9bca-43aa-88cd-2e7977d27b5a","resolution":{"observed_at":"2026-08-12T17:49:24.854115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.841502Z","title":"Unsupervised learning of video representations using lstms","venue":null,"work_id":"068b2dbf-8730-4254-b7b5-621413075731","year":2015},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.506560Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:932923306850451eeeb116b5e986b6a4924199b4e0978969b4071053a8aae28e","observation_id":"1638a70f-de83-4996-bc52-02a5db3f2997","resolution":{"observed_at":"2026-08-12T17:49:24.844886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.830926Z","title":"Self- supervised video representation learning using inter-intra contrastive framework","venue":null,"work_id":"8853621b-83a2-46de-b193-14d461899a0f","year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.509990Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:2c4aa7ab80e028098a8525e95365e5b907f095e1d779044c5bf52b5c3d5806e5","observation_id":"c88ec0dc-0f29-4b44-8c81-50712beacd5c","resolution":{"observed_at":"2026-08-12T17:49:24.834152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.822653Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"6953c703-38a2-4ea4-bc28-654c398013ff","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.513092Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:a0fda45e2a6269b93d8967914941f3b56e62c767616348edd8c45871f48bcc0a","observation_id":"d4ab85e5-1d50-4686-843f-ea01bf6a854c","resolution":{"observed_at":"2026-08-12T17:49:24.825399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.813618Z","title":"Mocogan: Decomposing motion and content for 10 video generation","venue":null,"work_id":"34e60c02-b1a7-4345-b11e-75efdff2b9de","year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.517021Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:8ae1594ef71a85603913bb0290159040a17e9e1e534b8083f41c8c4110dab5cb","observation_id":"15e69d7e-f07d-4382-b025-1b9936fb47f5","resolution":{"observed_at":"2026-08-12T17:49:24.817195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.520761Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.520761Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:4137aeb22059702202c1e67ef7915eaa2bee538ff977c317ee3383fa629b406c","observation_id":"75c070b1-bf83-48a6-af80-ebb08286e8f7","resolution":{"observed_at":"2026-08-12T17:49:24.520761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.798741Z","title":"Generating videos with scene dynamics","venue":null,"work_id":"7282a1f3-1872-40b3-8c8c-dafba6efe909","year":2016},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.523822Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:65fc91a8ec11a8590c4ba9a7a01ecd4935f3dc878b9d7a0712102a738dfd7dcc","observation_id":"b73dbf01-6530-430d-adf0-fcc3ec6cb10c","resolution":{"observed_at":"2026-08-12T17:49:24.802349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.788994Z","title":"Video anomaly detection by solving decoupled spatio-temporal jigsaw puzzles","venue":null,"work_id":"55b8d667-97e0-40cf-b78d-ed7a3e92f058","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.526894Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:38587548817f41138bd2f9d24b1fe1b6be4496500e8494f3389a18447bcfaa84","observation_id":"81e9237a-83dd-44ad-96ed-4bb4e3364508","resolution":{"observed_at":"2026-08-12T17:49:24.792414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.779719Z","title":"Enhancing unsupervised video representation learning by decoupling the scene and the motion","venue":null,"work_id":"e863c7f7-a3b5-435f-a43c-99909b70394a","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.530430Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:1371ef920efdbfeb9dee71a7855b690bcf1aaf7acaf30293f889488a8286abe6","observation_id":"34d500e7-a3d5-4f61-a3b8-303d2b698cf2","resolution":{"observed_at":"2026-08-12T17:49:24.783079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.769836Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"26bc290e-80da-4732-ba8a-58ef10975c6c","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.534417Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:0d950200befe82afe49b2ed5fb97673482d1495a5f7fc3c367392b17f4c51a8f","observation_id":"4f8ad67e-6ec1-4a14-9c5b-260517cc9526","resolution":{"observed_at":"2026-08-12T17:49:24.773678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.759235Z","title":"Knowledge distillation and student-teacher learning for visual intelligence: A review and new outlooks","venue":null,"work_id":"1c03abed-75aa-4921-8a95-3d3f991d3ab9","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.537871Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:e0e98e12a01b5a1f20baa427dd7117d4095dc0c1b12a0af817934ad32a44a5f5","observation_id":"6f8bd629-e89e-48d0-9f16-8d22b73023f4","resolution":{"observed_at":"2026-08-12T17:49:24.763431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.750380Z","title":"Bevt: Bert pretraining of video transformers","venue":null,"work_id":"bf234a3a-16e1-4269-acb9-81aa48a5bc3f","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.540840Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:a8b40541ef0009a3a042db9a51e82ed1243c8b45e3d53d36427ef86ee5b717a4","observation_id":"3e8eabf2-4867-4320-a54b-14bea67082fd","resolution":{"observed_at":"2026-08-12T17:49:24.753492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.543950Z","title":"Masked feature predic- tion for self-supervised visual pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.543950Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:a0f8820086eff64dd6cf113d180853ee44efbd2c825f1d0373a6ee36587a920d","observation_id":"f1738650-05dc-4838-b008-221b41809530","resolution":{"observed_at":"2026-08-12T17:49:24.543950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.736473Z","title":"Iterative reorganiza- tion with weak spatial constraints: Solving arbitrary jigsaw puzzles for unsupervised representation learning","venue":null,"work_id":"835554c5-06ac-4e8f-8e96-f395cbe7af84","year":1910},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.546954Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:a93aaea50883509815e3bdcb99ccd520fd39a7ae11de414d19bd92130e7be25f","observation_id":"7ba6a756-1220-43dc-9cd7-a620c67795d9","resolution":{"observed_at":"2026-08-12T17:49:24.739370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.727867Z","title":"Structured sparsity learning for efficient video super-resolution","venue":null,"work_id":"8447f43f-4880-49a1-b76e-218966e300ed","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.550429Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:c8adf037cd6adace09a8196ac2848afbee1edacd4514b08f4228ae6d0a06fb9d","observation_id":"0bcf54e1-e7fc-4579-ab79-ed9e8d549023","resolution":{"observed_at":"2026-08-12T17:49:24.731183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04154","last_updated":"2022-10-09T03:22:15Z","snapshot_observed_at":"2026-08-16T16:25:50.370331Z","submitted_at":"2022-10-09T03:22:15Z","title":"Self-supervised Video Representation Learning with Motion-Aware Masked Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04154","snapshot_observed_at":"2026-08-12T17:49:24.553285Z","title":"Self- supervised video representation learning with motion-aware masked autoencoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.553285Z"},"links":{"cited_paper":"/paper/2210.04154","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:2b1dfbc9dcc9cb800d34da6f75d9007d7da2ae1440824f3a33cc3d8590293edf","observation_id":"499db7ef-4e00-4c2c-bb9b-739e4363f0a8","resolution":{"observed_at":"2026-08-12T17:49:24.553285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.718545Z","title":"Seco: Exploring sequence supervision for un- supervised representation learning","venue":null,"work_id":"b6ef781d-12d0-4c76-9705-09a8543a1aaa","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.557225Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:86b7f8c20370b5cf0a152435559bc4f5504e71f66be7543e5cfc6d3beef8bfa1","observation_id":"f8d1fae6-b6be-4463-869c-0cadd1c2ac45","resolution":{"observed_at":"2026-08-12T17:49:24.721778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.709350Z","title":"Contextualized spatio-temporal contrastive learning with self-supervision","venue":null,"work_id":"afd2b7ab-88f5-474e-8acb-64abc364b626","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.560670Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:25ee80369fd587f58c86b5b60a336e362173e907975d51a22cf444b3f8ef0d50","observation_id":"6e75d79c-14ad-4be5-9177-2ef385cc1298","resolution":{"observed_at":"2026-08-12T17:49:24.712474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.700353Z","title":"A survey on masked au- toencoder for visual self-supervised learning","venue":null,"work_id":"12cef4f0-4ab5-4b04-bd3c-dcdfd0da542c","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.563649Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:d1cf3ae6d5b7a65b85a108ab2c9b11978e9daaf59486eab8d4a26465e03a50db","observation_id":"29c09f25-7269-48f5-b567-23a21496efbe","resolution":{"observed_at":"2026-08-12T17:49:24.703565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.00173","last_updated":"2022-07-30T09:59:28Z","snapshot_observed_at":"2026-08-16T16:42:18.622309Z","submitted_at":"2022-07-30T09:59:28Z","title":"A Survey on Masked Autoencoder for Self-supervised Learning in Vision and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.00173","snapshot_observed_at":"2026-08-12T17:49:24.566876Z","title":"A survey on masked autoencoder for self-supervised learning in vision and beyond","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.566876Z"},"links":{"cited_paper":"/paper/2208.00173","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:ab657a396e66bec8b7ffb50a3b394a7feae48c6550692ab6b748d6898866e6ba","observation_id":"7a61fd2b-eb16-47bd-823a-d39f1393a903","resolution":{"observed_at":"2026-08-12T17:49:24.566876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.690923Z","title":"How mask mat- ters: Towards theoretical understandings of masked autoen- coders","venue":null,"work_id":"faa0f698-debf-4963-bec4-fcb680cd37d2","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.569726Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:3a3f9ad4d46cdc2f495af2345929e4e2e1b8025457657cc5e3203af788eb8b80","observation_id":"4e4f03a9-9bdb-44a6-9e76-8a3e8949c78c","resolution":{"observed_at":"2026-08-12T17:49:24.694362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.681469Z","title":"Deep mutual learning","venue":null,"work_id":"15fcd80a-0384-4252-8cf8-d9300d1519fe","year":2018},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.572103Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:82a2410a25de85f599648f67f5a7480690a4848c873e61b72b858af41ae7c175","observation_id":"20bff9eb-0649-4998-875b-467726679d02","resolution":{"observed_at":"2026-08-12T17:49:24.684795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.668815Z","title":"Masked autoencoders in computer vision: A comprehensive survey","venue":null,"work_id":"a76d9dd7-5a3c-4b87-823b-354fa30d320a","year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.574574Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:7223e3c7ffa909e5e4f9e28ca39691ccc8f45eb54510b5ffdcf1c79ac380a834","observation_id":"47feeadf-f419-40b0-b267-5a9c7d537a10","resolution":{"observed_at":"2026-08-12T17:49:24.674644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":51},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2411.12270."}