{"as_of":"2026-08-09T19:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f08e079c7ef115758ae3431f8b644e9599ef1bd5134a21dd30f6d31784399b6","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:50:07.591495Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:13:57.887170Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:29:44.836738Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08769","snapshot_observed_at":"2026-08-06T19:13:57.887170Z","title":"Cluster and predict latent patches for improved masked image modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06230","last_updated":"2025-07-25T14:31:34Z","snapshot_observed_at":"2026-08-07T14:43:47.586033Z","submitted_at":"2025-07-08T17:59:50Z","title":"Feed-Forward SceneDINO for Unsupervised Semantic Scene Completion","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:57.887170Z"},"links":{"cited_paper":"/paper/2502.08769","citing_paper":"/paper/2507.06230"},"observation_digest":"sha256:27d87c4138c03a1f6b595a1556d8e79e3575ec15c403dded4c1b4c8dde698cce","observation_id":"c4e2b4b3-0965-4f08-9eee-0052b9bee9ca","resolution":{"observed_at":"2026-08-06T19:13:57.887170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"cited_work":{"arxiv_id":"2502.08769","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08769","snapshot_observed_at":"2026-07-04T10:29:44.836738Z","title":"Cluster and predict latents patches for improved masked image modeling.arXiv preprint arXiv:2502.08769","venue":null,"work_id":"4dfd8cbc-66a0-46be-8ee3-fe7fa0327953","year":null},"citing_paper":{"arxiv_id":"2605.03245","last_updated":"2026-05-05T00:26:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T00:26:57Z","title":"Text-Conditional JEPA for Learning Semantically Rich Visual Representations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T17:58:43.650308Z"},"links":{"cited_paper":"/paper/2502.08769","citing_paper":"/paper/2605.03245"},"observation_digest":"sha256:aac2178a1562096ec98f9434a3f97940721ccbf15427bc5d27f18eadd88d9c73","observation_id":"5ca6159f-0d2c-44c2-a94a-b60543384547","resolution":{"observed_at":"2026-05-12T10:51:30.652080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"cited_work":{"arxiv_id":"2502.08769","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08769","snapshot_observed_at":"2026-07-04T10:29:44.836738Z","title":"Cluster and predict latents patches for improved masked image modeling.arXiv preprint arXiv:2502.08769","venue":null,"work_id":"4dfd8cbc-66a0-46be-8ee3-fe7fa0327953","year":null},"citing_paper":{"arxiv_id":"2606.23503","last_updated":"2026-06-22T15:49:45Z","snapshot_observed_at":"2026-08-07T13:19:32.436528Z","submitted_at":"2026-06-22T15:49:45Z","title":"UniverSat: Resolution- and Modality-Agnostic Transformers for Earth Observation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-26T08:50:49.531565Z"},"links":{"cited_paper":"/paper/2502.08769","citing_paper":"/paper/2606.23503"},"observation_digest":"sha256:36da918b840f6452c9e606c35ffd2c2adbe98d799916a4db1f9805f1796105c9","observation_id":"63d6c140-fce3-4bb0-a322-f08060f9b25b","resolution":{"observed_at":"2026-07-04T10:29:44.839565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08769","snapshot_observed_at":"2026-07-11T22:20:52.422988Z","title":"arXiv preprint arXiv:2502.08769 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04011","last_updated":"2026-07-04T20:13:38Z","snapshot_observed_at":"2026-08-06T03:55:35.624754Z","submitted_at":"2026-07-04T20:13:38Z","title":"Separating Representation from Reconstruction Enables Scalable Text Encoders","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-11T22:20:52.422988Z"},"links":{"cited_paper":"/paper/2502.08769","citing_paper":"/paper/2607.04011"},"observation_digest":"sha256:1dfdb2da980c4b1416b18782a78ebe1701f76c8d0a851cffffc868fe2b859a5b","observation_id":"544ba040-2d98-410e-945d-49933a15a2e2","resolution":{"observed_at":"2026-07-11T22:20:52.422988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08769/citation-record","integrity":"/paper/2502.08769/integrity","json":"/paper/2502.08769/citation-record.json","paper":"/paper/2502.08769"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.167838Z","title":"Mim-refiner: A contrastive learning boost from intermediate pre-trained representations, 2024","venue":null,"work_id":"78a89b7b-83ea-406c-b53e-8fcab27ad815","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.372866Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:c79c9ff7a6cd2266ac9d3815c13053f0e51a8a195ae2f2b55dd49fa8c9ef608c","observation_id":"e64fd209-0933-4b59-ada4-cfaecb37f555","resolution":{"observed_at":"2026-08-07T23:50:08.171213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.377023Z","title":"Self-labelling via simultaneous clustering and representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.377023Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:0927bb466bb28eef77dff3e968ccc1e59b83343f71085266757cf5d51380b39f","observation_id":"affb467d-cb62-4c25-9828-79d172f73d03","resolution":{"observed_at":"2026-08-07T23:50:07.377023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.153916Z","title":"Masked siamese networks for label-efficient learning","venue":null,"work_id":"cdbf76fa-f6df-4de9-8496-4fb4bc363d71","year":2022},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.380319Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:4514e34ff03dfca628f3d7751592fcf41f6cc3f943837ede6ec640ae5dab91af","observation_id":"0727c0ae-930c-4d4b-8c3b-c049fbf98300","resolution":{"observed_at":"2026-08-07T23:50:08.157219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.383526Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.383526Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:98706ec674ac00b8548facdf84e22d27fbec2d8802345fa7351090116efbd34a","observation_id":"e6156ec4-db27-40f2-a81a-717c9211a1fe","resolution":{"observed_at":"2026-08-07T23:50:07.383526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.139864Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":null,"work_id":"9a1dde02-6fa6-4d8b-95cf-fffefcc83d1b","year":2022},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.386636Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:025e79fd5a64cb53d34fbdd3794e4abbb10f2e481d25d60fa155b19a479598db","observation_id":"5275a5ba-00c8-487a-ad6b-f04b4fc69dda","resolution":{"observed_at":"2026-08-07T23:50:08.143374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.389844Z","title":"Efficient self-supervised learning with contextualized target representations for vision, speech and language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.389844Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:928bf58085d3a1bb7206fd9d5e4e3f06f06c12eefbbe90003ee4c2d22687da49","observation_id":"4be6fc8f-9ab6-4d6c-af2d-65de12a83abd","resolution":{"observed_at":"2026-08-07T23:50:07.389844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.125663Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":"7aea9edf-f1c3-4c77-87c1-58e21fe2b3b4","year":2021},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.393315Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:5c1ab41773489672be83b2df0102a7c07ce31123371aa8f7afc632683773015b","observation_id":"c9be6d1e-fd5d-4b7c-86f6-150fce1ae03e","resolution":{"observed_at":"2026-08-07T23:50:08.129092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.116234Z","title":"Stochastic positional embeddings improve masked image modeling","venue":null,"work_id":"0b4c44ca-3c6f-4046-85f4-770f01aad0ca","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.396361Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:bd899a5a11dbe3b485bbdf04ea13cfd8ed6eb4662f35e66c0129a162f61f4cda","observation_id":"49a4743c-bf3b-44cf-bc36-1afee2967373","resolution":{"observed_at":"2026-08-07T23:50:08.119531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.107205Z","title":"Objectnet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","venue":null,"work_id":"d1ddc9f4-dab3-4122-ae7b-50165c844f79","year":2019},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.399244Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:7c454a5160804e011e9c460c252e7e3e63e7b140caf12353ffbb6b5f7d6d2276","observation_id":"63f55369-b7a8-4b83-af5a-1cf91ecba547","resolution":{"observed_at":"2026-08-07T23:50:08.110608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.098329Z","title":"V-jepa: Latent video prediction for visual representation learning, 2023","venue":null,"work_id":"8d968dbb-487a-4f2d-8377-63a7ee2434a9","year":2023},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.402414Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:6024b96b0c11b588f350292fe4e490b346f7d153c7a6529d5ca38b7097287973","observation_id":"c137fadc-b63d-471f-8164-ca9e43bb34b4","resolution":{"observed_at":"2026-08-07T23:50:08.101588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T23:50:07.405408Z","title":"H \\' e naff, Alexander Kolesnikov, Xiaohua Zhai, and A \\\" a ron van den Oord","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.405408Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:877eb813cb44980b7f02db8decd396103c651cdf37c265876b1d9e41a35e82d4","observation_id":"ee0fbd76-015e-464d-b862-02753ebe7013","resolution":{"observed_at":"2026-08-07T23:50:07.405408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.089400Z","title":"Depth pro: Sharp monocular metric depth in less than a second, 2024","venue":null,"work_id":"16e259d0-ba4a-48eb-8d27-43617ff0ab4d","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.408898Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:a438c80be13ced752cb7a9dcaaa59c321e28873fd6c6cea0539232e9c5e2e1fc","observation_id":"866f21aa-8678-4038-befe-023044aedc24","resolution":{"observed_at":"2026-08-07T23:50:08.092606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.080484Z","title":"A limited memory algorithm for bound constrained optimization","venue":null,"work_id":"8498496a-c7d4-4ad8-b4b6-0e7cbcaccfec","year":1995},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.411762Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:0c6a03578d543e06a5ff6c3bb2ab24045451794d8819c7b6adb282e1dd31a759","observation_id":"c5041c8f-00d8-43bf-a525-84b137b495c4","resolution":{"observed_at":"2026-08-07T23:50:08.083751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.414838Z","title":"Deep clustering for unsupervised learning of visual features","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.414838Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:1d433bc2717f0b23e987bb756754a475ed61fcecd300bf170f5cf37295b3d177","observation_id":"1a74868c-f175-4173-abce-6b9bea721d3d","resolution":{"observed_at":"2026-08-07T23:50:07.414838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.417820Z","title":"Unsupervised learning of visual features by contrasting cluster assignments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.417820Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:85780a8bcdadab3c037751003424e6db54aa9d2cf6b3619c2422e8233521fe20","observation_id":"46d778fb-81a4-446e-a4bd-2b18a3848f5c","resolution":{"observed_at":"2026-08-07T23:50:07.417820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.420841Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.420841Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:d05fbd3f80a087491b5d0771badc1d27306cd25972fadf09aefabb75f85e342e","observation_id":"73658325-b10e-415d-9d82-e988c8c80488","resolution":{"observed_at":"2026-08-07T23:50:07.420841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.056161Z","title":"Generative pretraining from pixels","venue":null,"work_id":"b54617d7-7caf-4966-92a1-47790e19dfd8","year":2020},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.423778Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:5ce82a57902f694c30aa938e3124f9572aa93bad959e76571ca98537d555d6dd","observation_id":"4a756af9-0202-4c6d-b631-66b09d57b9a8","resolution":{"observed_at":"2026-08-07T23:50:08.059440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.047432Z","title":"Towards a general-purpose foundation model for computational pathology","venue":null,"work_id":"f3b2d986-5a09-4310-82b0-6a9d26faf07a","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.426720Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:53f2fff2006a4d56f4e13f68a1fe44958bbd24793d37df20467a54f98e787a70","observation_id":"3bd9c4c6-87ed-4f13-8763-89941078d6ea","resolution":{"observed_at":"2026-08-07T23:50:08.050623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.038096Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"19632210-390c-4d43-9273-e5afe80a80a8","year":2020},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.429627Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:ca6837fa12aedb304a6f56ac70aa3d122b176089c9e0e3ac14caf8d5618ffb13","observation_id":"76f551b3-9afa-4f4f-b7a4-ad727a2b2540","resolution":{"observed_at":"2026-08-07T23:50:08.041590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.432479Z","title":"An empirical study of training self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.432479Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:fcf0d0abe92a933379f3b11becd4b06774a4180a849afeb8d00a4544562fe57c","observation_id":"2bfcb3c6-7260-4cd8-b2b0-c4158ede7a81","resolution":{"observed_at":"2026-08-07T23:50:07.432479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.435256Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.435256Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:13b37c501d762472c0106e6cbd8cfc6a948011c013a8552ce3f527fda8ca4bdd","observation_id":"4f29bb6c-aba0-41c1-a566-cbafbc9e0af1","resolution":{"observed_at":"2026-08-07T23:50:07.435256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.438148Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.438148Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:a53f6eab0354a8e0a727fa587f6dccebc680dfb4ace9f4ac1657b995ee57e0f3","observation_id":"a33e0d39-8445-4c3e-b5c1-8f1ed761c940","resolution":{"observed_at":"2026-08-07T23:50:07.438148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.014696Z","title":"Endodino: A foundation model for gi endoscopy, 2025","venue":null,"work_id":"1fef75c3-ffb6-49d1-b9a6-138f51702d19","year":2025},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.441063Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:382fbf2a41415ddc4ecfca8ca5e6dbdf12eab6f3f50b73bb18be0a35079aa9a4","observation_id":"9a3a6299-d39c-4128-ad6d-130455ba5cd2","resolution":{"observed_at":"2026-08-07T23:50:08.017934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:08.005833Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"a1942e51-7a6a-4486-8a6b-6eb513f11a17","year":2018},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.443978Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:2197c573d18a51930c33f775c652432475f6c00e25b6e85d8cac6f2efb70354d","observation_id":"18199c8e-0d36-4f98-bfdc-fde4761828dc","resolution":{"observed_at":"2026-08-07T23:50:08.009069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.446829Z","title":"Unsupervised visual representation learning by context prediction","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.446829Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:dbfac476b424a70543b2c0701cf2e92a8a8ef83acc0058bb69184698d8385d3a","observation_id":"b5fc92c9-e613-4773-aa08-fd077901dcce","resolution":{"observed_at":"2026-08-07T23:50:07.446829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.449847Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.449847Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:58e65ca823a8473ea12a5da8fbd985192073e1670b88d3ae8ea9186cec8106c7","observation_id":"a946cdd3-d29f-4fa9-95f8-f33aa27388e4","resolution":{"observed_at":"2026-08-07T23:50:07.449847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.987201Z","title":"o kman, M rten Wadenb \\","venue":null,"work_id":"3d0d2af3-4e3c-42b4-8e5b-cf5a242b80f7","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.453047Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:46066b2aeaf1d0684aa94ee6890daec71a7e0ddc5b8cda7632ade5a37e5f9df8","observation_id":"a0e84832-fc92-4d67-a9f2-433c00e8196c","resolution":{"observed_at":"2026-08-07T23:50:07.990271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.978225Z","title":"Scalable pre-training of large autoregressive image models","venue":null,"work_id":"daead0c0-cf0e-4212-856b-634ab1371cea","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.455970Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:e07094bf1215a96dfcebd213e73d0dce1e694eb58a68dfef21c03b7dbb891cef","observation_id":"3f7e670a-dd50-473e-a8e2-0bc3aed625a8","resolution":{"observed_at":"2026-08-07T23:50:07.981466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.458831Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.458831Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:28010e8bac258e5954abd1dfc34c3de40b797fd71449cf8404dbec70453b4962","observation_id":"4884892d-8102-4533-a151-c52a2fd7b95c","resolution":{"observed_at":"2026-08-07T23:50:07.458831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.964422Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"a562fd9f-9a73-438c-96ae-f649424ffaa6","year":2023},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.461571Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:503f8c8fef831d023e2619ef4aed8c3be28613b1d0fc73d595a2ebe30cb97c4d","observation_id":"8fe93c9b-26ff-41f7-a011-c47b2cad24ee","resolution":{"observed_at":"2026-08-07T23:50:07.967740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.955703Z","title":"Eva-02: A visual representation for neon genesis","venue":null,"work_id":"7a73b986-76e1-4976-9804-7ac8db14e61d","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.464737Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:6e155fe51c224a194cb6604a3f46055d3d0dcb6f0e22a0e3f79a92b418a57609","observation_id":"619dd6f0-2191-4681-8cb5-d2435f8a3490","resolution":{"observed_at":"2026-08-07T23:50:07.958856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.946890Z","title":"Rethinking patch dependence for masked autoencoders, 2024","venue":null,"work_id":"2d872f85-332b-4fc4-a7d5-661af7d7768a","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.467748Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:af36327aff38637836e3a70df75b2f0285ddbcbc27d07b24bb6083a73222e681","observation_id":"82671770-9e2b-4584-91b4-695e87ad79a4","resolution":{"observed_at":"2026-08-07T23:50:07.950151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.470609Z","title":"Unsupervised representation learning by predicting image rotations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.470609Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:d0436fa02ed675cadec7fb5ef00824569acc965b402e4f709b0f12d739a266fb","observation_id":"24bf672d-d6b5-479e-993a-7cc1ed888107","resolution":{"observed_at":"2026-08-07T23:50:07.470609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.932862Z","title":"Moca: Self-supervised representation learning by predicting masked online codebook assignments","venue":null,"work_id":"62126803-f6d9-4851-9bc6-7210b3062837","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.473551Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:f233b02018c84dea751fbf891606ca26346c1c188a1e8ea0c24c022b1116e73a","observation_id":"63f1df5b-79a5-439a-8e4c-339027aea395","resolution":{"observed_at":"2026-08-07T23:50:07.936227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.476453Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.476453Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:143dcaf1630f9645a2412891be82aa17f6bd0d312f92256285820e694176790a","observation_id":"e585265f-921d-4e03-899a-e23bd48441fc","resolution":{"observed_at":"2026-08-07T23:50:07.476453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.479313Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.479313Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:eaab2de33a596e244c91c9efc7e5631c1125c49768c9009d9c9d0d7275cca0d8","observation_id":"ada7ba09-5da0-486a-98f9-f143e3e9769d","resolution":{"observed_at":"2026-08-07T23:50:07.479313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.482133Z","title":"Natural adversarial examples","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.482133Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:f9ccd137c866c9a51a4ddcdba4a8333997792780257f76a3d05aed740b880a4c","observation_id":"aec7e784-0981-4ba5-99b6-5e469482ad57","resolution":{"observed_at":"2026-08-07T23:50:07.482133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.909211Z","title":"Contrastive masked autoencoders are stronger vision learners","venue":null,"work_id":"a328c54c-81ca-4b89-8a73-dfca0807959e","year":2023},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.485221Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:6436a729bfb8f70abc67adc1e68d705a5756cdae0401a5aa7ac7c408879aece4","observation_id":"5f2a1434-4d4d-409b-b1d8-63b45eb5bfc6","resolution":{"observed_at":"2026-08-07T23:50:07.912506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.900391Z","title":null,"venue":null,"work_id":"eef2e172-ee05-42d9-a076-372f0cecdbb1","year":2007},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.488112Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:f854a8310bab0c0bb99e95ce7d1c5faf54de1f0a47147d00b49f961bb1a937d1","observation_id":"c83b423e-8ea2-4c5e-93d6-c8a99c5b517f","resolution":{"observed_at":"2026-08-07T23:50:07.903599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.891272Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":"bead84e0-e77f-4e29-ac85-c60876c61b4c","year":2014},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.491163Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:07afbb293092b47e73a7f66657b2b6d330053fe8942897be5a0a39d642082a69","observation_id":"7b2bbcfa-7c35-4dd5-8778-8157ab2d53aa","resolution":{"observed_at":"2026-08-07T23:50:07.894446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.882443Z","title":"A path towards autonomous machine intelligence, 2022","venue":null,"work_id":"7cc7304e-96c5-43f5-93c8-62682ff62a62","year":2022},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.494396Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:4cf96e3845f5c673f5468a13d839ec5969999947962a4764df8938668001a451","observation_id":"b308b999-fd16-4155-8079-33084944fae3","resolution":{"observed_at":"2026-08-07T23:50:07.885626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.873781Z","title":"Deepseek-v3 technical report, 2024","venue":null,"work_id":"ea6b4d6b-3f89-4558-a1ad-10f17eec1c5d","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.497828Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:0b3d1bd637da435a80d8c325c119b4f11b89c76bce90c9dff1f18a1520e662fa","observation_id":"377e077e-86b1-48d6-98eb-503876300c96","resolution":{"observed_at":"2026-08-07T23:50:07.876872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.864958Z","title":"Decoupled weight decay regularization, 2017","venue":null,"work_id":"1e2f1b75-3fae-4600-bf74-619a246fec4f","year":2017},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.500801Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:d2f57549154aefe7eec061b52f8127e6b16921a71280843c0a1b16b0ee6e905d","observation_id":"fde0bc63-6951-40ee-9065-1b447ee562c1","resolution":{"observed_at":"2026-08-07T23:50:07.868172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.855956Z","title":"Torchvision: Pytorch's computer vision library","venue":null,"work_id":"62c7e76d-0eca-4b13-96f8-9c5b18dc5d2b","year":2016},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.503791Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:56d2ea8d54ec1eb4a8d21dddd60aeef40354d58260986e5ed3f7cba5c9abfe84","observation_id":"9b3fb27b-99ac-491b-886e-0b103d3d9d59","resolution":{"observed_at":"2026-08-07T23:50:07.859169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.506667Z","title":"Self-supervised learning of pretext-invariant representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.506667Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:b05a0c6cc338ddf52906b5ccfbccbd1d8eba964e415d0b062d234a371ebedd79","observation_id":"a91de2bf-3772-4fdb-a957-1117bff0993d","resolution":{"observed_at":"2026-08-07T23:50:07.506667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.841599Z","title":"Advancing human-centric ai for robust x-ray analysis through holistic self-supervised learning, 2024","venue":null,"work_id":"d228bb49-ee47-4a65-8130-40f65806f4ea","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.509438Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:2806d5372d97f200f9437bba0c6e4b54f8e05fbd2a744160571324acac4333db","observation_id":"ecf4ca09-9cc3-40f4-82f2-faada597e0fd","resolution":{"observed_at":"2026-08-07T23:50:07.845454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T23:50:07.512374Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.512374Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:193a3ee6c623a66ffbe696ff1a4502734d43482c4c11ccfd4e642f99d3d8ebfa","observation_id":"93e6c209-c278-4f8e-a933-cd7e52e60e06","resolution":{"observed_at":"2026-08-07T23:50:07.512374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.832897Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"2ccefccf-3422-4c81-bbb3-39cbb5c7695d","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.515457Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:02c264e2116e463365cfc85134e32ac8b2af5e94e39017a5cc863a583b960935","observation_id":"0f7775d7-3e2b-4b84-903a-41a85534d560","resolution":{"observed_at":"2026-08-07T23:50:07.836104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.824238Z","title":"Context encoders: Feature learning by inpainting","venue":null,"work_id":"b80bcf08-7dd9-42c8-a602-a70206b56965","year":2016},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.518444Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:0c0283b16b7438b51cb99eae19faca7a6775df76ac5515cd49409e2fb28992f9","observation_id":"f930ddcd-6022-4075-9fe7-c501b3253bf4","resolution":{"observed_at":"2026-08-07T23:50:07.827446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.521541Z","title":"Improving language understanding by generative pre-training, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.521541Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:6dec7a6f5b7b22e20a57e43cf2bf9b8bef60a77c139396efe4535b072c6a5ede","observation_id":"1c1f4f13-6cf2-42d9-b5c9-39285b6a63b9","resolution":{"observed_at":"2026-08-07T23:50:07.521541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.524359Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.524359Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:3eebdb5f8b95b46cacbe1bf1dbb24c818a5b5c8ec3eabb650cc7263d810fa3aa","observation_id":"ab79520b-c91b-4eb2-97d3-aaa6370c192f","resolution":{"observed_at":"2026-08-07T23:50:07.524359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.805480Z","title":"Machine learning in python: Main developments and technology trends in data science, machine learning, and artificial intelligence, 2020","venue":null,"work_id":"33211a50-1e18-4e00-afad-9d43195764c4","year":2020},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.527309Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:24a780620e559229aac7ac93d0027d55816df9d264812b2dddd532ce07a281d4","observation_id":"d787353b-fd33-4741-8cde-e961e4d6597c","resolution":{"observed_at":"2026-08-07T23:50:07.808793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.530143Z","title":"Do imagenet classifiers generalize to imagenet? In ICML, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.530143Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:bedce21e12d3857594e4e6db985a1a588756b31be0dd05cf76b34486c5e28319","observation_id":"73c077ff-2cc1-4778-8624-a62da0966b56","resolution":{"observed_at":"2026-08-07T23:50:07.530143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.791662Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":"d7d14cf4-a3ec-4698-bc88-1f6369598059","year":2015},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.533008Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:db52fc21bf77b2624fb26b92a12d7023148fab3bc81362d3a1b5b39e99a8d124","observation_id":"f538355e-5b4a-41fc-9748-0f59f7a2cf3f","resolution":{"observed_at":"2026-08-07T23:50:07.794958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.782790Z","title":"Sigma: Sinkhorn-guided masked video modeling","venue":null,"work_id":"203825e7-3e98-4b2f-864e-76fabdb43f66","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.535814Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:ecdfd2d2859302428afdccbac4afa89f8bb1807cc508fd5da86b28306ba8dec4","observation_id":"01a3fa6a-3f2d-4fdd-a4ab-218ace82b162","resolution":{"observed_at":"2026-08-07T23:50:07.786140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.774135Z","title":"Web-scale k-means clustering","venue":null,"work_id":"18a7eb2b-8998-463e-8347-233274479472","year":2010},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.538768Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:f07e7f511cba7ef9029f8506ae395a65724f78c4bcec2bdba530ed5dc6eeeb9d","observation_id":"03793c26-e018-4988-bf34-f66bc7bed3a7","resolution":{"observed_at":"2026-08-07T23:50:07.777248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.765238Z","title":"Concerning nonnegative matrices and doubly stochastic matrices","venue":null,"work_id":"ea4d3e21-842d-475c-9d90-acf22f875066","year":1967},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.541651Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:43ade89df67fd81ec6aa5eeddc39c41be5b9672356930ffa038aa411070ed503","observation_id":"cc0bbcb5-b204-4ab4-b0dc-be01084b5aff","resolution":{"observed_at":"2026-08-07T23:50:07.768485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.544619Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.544619Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:f9197449e5ce32981fa02c0510749fdd75e5d5dcd0396727646130cab6c3dbb6","observation_id":"71497537-1fb9-4982-bf87-53b1e49aa061","resolution":{"observed_at":"2026-08-07T23:50:07.544619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05016","last_updated":"2025-05-03T06:48:53Z","snapshot_observed_at":"2026-07-06T19:29:01.116622Z","submitted_at":"2024-10-07T13:15:07Z","title":"T-JEPA: Augmentation-Free Self-Supervised Learning for Tabular Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05016","snapshot_observed_at":"2026-08-07T23:50:07.547661Z","title":"T-jepa: Augmentation-free self-supervised learning for tabular data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.547661Z"},"links":{"cited_paper":"/paper/2410.05016","citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:33685f866cd11132042610a500fe0f7c233f3427eb43a57cf241acdd48fe9000","observation_id":"e2afff0e-51a7-42b1-b489-665f78593d31","resolution":{"observed_at":"2026-08-07T23:50:07.547661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.751048Z","title":"Very high resolution canopy height maps from rgb imagery using self-supervised vision transformer and convolutional decoder trained on aerial lidar","venue":null,"work_id":"a9119ff3-47b1-42b1-9107-8b09ebbbbdf0","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.550852Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:bd88d85908b883792882a40fd4671cbad06bdd209ae45fa1702a8cdde0402e9c","observation_id":"9332855d-31d5-4d2f-9a77-9ce603cd036a","resolution":{"observed_at":"2026-08-07T23:50:07.754537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.742196Z","title":"Dino-tracker: Taming dino for self-supervised point tracking in a single video","venue":null,"work_id":"5be985ab-f7e4-4649-8b76-9decef15d426","year":2025},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.553783Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:7cdadec0a49e52a28da438886ab196b9a18c855adb95909ecfe35804a4c8f854","observation_id":"24166dd7-4065-4acc-9070-5850df9f9304","resolution":{"observed_at":"2026-08-07T23:50:07.745387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.733181Z","title":"Benchmarking representation learning for natural world image collections","venue":null,"work_id":"6bea45cb-7cf8-455e-a2aa-6bc7d9ba7e89","year":2021},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.556618Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:3f5420054c3ab3b6672d33f535051dc3369f294e3d194e1de386abfe6121f81d","observation_id":"1012bfcb-709a-490e-b18c-2b191e835b12","resolution":{"observed_at":"2026-08-07T23:50:07.736440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.559390Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.559390Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:7d4b5f719462fb71ba4bc8c5b0998a0ebffca7b6dac6e627d2530afaf4b00390","observation_id":"09bf2426-bffb-4417-8b0a-9992e740c291","resolution":{"observed_at":"2026-08-07T23:50:07.559390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.718567Z","title":"Vincent, H","venue":null,"work_id":"82cbbc7b-2fbf-4a83-9c7b-ed717858d97f","year":2008},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.562290Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:961adfd0a7e279a7e457de2b2c74be92505e666e5e461d5ed085c1fe7d8e8b73","observation_id":"9d190232-a474-4e33-985c-9f74b17f81a3","resolution":{"observed_at":"2026-08-07T23:50:07.721865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.709702Z","title":"A foundation model for clinical-grade computational pathology and rare cancers detection","venue":null,"work_id":"08c0f68a-63f0-4b42-abd5-aa7f1c8de340","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.565149Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:2f5d352cf7a46243a530bcd40cd996118a9d8cf2a20dcf8196cff7094cce07f4","observation_id":"03a388a6-3cf3-4d29-9a55-502e65642cdd","resolution":{"observed_at":"2026-08-07T23:50:07.712776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.700636Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"9867e64f-72df-47bd-9e34-f4c668d495d9","year":2010},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.568303Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:fa87367fa1d5e8d0b31295efd41ac68e574d93ba11370efbf285781688af7a07","observation_id":"2a4280e0-4b36-4d95-8c11-69ac599d0947","resolution":{"observed_at":"2026-08-07T23:50:07.703872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.691413Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":"8ab2023b-a27f-48cf-92b7-632911ff77a7","year":2021},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.571101Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:43a5f31a445fa9c09ed15dcce5ccafb8e8b96deb937217a6ee2e8c49dcc4e5fb","observation_id":"89dfc7d7-8d07-4983-95b7-ed952a786bd0","resolution":{"observed_at":"2026-08-07T23:50:07.694583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.682429Z","title":"A whole-slide foundation model for digital pathology from real-world data","venue":null,"work_id":"bee07f6d-7c6d-4902-9af0-b4a4cb3b2481","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.573921Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:18b3687d9ad7360246f5c01275050759feb951875ce58edf40f77d4ea9054b23","observation_id":"bd409697-b5c0-4df1-96f7-38e7d60df78d","resolution":{"observed_at":"2026-08-07T23:50:07.685696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.576803Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.576803Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:eb1eba75446ad90cc842eb69b60a948799fa3b4dcbac3a22f23bbdeeb68cc3db","observation_id":"52981f07-77ca-421e-959a-06d2635c58a3","resolution":{"observed_at":"2026-08-07T23:50:07.576803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.668576Z","title":"Depth anything v2, 2024 b","venue":null,"work_id":"a400a3c3-d81a-42bc-b598-b1d572bbaeeb","year":2024},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.579735Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:21f38bd9d3d6f95dff8742426de19a9514fa17450e8ba5f541e6402b88d4ee0e","observation_id":"46bc9068-cfc6-4076-80ae-32ce6c0ac2b6","resolution":{"observed_at":"2026-08-07T23:50:07.671669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.582651Z","title":"Colorful image colorization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.582651Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:19fbbcaff5f819bd0fa35fefc39520f0ba71f05a588937649a10b7c5f6657e3b","observation_id":"d3f037b7-e65d-4465-a4f3-fafd8849fa92","resolution":{"observed_at":"2026-08-07T23:50:07.582651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.654339Z","title":"Cae v2: Context autoencoder with clip target, 2022","venue":null,"work_id":"e9a9d698-1fa6-4439-841d-b1505e160f8a","year":2022},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.585444Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:2a793f9e892aaeab2ca4693bc48586f7c7a06d801dc5608537c3f93f51e0adf6","observation_id":"323e94d1-8d9b-417f-ab22-6bc31226f118","resolution":{"observed_at":"2026-08-07T23:50:07.657730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.588355Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.588355Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:dba0ccb12983f72c461e0c762cdbecc3c94b2e485014f9ce8619ced90bbff4a5","observation_id":"94ef0851-dcbc-4bd1-8101-143584786c9a","resolution":{"observed_at":"2026-08-07T23:50:07.588355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:50:07.638390Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":"fb361e36-6b04-4255-b024-8f4efc9cce84","year":2022},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.591495Z"},"links":{"citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:0075cb9d286f48b2798d4f5e89aeeb5c5a49fdad8e40d0453b5a1b5cffd53b7a","observation_id":"c4c25e21-09f6-4514-808f-03cd2fcdca3b","resolution":{"observed_at":"2026-08-07T23:50:07.643482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 4 inbound Pith citation observations for arXiv:2502.08769."}