{"as_of":"2026-08-14T09:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8dfae987ea3b70618bd33bd5830cf1d271f909e1401b3ea8bb99e1e5b227b759","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:59:36.446502Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.15787/citation-record","integrity":"/paper/2411.15787/integrity","json":"/paper/2411.15787/citation-record.json","paper":"/paper/2411.15787"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.514480Z","title":"Asano, Christian Rupprecht, and Andrea Vedaldi","venue":null,"work_id":"8882cd71-c278-469c-b74c-9aec3d508f3e","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.162993Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:752eaef4ff0aa44fa756fa2023a6463c6286865c674fcba95821eba90f92e470","observation_id":"c0c18bca-5231-4214-b82b-0e51ceb643c7","resolution":{"observed_at":"2026-08-12T13:59:37.518865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.502847Z","title":"BEit: BERT pre-training of image transformers","venue":null,"work_id":"3a995837-dd67-4833-b480-8e6c9d99a738","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.167722Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:1a0ba7bca7dd228b772494a74303b20cc76d9440b12e63fbdb3472abaa22e09b","observation_id":"fb9c483a-0a2e-4aa0-95d1-237f9ae77cf2","resolution":{"observed_at":"2026-08-12T13:59:37.507105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.489467Z","title":"Cascade r-cnn: Delving into high quality object detection","venue":null,"work_id":"cc5a1846-31f8-42e6-96ef-bff083c9b263","year":2018},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.171857Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:11124f835aec5287152198ca03b7cae8cd77bccf356d22e8dec07d03e738c9ff","observation_id":"81363a80-e5b7-4c4c-93aa-0416cae652cb","resolution":{"observed_at":"2026-08-12T13:59:37.493756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.478842Z","title":"Unsupervised learn- ing of visual features by contrasting cluster assignments","venue":null,"work_id":"db4cc7e0-483b-4edb-8f42-2763a1588cce","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.175892Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e843d2a16bff9f3d9c8483e6927da99c4d0ec8f72831d32302b28f43c7db25f5","observation_id":"17b47991-8b28-4e0b-9141-b7f273e49974","resolution":{"observed_at":"2026-08-12T13:59:37.482258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.467762Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"f92227fd-235a-4dd9-a322-a3b9dc035683","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.180754Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:16b23e8a2084b181e0aa127d893eb0cdfdeeb328f7057f9fc1511c21aaa5f6b1","observation_id":"0eb08d6c-8a62-4bb8-87af-39508d7990a7","resolution":{"observed_at":"2026-08-12T13:59:37.472053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.455457Z","title":"Mixed autoencoder for self-supervised visual representation learning","venue":null,"work_id":"db8daae7-72aa-4aed-8b36-3895f0a21882","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.185131Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:df72dd5412fefda1da270727f15a9911666ae7948c679e9f472f5b573b17e7f8","observation_id":"e5b8be40-8107-4031-972d-4d6a660ce06f","resolution":{"observed_at":"2026-08-12T13:59:37.459500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.441757Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"232bf94c-eb18-4341-89bc-3e55f0bba43d","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.189448Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:a7c19fd18897fdbd2a505ce044929112a93774f0747c47d7a6d58342e21f7b6f","observation_id":"bae4412f-d772-4e0f-80d8-54654691c16e","resolution":{"observed_at":"2026-08-12T13:59:37.446793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.431071Z","title":"Exploring simple siamese rep- resentation learning","venue":null,"work_id":"db8875d0-7086-4061-900c-feabbbb4399e","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.193352Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:56ec424dc58165c4b0d8e6e1ca4c515036c3980e6c97b160eb0738d609611141","observation_id":"4987cec4-5022-4483-86b2-723da00bcfe6","resolution":{"observed_at":"2026-08-12T13:59:37.434514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.419172Z","title":"An empiri- cal study of training self-supervised vision transformers","venue":null,"work_id":"addc9b97-0d05-4302-bc17-5583852fef04","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.197964Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:cb8e29597ce07b98bb96c0120c0a8a9545c6c1673f4fa8336cc3e1dc6e5d2f39","observation_id":"7b450849-3c64-41c3-b76d-bf7cd4ad6571","resolution":{"observed_at":"2026-08-12T13:59:37.423402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.405984Z","title":"Convit: Improving vision transformers with soft convolutional inductive biases","venue":null,"work_id":"7f7ee1a1-805c-4229-af13-ee41e670119e","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.202247Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:0088cd35571b03f1769a05b5ea2d334f82a255ef7cf0778968b523226de39dc1","observation_id":"1c7a8955-0b96-42f2-b548-25581cf233fe","resolution":{"observed_at":"2026-08-12T13:59:37.410405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.393985Z","title":"Ensemble methods in machine learn- ing","venue":null,"work_id":"86627ddb-699f-4fca-b74f-79a5d19ded05","year":2000},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.205999Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e99657eab6ad592152cff373f56e367b8709de1a9e9daed62a3781fc9c350a1f","observation_id":"d5345f7c-f55e-466c-8da6-f9b683ef5111","resolution":{"observed_at":"2026-08-12T13:59:37.397794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.380606Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"4690e6e2-fb31-4b3d-b940-e431f7c837dc","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.210402Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:aa315ac1131aded87a749dcd2cc160e9990e082e53dbb1bd094d3a1d9bdc4728","observation_id":"7c14abbd-a1ad-4f6c-9577-b8b7051979d7","resolution":{"observed_at":"2026-08-12T13:59:37.385594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.367183Z","title":"Whitening for self-supervised representation learning","venue":null,"work_id":"9cacd323-fac1-4ab5-a1d3-2afffa7b5d30","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.215043Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:a2d6cd54b15473a7ef5aca2929d5390cc7c5d1899ca1887b0de83ebf38350d34","observation_id":"59e7332b-e982-491d-9d09-8a3b37c71d86","resolution":{"observed_at":"2026-08-12T13:59:37.371780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.353309Z","title":"Seed: Self-supervised dis- tillation for visual representation","venue":null,"work_id":"42797bb9-8dd7-43be-bec1-ecd0b652d110","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.218838Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:23f6060c400f7c70aec8fd0871a496c3096fd3a4a4626fd9efae1005409c614c","observation_id":"f324fea3-b88c-4cbd-95d9-b320c9086d2e","resolution":{"observed_at":"2026-08-12T13:59:37.358369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.341458Z","title":"Evolved part masking for self-supervised learning","venue":null,"work_id":"4c0e4529-4a5d-4c2d-b58b-e7fa5a362286","year":null},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.222715Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:01d6b43cc375b36dc7cde1f5ed2d84948f743f39aa079c055b381d62aab34291","observation_id":"f8a93134-6acc-4218-9dec-85847ba44a80","resolution":{"observed_at":"2026-08-12T13:59:37.346320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.325528Z","title":"Ganaie, Minghui Hu, A.K","venue":null,"work_id":"52d305c1-6f09-4a35-92c8-e136e5485d2b","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.227572Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:57f1a83f26a911dadf293492d241f10367b0ebfffd6dcb1167b6e0e29cd6cd7d","observation_id":"1df1351e-b688-472e-8008-58ad63218e85","resolution":{"observed_at":"2026-08-12T13:59:37.330615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.312235Z","title":"Large-scale un- supervised semantic segmentation","venue":null,"work_id":"fac72a23-5fe5-44a2-af5e-e67d13f5fd22","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.232442Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:257a821a5ca39c413a61253114efe6a809356ba6e16a58fd2f1d0fd9cd38ab48","observation_id":"cc5b256c-db5d-4777-a2d4-2980d658d30e","resolution":{"observed_at":"2026-08-12T13:59:37.316715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.186403Z","title":"Richemond, Elena Buchatskaya, Carl Doersch, Bernardo ´Avila Pires, Zhaohan Guo, Moham- mad Gheshlaghi Azar, Bilal Piot, Koray Kavukcuoglu, R´emi Munos, and Michal Valko","venue":null,"work_id":"8a96c727-abe6-487c-916c-8db3e827d0bf","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.236321Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:6d008a6054fbea88251a3c39a2f1d44d8891928c08f7175a6ac4bcbc9501564f","observation_id":"87d73ed9-4a22-4f77-a574-d3764fe50431","resolution":{"observed_at":"2026-08-12T13:59:37.245865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09741","last_updated":"2022-07-11T04:21:37Z","snapshot_observed_at":"2026-08-11T14:46:55.089040Z","submitted_at":"2022-02-20T06:35:18Z","title":"Visual Attention Network","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09741","snapshot_observed_at":"2026-08-12T13:59:36.240463Z","title":"Visual attention network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.240463Z"},"links":{"cited_paper":"/paper/2202.09741","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:dae326caff8b41855e4dc24e04c701d9a0b1b66a2938a26b67f3140d09c40488","observation_id":"0007e657-5c59-4277-9ac2-129af3be0f57","resolution":{"observed_at":"2026-08-12T13:59:36.240463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.173615Z","title":"Hansen and P","venue":null,"work_id":"3878b26e-4d3b-4c63-ae01-832c5e7eb595","year":1990},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.245057Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:f3eafff6b960ffa094b09624001ff09e6d5b3c00960cb896a81004dbbcde20b2","observation_id":"202ee373-4dee-40f8-b622-5c150b8e821b","resolution":{"observed_at":"2026-08-12T13:59:37.177669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.160805Z","title":"Training independent subnetworks for robust prediction","venue":null,"work_id":"d017a265-2636-48fa-a95b-bac5d4887e2e","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.249656Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:95c6f677ef255796e9014e96f8efad22cd7045cacee81864c35e15fa3ef05367","observation_id":"ec2b9bb3-731d-42c2-8a6a-304c77232e7a","resolution":{"observed_at":"2026-08-12T13:59:37.165226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.253645Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.253645Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:1d4063ff105e620c50cafa0234b5f8681859f72b1bc7d2d600348588f85da66a","observation_id":"6f0a9f0a-c6a9-420a-b565-579b2f1db22f","resolution":{"observed_at":"2026-08-12T13:59:36.253645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.140789Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":"4b95e079-4d4f-42db-acc4-fb9c5236e4f4","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.257724Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e5efe1a178245d14533ef3a2a2652ef018014a19a6a83dfd71ea17f246fe21a7","observation_id":"7307fe2b-58c4-4e12-be64-f897cce54176","resolution":{"observed_at":"2026-08-12T13:59:37.144942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.128795Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"88dfb5fb-fd04-40b6-bd80-0fa518e07f2f","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.261961Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:deac29dc496ce9b1027c9609bd09836d9046f8733cb6827deaa885e320bfe3d6","observation_id":"fec79ee1-7fa5-4f2b-9c1b-320cee2d22b1","resolution":{"observed_at":"2026-08-12T13:59:37.132864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T13:59:36.265938Z","title":"Distill- ing the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.265938Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e710d0578fc53ca30e56e380c97509097b45c7edeabc4f724d008baa66858552","observation_id":"ae5b7a43-a9ee-4420-8f01-4c65f282ca8a","resolution":{"observed_at":"2026-08-12T13:59:36.265938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11943","last_updated":"2022-11-22T01:39:45Z","snapshot_observed_at":"2026-08-14T01:30:46.470820Z","submitted_at":"2022-11-22T01:39:45Z","title":"Conv2Former: A Simple Transformer-Style ConvNet for Visual Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11943","snapshot_observed_at":"2026-08-12T13:59:36.270510Z","title":"Conv2former: A simple transformer-style convnet for visual recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.270510Z"},"links":{"cited_paper":"/paper/2211.11943","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:df8c88ac61c1acf3d7dae500f298775209eed52d146fc6adaaf01ee4f6318fbd","observation_id":"f91d5ffd-e3db-4dee-ac1b-1705c7950631","resolution":{"observed_at":"2026-08-12T13:59:36.270510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-12T13:59:36.274517Z","title":"Averaging weights leads to wider optima and better generalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.274517Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e57cac3491b6097c529cb189af3161de85a52a59f9d3425c4777dcc77df2b7a6","observation_id":"2c8310df-939a-47f3-ba8c-54e875f15300","resolution":{"observed_at":"2026-08-12T13:59:36.274517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.116167Z","title":"Similarity of neural network representa- tions revisited","venue":null,"work_id":"20a72803-5f39-47c3-b58c-bdc7804275b1","year":2019},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.279665Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:f5b446121476402e2aafb8477b2d2894b35b91f3e019138740bf6d53d0e273da","observation_id":"008a7f77-e186-44e7-8e9b-595500a28f5c","resolution":{"observed_at":"2026-08-12T13:59:37.120725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.103860Z","title":"Fractalnet: Ultra-deep neural networks without residuals","venue":null,"work_id":"98ef8027-d279-4c60-b82d-af36a5e0676a","year":2017},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.283495Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:8b63b438b94cb43686240c79e6a7ada06599d09d3530325ddd340dbecb6aa26e","observation_id":"6b864517-9da5-4755-9925-88bcbaf7e41c","resolution":{"observed_at":"2026-08-12T13:59:37.108217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06314","last_updated":"2015-11-19T19:19:58Z","snapshot_observed_at":"2026-07-06T04:37:08.670695Z","submitted_at":"2015-11-19T19:19:58Z","title":"Why M Heads are Better than One: Training a Diverse Ensemble of Deep Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06314","snapshot_observed_at":"2026-08-12T13:59:36.287012Z","title":"Why m heads are bet- ter than one: Training a diverse ensemble of deep networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.287012Z"},"links":{"cited_paper":"/paper/1511.06314","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e66dfc0ca410521c058042d5f19e89759fd4e600643bee1bad63137cfa3d90c7","observation_id":"cf0c168f-5f8b-47c9-b486-193d522a2456","resolution":{"observed_at":"2026-08-12T13:59:36.287012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.092457Z","title":"Sere: Exploring feature self-relation for self-supervised trans- former","venue":null,"work_id":"304ee2fb-f54d-445c-a508-f598318a5382","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.291248Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:2aba311a8652cf36f3326a33d792f04aa325d95e236292e2a29334641c48dda0","observation_id":"49c894ea-0fc9-4cbd-be3b-b64fc9434d9c","resolution":{"observed_at":"2026-08-12T13:59:37.096601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2310.05108","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.622223Z","title":"Enhancing representa- tions through heterogeneous self-supervised learning","venue":null,"work_id":"2e4a694b-7bda-415f-8d05-d46438314762","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.294927Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:b24f777acea1ef74226865f250ec0d01b2443bdf1ad34f4d0d6d3572d91f30fc","observation_id":"06f74ad0-5d71-4f4f-8297-eb3141445aee","resolution":{"observed_at":"2026-08-12T13:59:36.630796Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.079853Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"9d724c20-85e1-45cc-86c1-eac4ada8e929","year":2014},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.298601Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:052bf826ff36531e1ed25176f6173b46e69f5ec4071b317d91dfc3aebe0eb9de","observation_id":"7de05d14-dcb8-4fab-be4f-7cea56036150","resolution":{"observed_at":"2026-08-12T13:59:37.084032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.067429Z","title":"Swin trans- former: Hierarchical vision transformer using shifted win- dows","venue":null,"work_id":"f081ddc9-fd33-4de9-9a64-3a6f60f1fc75","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.302744Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:0c136f04e81086b5df88fe36c8807de3839438b0712ee4012852551228294b6b","observation_id":"1e928978-8500-4391-873d-2a7a81ef28c1","resolution":{"observed_at":"2026-08-12T13:59:37.071789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.053270Z","title":"A convnet for the 2020s","venue":null,"work_id":"eb531301-488d-495a-8379-b836f743bd2b","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.306788Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:6a2c8553382345f2071f55914a37d1338c479c9882ac09c5dc26c3b20baaf7f0","observation_id":"cd04de15-3d21-4fa2-bd93-99c50f2f8caa","resolution":{"observed_at":"2026-08-12T13:59:37.058450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.039113Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"5373b063-e644-4db4-8d4e-4990aef0e617","year":2019},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.310991Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:289ed47c9c1a7b4ee0cd6ed119cd832431191f2baf7f6affbad86b5d2f92bbb7","observation_id":"fe97687c-bdf2-4f79-a15a-b052e55841bd","resolution":{"observed_at":"2026-08-12T13:59:37.044230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.025789Z","title":"Representation uncertainty in self-supervised learning as variational inference","venue":null,"work_id":"72dd84a3-fe40-4e62-8c2d-698a88097f2c","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.314763Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:01669e28902af9161329e1373d01ac4379ab5df005f79fbd941a440cf96c423c","observation_id":"81876898-bc47-4c23-9244-b503f4ac24ce","resolution":{"observed_at":"2026-08-12T13:59:37.030120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.011441Z","title":"Simreg: Regression as a sim- ple yet effective tool for self-supervised knowledge distilla- tion","venue":null,"work_id":"16d8a696-e5b4-4d43-8a95-ec7ffd8c5797","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.318518Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:a5bcc067a0642207ae84e17964599319d13851f82fdddc77eef9606297a26316","observation_id":"474571af-d00b-4c85-9f9e-7093000d1393","resolution":{"observed_at":"2026-08-12T13:59:37.017322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T13:59:36.323425Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.323425Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e8934121d11259f9b08d535d038b3ab8e31f38a063a295d481bb50995c02e7d2","observation_id":"58b883a7-a95f-485c-965d-8b9157c8bdb5","resolution":{"observed_at":"2026-08-12T13:59:36.323425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.327999Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.327999Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:1df7a99f3e0ba9c9ee38dc7445ad3439a7d3039746d06890ab5e93411183c1b2","observation_id":"e92f2de2-92a5-4f0b-90d8-4b6528726863","resolution":{"observed_at":"2026-08-12T13:59:36.327999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.991809Z","title":"Learning common rationale to improve self-supervised rep- resentation for fine-grained visual recognition problems","venue":null,"work_id":"63a25ad9-8dd0-4411-b8af-cd9b46dc0a37","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.332762Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:fc86af9a8adbaa6dc42cb7759a37b77e333a7f56d348ca213ef1113c0954fae0","observation_id":"30511b61-22e1-4182-bfb2-190f132ed2ca","resolution":{"observed_at":"2026-08-12T13:59:36.995993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.979127Z","title":null,"venue":null,"work_id":"7373ea89-61b6-487a-b1ea-909edf165c96","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.337204Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:4f4dcc81136753e8eb8d8532f98033a28c35fe7b531ddef32f24bcd121cee20e","observation_id":"6c11bba4-cc9b-4d59-b780-d51ed92533c1","resolution":{"observed_at":"2026-08-12T13:59:36.984006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.967266Z","title":"Multi- mode online knowledge distillation for self-supervised visual representation learning","venue":null,"work_id":"c0c70179-8c08-4e74-97b5-68c873796c77","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.341166Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:71b7dd2fb2a4479d225f905860dbc7ad626d66ff8aeafb27d103688d6213a558","observation_id":"1397c6fb-8ffa-482b-9707-6664ac7e44ae","resolution":{"observed_at":"2026-08-12T13:59:36.971471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.954860Z","title":"Semantics-consistent feature search for self-supervised visual representation learning","venue":null,"work_id":"de1fe4d4-6427-4e0e-bb55-81d299859e59","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.345473Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:6a3711f652259c0f6fa155d3a83349b750ee4528eb478805d711f46fc7d81932","observation_id":"39d4be1e-013c-4f9a-ac70-79b84717ee06","resolution":{"observed_at":"2026-08-12T13:59:36.958797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.942704Z","title":"Dropout: A simple way to prevent neural networks from overfitting","venue":null,"work_id":"a035d952-ca0d-41cc-87be-033a113b1739","year":1929},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.349178Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:cd745c316bd0404294d5ef4b7df28c099982cd7c576501fdce780ce1ce2d54fd","observation_id":"01ba14a2-f08d-40cd-be01-5faafd0dab63","resolution":{"observed_at":"2026-08-12T13:59:36.946527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.930035Z","title":"Siamese image modeling for self-supervised vision represen- tation learning","venue":null,"work_id":"cb6a4dfb-bd2e-4756-8acb-17b5400450d5","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.353103Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:d368f121bdbdf621d8903b59d9199d3e42d41e1278652358219c0a474fca7708","observation_id":"0ffb2b9b-743a-455d-9305-745c44fb2bd1","resolution":{"observed_at":"2026-08-12T13:59:36.934827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.916683Z","title":"Un- derstanding self-supervised learning dynamics without con- trastive pairs","venue":null,"work_id":"045609d7-977c-4c34-8d71-0b316cda1991","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.357880Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:b2bbfa8e5f6537f30daf978a6c4e0a3fa4a105e696d85ce14699f4fef7440720","observation_id":"5160aa41-7918-4047-808c-b87342537b04","resolution":{"observed_at":"2026-08-12T13:59:36.921604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.904642Z","title":"The inaturalist species classification and de- tection dataset","venue":null,"work_id":"ba39eb80-c0ec-4a45-b01f-f6600e9ac82f","year":2018},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.362071Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:2fd6eb7656b480ebdfaba1677d5c99b598de7e0863fc0dc43a5f73591604e79b","observation_id":"d4306c5c-5350-40be-a1a1-e9d2f647d87e","resolution":{"observed_at":"2026-08-12T13:59:36.908604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.365916Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.365916Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:5a75e5ee35a51777c1abc4a01040576150ed71d5cfcadb25aaa52e0e54fec5ef","observation_id":"fd3cc78a-db4f-4275-9230-f92fded43f8e","resolution":{"observed_at":"2026-08-12T13:59:36.365916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.884347Z","title":"Dense contrastive learning for self-supervised visual pre-training","venue":null,"work_id":"30e7a356-8a4e-4599-acbd-c8d6994a023a","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.370044Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:a22598dcd71e6df45cedb2c98d49b537b98dae7b423b413d273a55325965ec42","observation_id":"c21843a7-1cc4-4fb6-b6d0-a03cbfb301fd","resolution":{"observed_at":"2026-08-12T13:59:36.888226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09133","last_updated":"2023-01-12T18:45:58Z","snapshot_observed_at":"2026-08-13T18:12:41.802212Z","submitted_at":"2021-12-16T18:59:59Z","title":"Masked Feature Prediction for Self-Supervised Visual Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09133","snapshot_observed_at":"2026-08-12T13:59:36.374197Z","title":"Masked feature predic- tion for self-supervised visual pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.374197Z"},"links":{"cited_paper":"/paper/2112.09133","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:bcb13b017967d50cbcfba1eb3ddc5c09021ea0e8c67e7f4391c2bccaa30a9940","observation_id":"0b6c0f23-d613-4c04-a131-7ab4fed5a8bf","resolution":{"observed_at":"2026-08-12T13:59:36.374197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.873102Z","title":"Batchensemble: an alternative approach to efficient ensemble and lifelong learning","venue":null,"work_id":"7c6bef70-ca3e-4b42-a640-ad23342e5b63","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.379007Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:a57dde76f657f6e66baf8d35a28a51f8f56eeb6789700543fae08087acfed714","observation_id":"8f63cfc6-8ea1-4a29-8c9c-fbd761f90e77","resolution":{"observed_at":"2026-08-12T13:59:36.877196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.860739Z","title":"Con- vnext v2: Co-designing and scaling convnets with masked autoencoders","venue":null,"work_id":"87eea922-ced8-45c6-a7ee-b6e44717b78a","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.383605Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:0e6632d3af1c82da0b9c83c0c5d3a190e8580366591b9e3bdeb75976b6553a0c","observation_id":"fd8cabfb-f044-4e51-ae64-d8cf6949b0e4","resolution":{"observed_at":"2026-08-12T13:59:36.865107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.846852Z","title":"Cvt: Introducing con- volutions to vision transformers","venue":null,"work_id":"549618e2-f416-4589-b6f8-9736a3819f3a","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.387576Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:d6878c258878164e1698606e5ec532b97205df4169b2110452b05f6cf4ebc805","observation_id":"3f8ca473-1b5c-482f-ad48-83bae95b1767","resolution":{"observed_at":"2026-08-12T13:59:36.851238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.832944Z","title":"P2T: Pyramid pooling transformer for scene understanding","venue":null,"work_id":"5b25e156-62cb-4248-b6c4-287a3b4b4626","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.391428Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:b80a6c34655a879c3881685ddac768b28897ae24690c8be26a5f755bd4997e8c","observation_id":"d1933b00-fa25-46b6-9444-27b306a7c594","resolution":{"observed_at":"2026-08-12T13:59:36.837973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.820786Z","title":"Unified perceptual parsing for scene understand- ing","venue":null,"work_id":"c35ecf7b-e6fd-4815-9d20-4956fd5191b7","year":2018},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.395599Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:807de00d30a568e84d5396370ef410c0fca9a857708a004ea7bd3a263383977d","observation_id":"85ef4907-c63c-486a-81d0-55e8f7d0a51e","resolution":{"observed_at":"2026-08-12T13:59:36.824794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.809115Z","title":"Detco: Unsu- pervised contrastive learning for object detection","venue":null,"work_id":"0358517b-d1e8-4c1a-b10e-3231fe612856","year":null},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.399528Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:da7782b54605653a162e3d12842290816ae702e309075dd6ee4b9db1901a333e","observation_id":"b3a14ab8-cde0-4d9a-b440-18f5bb7d8396","resolution":{"observed_at":"2026-08-12T13:59:36.813107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04553","last_updated":"2021-05-11T17:28:00Z","snapshot_observed_at":"2026-08-13T19:25:16.161654Z","submitted_at":"2021-05-10T17:59:45Z","title":"Self-Supervised Learning with Swin Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04553","snapshot_observed_at":"2026-08-12T13:59:36.404002Z","title":"Self-supervised learning with swin transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.404002Z"},"links":{"cited_paper":"/paper/2105.04553","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:1497a2f50e80a9032846bbca4fa8cd0aafd464ee61ba05a8e95ee225e422eed0","observation_id":"e9c44f02-2f1e-4160-ba2c-222945df8fcb","resolution":{"observed_at":"2026-08-12T13:59:36.404002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.797536Z","title":"Propagate yourself: Exploring pixel-level consistency for unsupervised visual representation learning","venue":null,"work_id":"c74fc69f-8372-4b38-a5ce-a34c3d3f4b06","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.408074Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:c14db2ce75b15e63d3474874e6518593e04bcae3285b8a691304117e785941dc","observation_id":"586afe26-a476-4a99-b125-432adefc9de2","resolution":{"observed_at":"2026-08-12T13:59:36.801568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.412172Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.412172Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:dd4b88eaab86316ae1fca05f9799b502b6abcc34d504a9ee06fe9022b00fd57d","observation_id":"2262c200-fa96-41d5-9fda-4b9c8c84af89","resolution":{"observed_at":"2026-08-12T13:59:36.412172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.777797Z","title":"Bag of instances aggregation boosts self-supervised distillation","venue":null,"work_id":"bec812bc-cd90-4709-a94f-96fa950924ae","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.416426Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:bf81839a9897c912ba43b8cf8e1821df352e70884af8bff59ecd67d5f830803d","observation_id":"6aab7386-a01d-4f1e-a02d-c4deaeeaa838","resolution":{"observed_at":"2026-08-12T13:59:36.782035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.420129Z","title":"Joint unsuper- vised learning of deep representations and image clusters","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.420129Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:464de2569f83fd38a25d1ed15b74e1e91a0dfcf63157389b26b53890dfa074a5","observation_id":"d73d5289-4ec1-4238-b808-479c9960f467","resolution":{"observed_at":"2026-08-12T13:59:36.420129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.755672Z","title":"Decoupled contrastive learning","venue":null,"work_id":"8ab5351e-6a9f-4a3f-a017-bf8e016160d7","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.424067Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:71cc1cf50b4f14fd8f0f12e64f69a965e060d50ac70836aa82ebb1e5b6b11727","observation_id":"b611e978-ca13-4602-a3a5-b61a99a31d0e","resolution":{"observed_at":"2026-08-12T13:59:36.759788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.742093Z","title":"Online deep clustering for unsupervised representation learning","venue":null,"work_id":"cbea7ee5-ec22-487b-8aa9-744318b42dc5","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.428108Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:f478d37bb6d5a887350b699bee5da81c8a0320b1ad4fe2d9de49709f730828cb","observation_id":"da304176-fd51-44a5-8855-0610b6db12f6","resolution":{"observed_at":"2026-08-12T13:59:36.745952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.727984Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"79466df3-6e9b-49e3-b3b7-89e09c398635","year":2017},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.432014Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:b5b77fc5ef1f1ef39906eb61747e6511eba5678a1bbe52d48340ee0448539978","observation_id":"d104ba81-a887-4d37-9d54-85f9fd059ddd","resolution":{"observed_at":"2026-08-12T13:59:36.732631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.715335Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":"a3c9a13f-20dd-4a61-93c4-05646a14f2af","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.436927Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:811ea322a9833ea1b445b8ddbd99585a1d179aa4de62fc3ee583df012299ce49","observation_id":"59d1a300-238d-4504-bd43-6c4df54e38fb","resolution":{"observed_at":"2026-08-12T13:59:36.719476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14415","last_updated":"2022-03-27T23:42:05Z","snapshot_observed_at":"2026-08-13T16:14:30.894916Z","submitted_at":"2022-03-27T23:42:05Z","title":"Mugs: A Multi-Granular Self-Supervised Learning Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14415","snapshot_observed_at":"2026-08-12T13:59:36.441292Z","title":"Mugs: A multi- granular self-supervised learning framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.441292Z"},"links":{"cited_paper":"/paper/2203.14415","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:b43b4e7533e7aacf5f08c357d3f703873cba9fe7b31b54d95dbf23d97691f579","observation_id":"3209ecb5-4892-4949-a2d5-7eb2ad445a7b","resolution":{"observed_at":"2026-08-12T13:59:36.441292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.703545Z","title":"Multi-label self- supervised learning with scene images","venue":null,"work_id":"90ad0c5b-ba6d-410e-a5cb-a5f46301406d","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.446502Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:f0470acbe5565d42fc3b872f66c5825914d20c4ac1049699aa256cfe8febb116","observation_id":"a1d707bd-7ebc-4ab5-baa6-8d2b9186b074","resolution":{"observed_at":"2026-08-12T13:59:36.707319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":52},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2411.15787."}