{"as_of":"2026-08-16T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1efcdd0c76f3df7093530284b9d91b4a062af9fd9173b0439445151d278bf353","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:06:00.353383Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.03871/citation-record","integrity":"/paper/2412.03871/integrity","json":"/paper/2412.03871/citation-record.json","paper":"/paper/2412.03871"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.090553Z","title":"Contrastive learning of medical visual representations from paired images and text,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.090553Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:088cc42884d8c75c144f7aa2d1c97cc368b62fa91abced6f12f723d0e35aa289","observation_id":"91946815-836d-4d45-a606-ecccd9ecf1eb","resolution":{"observed_at":"2026-08-11T22:06:00.090553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.095675Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.095675Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:07e3428126de5ba626730abc539af1ec56ef942a9c6179c5ba5edcb407129287","observation_id":"0aea3cd7-3cae-4250-8527-1152206ae3ee","resolution":{"observed_at":"2026-08-11T22:06:00.095675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:01.044959Z","title":"Vlmo: Unified vision-language pre-training with mixture-of-modality-experts,","venue":null,"work_id":"2de564c8-217b-4e7c-a6b8-2d7cbc2127ab","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.100573Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:1a50d4d60943db320a01a86376222e7787a8c27699ddbf475ff84e667d98a589","observation_id":"bdbee442-6410-4f1b-8cf0-00cf44c82418","resolution":{"observed_at":"2026-08-11T22:06:01.049391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.104843Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.104843Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:78176e5a530a4f1b4bc4d7011c32544d994136648c1be5a8919c7cb21a5f52a1","observation_id":"ad94a0b6-cecf-40c4-8f46-45737d4c9243","resolution":{"observed_at":"2026-08-11T22:06:00.104843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07966","last_updated":"2020-01-23T08:03:27Z","snapshot_observed_at":"2026-08-13T04:05:30.435237Z","submitted_at":"2020-01-22T11:35:58Z","title":"ImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised Image-Text Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.07966","snapshot_observed_at":"2026-08-11T22:06:00.109020Z","title":"Imagebert: Cross-modal pre-training with large-scale weak-supervised image-text data,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.109020Z"},"links":{"cited_paper":"/paper/2001.07966","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:ad03dca81d00ab0dc6c45b0f25ea64fdb5ba76edf72996c1300b86f11cea68da","observation_id":"ca36181f-c706-41ec-8116-a6c34923517b","resolution":{"observed_at":"2026-08-11T22:06:00.109020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:01.026096Z","title":"Reproducible scaling laws for contrastive language-image learning,","venue":null,"work_id":"434f92c0-0931-481d-9c9d-b90066af9444","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.113671Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:5e1fa01e983fdc644b8fbed5a0ae16ed7a2a30942aa8307e6d44926d2586300a","observation_id":"e7c8122b-57ed-4cea-843a-0ee1e67cef29","resolution":{"observed_at":"2026-08-11T22:06:01.029833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.117928Z","title":"Scaling language- image pre-training via masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.117928Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:51271725dd71b0e651d03429f339c06bba33843662e7b4596ccbb4d2b7a88507","observation_id":"e5845aab-7b1b-41e8-a85d-afd68ca91055","resolution":{"observed_at":"2026-08-11T22:06:00.117928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:01.006257Z","title":"An inverse scaling law for clip training,","venue":null,"work_id":"1fc862fa-4467-4841-9777-bacf1fcb1351","year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.121503Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:90865a3766c369afd58dd05699484263cc26753eac31dfd704dd9056be9eac01","observation_id":"7ca70f1a-34ae-4d63-b0f3-1b88000e0dfe","resolution":{"observed_at":"2026-08-11T22:06:01.010717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.994616Z","title":"Supervision exists everywhere: A data efficient contrastive language-image pre-training paradigm,","venue":null,"work_id":"de4bc6f0-61d2-400a-ab1f-3de333b7c731","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.125049Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:43392832f3b73ebc0fb445dd02ad2663bb25937d6d6342f97dabb4519f416221","observation_id":"8e6cf8b0-f751-40e8-b4c1-fb9357e61d26","resolution":{"observed_at":"2026-08-11T22:06:00.998963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.984025Z","title":"Too large; data reduction for vision-language pre-training,","venue":null,"work_id":"f9b6482d-0a59-4dc9-8142-de303cbd6b0a","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.130194Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:7a4490908352cd3a61f4e1e778d84c7e88a7cd7de9e5d6de67e05f18326aeafe","observation_id":"6b4bbdfb-7b62-4e36-b559-e21730856a97","resolution":{"observed_at":"2026-08-11T22:06:00.988030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.973385Z","title":"Slip: Self-supervision meets language-image pre-training,","venue":null,"work_id":"b190563d-a68e-48da-841f-e3b1c9b6aa1d","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.134764Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:a4cb1a16334d670360ac9b37e92763204c94273078b553cd5b17cf4dc54b6109","observation_id":"3e8eba59-80c7-4892-879a-b7070098a7dc","resolution":{"observed_at":"2026-08-11T22:06:00.977198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.138881Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.138881Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:b8d7aad2574c234a20bce9a37c0766f57b848b6310b755d25f8efa1b16b37830","observation_id":"e8482758-cd0d-4f74-9b3f-87a6816d2436","resolution":{"observed_at":"2026-08-11T22:06:00.138881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.142872Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.142872Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:19a88ea1bd5e92825f748bc6660a5233abeed5ec626e717d6c9e817500231671","observation_id":"88ca24f7-999f-4835-b6c1-ac0fa8ddc1f8","resolution":{"observed_at":"2026-08-11T22:06:00.142872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.147060Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- tioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.147060Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:ea2d7549504d2cb06c6a19549f98a21c9b095d7087084cc56f419a45fb0ff648","observation_id":"20bf84cc-3960-46ff-b846-cb466ae9e1dc","resolution":{"observed_at":"2026-08-11T22:06:00.147060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.935048Z","title":"Image as a foreign language: Beit pretraining for vision and vision-language tasks,","venue":null,"work_id":"a6ac169d-aa79-4c21-8f46-a81495488064","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.150607Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:081d66e53de2e3ba4bb38f687abdab90e888d350ad7c390d4735c984e9a270f7","observation_id":"89f84f21-96d0-47ff-9ca2-a5aa5a72519c","resolution":{"observed_at":"2026-08-11T22:06:00.941175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.919620Z","title":"The crucial role of data collection in research: Techniques, challenges, and best practices,","venue":null,"work_id":"05e1a11c-87cc-447d-96ad-5e5774821dc9","year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.154213Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:25adfd4f9bf496dde417441b4cd604ac403ab031add7615e42d70c8ab567d09a","observation_id":"236d816a-d82f-4d93-9908-254da5e0ef32","resolution":{"observed_at":"2026-08-11T22:06:00.924510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.906472Z","title":"Tinyclip: Clip distillation via affinity mimicking and weight inheritance,","venue":null,"work_id":"9a134aed-ff77-4023-9314-6ede55be1719","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.159558Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:a69807819fe9d2311addebbb7ad564ffe5a7fcbc50805103c90aeb1c0fe53327","observation_id":"8288412d-19ea-4192-9e22-fd875dd932ea","resolution":{"observed_at":"2026-08-11T22:06:00.911260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.163378Z","title":"Clip-kd: An empirical study of clip model distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.163378Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:2bba8599dec6872807b08579f6ed372377be98a7f02d82943b421bba9a3c603e","observation_id":"512d4a61-f85b-45fc-934b-32f5880b9690","resolution":{"observed_at":"2026-08-11T22:06:00.163378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.167013Z","title":"Mobileclip: Fast image-text models through multi-modal reinforced training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.167013Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:0e3cca54ad5600b9e4341f4bf18d69f9325b8a1b0dcd93d6dd76150b486b9a30","observation_id":"4d795658-3725-4daa-b2ad-9e4431d2f4cd","resolution":{"observed_at":"2026-08-11T22:06:00.167013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04145","last_updated":"2024-08-21T01:36:27Z","snapshot_observed_at":"2026-08-16T13:27:49.377355Z","submitted_at":"2024-08-08T01:12:21Z","title":"ComKD-CLIP: Comprehensive Knowledge Distillation for Contrastive Language-Image Pre-traning Model","version":3},"cited_work":{"arxiv_id":"2408.04145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.04145","snapshot_observed_at":"2026-08-11T22:06:00.464474Z","title":"ComKD-CLIP: Comprehensive Knowledge Distillation for Contrastive Language-Image Pre-traning Model","venue":"cs.CV","work_id":"d3f78f65-2eb5-4738-8352-decda4445a2a","year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.170818Z"},"links":{"cited_paper":"/paper/2408.04145","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:8d8e45e6e0173bd5af0ad2d7f49a2ba9f038dcaeffb42e1f2a95bfa8fdaba843","observation_id":"abced0f7-245b-4d67-89f8-3de1d07393e5","resolution":{"observed_at":"2026-08-11T22:06:00.470348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09441","last_updated":"2024-12-16T11:26:26Z","snapshot_observed_at":"2026-08-16T13:25:45.267255Z","submitted_at":"2024-08-18T11:23:21Z","title":"CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09441","snapshot_observed_at":"2026-08-11T22:06:00.174773Z","title":"Clip-cid: Efficient clip distillation via cluster-instance discrimination,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.174773Z"},"links":{"cited_paper":"/paper/2408.09441","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:89331977fed1d55cdbe30e9d7a6b6dfff488763a6aec922d3f07869ca30e2cc2","observation_id":"11b0426b-1949-4225-a587-212e3adc196a","resolution":{"observed_at":"2026-08-11T22:06:00.174773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.875844Z","title":"Module-wise adaptive distillation for multimodality foun- dation models,","venue":null,"work_id":"d15781a2-eab9-42c8-9eab-916552d91b5f","year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.179242Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:8ffd29330ca2666c8438a6b5cd91f99ae4ee990ac3cd49d3b5a6f519a1bae6c6","observation_id":"98bb1143-be61-4147-842b-fc4dcc342547","resolution":{"observed_at":"2026-08-11T22:06:00.880132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.862702Z","title":"Self-supervised co-training for video representation learning,","venue":null,"work_id":"3fd8dae9-b306-4d46-b581-8bcbf9d45c70","year":2020},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.182919Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:9d882fc8f702d921a842d8439d81e9b094c12c4cdd7fa0204aefae91d8b8f53e","observation_id":"64a7479b-8a93-41b1-b089-879819650dfe","resolution":{"observed_at":"2026-08-11T22:06:00.867734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.849739Z","title":"Improving generalization via scalable neighborhood component analysis,","venue":null,"work_id":"c51e03b4-0018-4d59-940c-a4d16b5d6d27","year":2018},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.186788Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:33df094adbe844ececf70f7f33ce98b4bf16a380095225a517f82d2c988ad91a","observation_id":"a58589fe-c8c8-4090-a7e6-35ce51f73929","resolution":{"observed_at":"2026-08-11T22:06:00.854101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.190524Z","title":"With a little help from my friends: Nearest-neighbor contrastive learning of visual representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.190524Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:3a466e41626714cb7d37244a8c0f414f96f5e46a3092a0ea2b00d957abb81406","observation_id":"94da781f-6637-4cea-8bb5-9e987f1f8841","resolution":{"observed_at":"2026-08-11T22:06:00.190524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.828683Z","title":"Promoting semantic connectivity: Dual nearest neighbors contrastive learning for unsupervised domain generalization,","venue":null,"work_id":"f8f6aa04-5ed1-4924-88c8-b340110e465e","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.193769Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:f4fb058528e77c58ad62a2c7a38b97147fc372d3a44c9766cac914c9b886f37e","observation_id":"1190b91c-0203-492d-ad08-ee158f2b05a1","resolution":{"observed_at":"2026-08-11T22:06:00.833909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.197171Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.197171Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:8b6588d6f144889023a243f5fc612557b2b5162d7f34d4f87629bb471cb127a5","observation_id":"026e746f-b4b5-41f5-aeef-8fa9ecbd9c5b","resolution":{"observed_at":"2026-08-11T22:06:00.197171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.200851Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.200851Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:fc051f3b2b1f4d2b6a86157ec8c23c8c8ab46f3ff48eaac2ede9b67d9f34ed07","observation_id":"c06e4be7-ac28-48c5-8350-0831648a41c9","resolution":{"observed_at":"2026-08-11T22:06:00.200851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.204377Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.204377Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:68516cfd1bdb4f47e41a5e06768c2c999ca33b623936e513ec440f1d18c4e5a5","observation_id":"4a203864-f0f4-446b-8b9f-f7c74ca00559","resolution":{"observed_at":"2026-08-11T22:06:00.204377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10936","last_updated":"2022-07-16T01:27:59Z","snapshot_observed_at":"2026-08-16T17:20:17.721189Z","submitted_at":"2022-02-18T15:15:46Z","title":"A Survey of Vision-Language Pre-Trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10936","snapshot_observed_at":"2026-08-11T22:06:00.207800Z","title":"A survey of vision-language pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.207800Z"},"links":{"cited_paper":"/paper/2202.10936","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:9755db7f8bfd4588a11dc8a0457720e734be3511ac7c49bb2a2dda0659f5fbf4","observation_id":"d1db178b-18c5-4aab-af74-5a9d5e858327","resolution":{"observed_at":"2026-08-11T22:06:00.207800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.211525Z","title":"Vlp: A survey on vision-language pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.211525Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:1914461b48339303971329e74faeea9f25bb5de56c3a2a3cf51406ab51941943","observation_id":"f8bb8222-28f2-4be0-a75b-cea192dc845b","resolution":{"observed_at":"2026-08-11T22:06:00.211525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.780035Z","title":"Self- supervised learning of visual features through embedding images into text topic spaces,","venue":null,"work_id":"5426d911-8105-4272-b2b8-8392cedd45ad","year":2017},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.214468Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:14b044b32dcfef02b789c5d9d989b5ebcb1000eea48a49decf60754b40b9db48","observation_id":"90cd535b-2824-4fe1-ad29-2685a4b6ed02","resolution":{"observed_at":"2026-08-11T22:06:00.784451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.767335Z","title":"Beyond instance-level image retrieval: Lever- aging captions to learn a global visual representation for semantic retrieval,","venue":null,"work_id":"67a4d7d1-d63f-43bc-a487-4d11283c5cd4","year":2017},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.217478Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:0ba3aca8819754ce21058d8b4ff934339d9af99acf411f9991ae6c01284bc219","observation_id":"ac14d9e5-3188-4772-9bff-50f865e083a9","resolution":{"observed_at":"2026-08-11T22:06:00.771795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.754130Z","title":"Learning visual n-grams from web data,","venue":null,"work_id":"380e4150-1d02-45e9-8bf4-c740c46fe6ef","year":2017},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.220250Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:3534323bdaa92647e49269f9c5db0993539f47cd1432329d2c8cc40825c7e5a4","observation_id":"2b30d2c5-aa1d-4108-b940-11841b3b8923","resolution":{"observed_at":"2026-08-11T22:06:00.759054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.223160Z","title":"Virtex: Learning visual representations from textual annotations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.223160Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:7fc208cbdd9cba408918ebe919509be3cafaefa22d2d59e5d6ed47a092aefdda","observation_id":"0b009b12-0821-4b51-aea5-1e57736515ff","resolution":{"observed_at":"2026-08-11T22:06:00.223160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.226288Z","title":"Learning visual representa- tions with caption annotations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.226288Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:00e6cb681334af1b93b05f77892b0d698397083e7336e046d4a8ecd137961390","observation_id":"7f330f13-f532-4857-a9cc-48442ff3b788","resolution":{"observed_at":"2026-08-11T22:06:00.226288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.720894Z","title":"Combined scaling for zero-shot transfer learning,","venue":null,"work_id":"341dadcc-965c-4924-aa1c-5fcbe8b9b372","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.229123Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:b55abd170eeb967b9765df4508726864f8595540728789e06941a0797d7dd6ed","observation_id":"925d989d-082b-43e3-b996-21cc8e9798e9","resolution":{"observed_at":"2026-08-11T22:06:00.724957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.711013Z","title":"SimVLM: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":"4064524b-9a26-4cd1-b7b4-803e60346f96","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.232081Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:ae07dfdbca65c9c1339f1dfff6560f0640478d32f2408939d73bea7b9d6d4d7b","observation_id":"156132af-75b2-4825-9262-f41f3e8c6ad6","resolution":{"observed_at":"2026-08-11T22:06:00.714698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-11T22:06:00.234692Z","title":"Florence: A new foundation model for computer vision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.234692Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:2ba4f69fa000515564874490e650f3de8cb40872bd41a6fd52529b6b70f2d7b3","observation_id":"b52c001c-90ff-4127-9a22-83093896cc27","resolution":{"observed_at":"2026-08-11T22:06:00.234692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.701076Z","title":"Lit: Zero-shot transfer with locked-image text tuning,","venue":null,"work_id":"ae3a88bd-bf23-4bb4-9f48-ed5f4154d2f9","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.238602Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:2387681fe93a4511887141eff46950b0db4f3fce7fb07c6c1d525d51782b7e4f","observation_id":"063d9e71-4045-4488-9ea2-588180f339e7","resolution":{"observed_at":"2026-08-11T22:06:00.704730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.690047Z","title":"Compressing visual-linguistic model via knowledge distillation,","venue":null,"work_id":"0a32b5ad-84a7-49c7-bd80-1bf59ab023a7","year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.241819Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:c316eee2e7d4e25c07b5b168b04773946ef5c3168a93d03ae09f7de418c3a60b","observation_id":"a5d540bb-1243-4d9e-bab9-45b2237b970a","resolution":{"observed_at":"2026-08-11T22:06:00.693660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.679835Z","title":"Distilling large vision-language model with out-of-distribution generalizability,","venue":null,"work_id":"d26de104-55fd-4444-beaf-ab79e92b0181","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.245036Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:bed1884e5afc0c88bb0ef46c8d030c8613150b54939616ea7bd8e2e82cfaf24c","observation_id":"3ca00690-42f1-4dff-b713-28007b1779d7","resolution":{"observed_at":"2026-08-11T22:06:00.683490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10496","last_updated":"2022-04-28T17:43:36Z","snapshot_observed_at":"2026-08-16T17:05:21.875631Z","submitted_at":"2022-04-22T04:41:04Z","title":"Multimodal Adaptive Distillation for Leveraging Unimodal Encoders for Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.10496","snapshot_observed_at":"2026-08-11T22:06:00.248566Z","title":"Multimodal adaptive distilla- tion for leveraging unimodal encoders for vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.248566Z"},"links":{"cited_paper":"/paper/2204.10496","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:cfdd66c253df93270bfd63cc323baf4af5471ab24e94f541545f1078dd8145be","observation_id":"d168bf67-5684-46a2-901a-3d40d0ec970d","resolution":{"observed_at":"2026-08-11T22:06:00.248566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-11T22:06:00.252477Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.252477Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:f2e5c7827e88c16ac10f974811a522d1d6256e20d44c1cc699ed6bf48048bb08","observation_id":"96d6f81d-acd0-499d-a518-27fd20d71bc7","resolution":{"observed_at":"2026-08-11T22:06:00.252477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.256071Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.256071Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:00b61b01fcd19213924606340747dd058afc0887ee1cde76f37db15e65245ef8","observation_id":"38f597db-d92e-4f1d-8958-428760d598e7","resolution":{"observed_at":"2026-08-11T22:06:00.256071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.259290Z","title":"Pytorch image models,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.259290Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:905e9eaffa0e6a603b0e8a1f594d0eabeb1f4c445a5e79a80e1a801c58c3026e","observation_id":"f4209112-e2f7-4097-bd4b-46c69d80807a","resolution":{"observed_at":"2026-08-11T22:06:00.259290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.657973Z","title":"MobileBERT: a compact task-agnostic BERT for resource-limited devices,","venue":null,"work_id":"9923432c-648a-4a72-9334-688122780e44","year":2020},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.262663Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:9702d2aa1614659f8ae83adb9269741c0d72b2854683c84c4f2f74e0d6d0c96b","observation_id":"3a61defe-dde8-4b7c-ba72-7e3c30db0a81","resolution":{"observed_at":"2026-08-11T22:06:00.661894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.266138Z","title":"A convnet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.266138Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:0c59467e02a6ffdc765f51e44aee3be62d384268f6909f98b6c8fe76d3e18c4d","observation_id":"6e400ef1-71af-4e03-a2d6-8db114ad7506","resolution":{"observed_at":"2026-08-11T22:06:00.266138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10518","last_updated":"2024-09-29T21:58:22Z","snapshot_observed_at":"2026-08-16T14:00:30.376634Z","submitted_at":"2024-04-16T12:41:25Z","title":"MobileNetV4 -- Universal Models for the Mobile Ecosystem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10518","snapshot_observed_at":"2026-08-11T22:06:00.269384Z","title":"Mobilenetv4-universal models for the mobile ecosystem,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.269384Z"},"links":{"cited_paper":"/paper/2404.10518","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:8676f08444d58e989de4702eea40622cf25e508bd01f4a29066b867d94282713","observation_id":"1fb58ed0-7f95-4fb1-af0a-cd1c801b0c5e","resolution":{"observed_at":"2026-08-11T22:06:00.269384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.642083Z","title":"Big transfer (bit): General visual representation learning,","venue":null,"work_id":"77008822-0214-41f1-9ce8-96f78deb093b","year":2020},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.273076Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:f8db19baea370231f38e4ee9eaa37547acd63987bf49f44817d58579760500fe","observation_id":"b26d086a-b239-4fbb-a27d-2f4f475085da","resolution":{"observed_at":"2026-08-11T22:06:00.645346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.276429Z","title":"Identity mappings in deep residual networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.276429Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:8af8c5f24a7efd12107da20721620b5f3abe16a4747294f9103bd52eba62de7b","observation_id":"01984534-8d08-4e14-a204-b54f5b76e920","resolution":{"observed_at":"2026-08-11T22:06:00.276429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.279965Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.279965Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:fe25af257a40d5df01c295b946e8e0e4662507497113a67c75a57c817c298289","observation_id":"53c711ba-8155-49c4-9ca8-549a181a1cf7","resolution":{"observed_at":"2026-08-11T22:06:00.279965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.283293Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.283293Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:3382021449e87d195c9996a5f3c5cefb2bce971da06bfa404dcc6e4e14c4eb56","observation_id":"9528bc2e-a8cb-414b-99a2-83d8f1c54636","resolution":{"observed_at":"2026-08-11T22:06:00.283293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.615075Z","title":"Algorithm 799: revolve: an implementa- tion of checkpointing for the reverse or adjoint mode of computational differentiation,","venue":null,"work_id":"08ec4031-f079-4101-ae7c-a07436eabf4d","year":2000},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.286716Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:cac4fbf48bb003ffa0de3f1d89ccbaa7375bdae510062303ae79477249e50851","observation_id":"037f5969-2b5b-4763-bf50-9e497fe88522","resolution":{"observed_at":"2026-08-11T22:06:00.619079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-11T22:06:00.289929Z","title":"Training deep nets with sublinear memory cost,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.289929Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:9655d7714d677dcfee5a436f1a8c12d97b299ac84221575f20a60dedf3b4c581","observation_id":"49120462-847a-42d0-8b3d-9e0d85a1b312","resolution":{"observed_at":"2026-08-11T22:06:00.289929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.604976Z","title":"Mixed precision training,","venue":null,"work_id":"b77bd294-a9ea-4b72-9e59-3b3340583144","year":2018},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.293603Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:434e51a12e52b1785d86de8913156ea0e4b026699fa2d5e0d05695800cbfbd07","observation_id":"dd24f8c8-fb05-4cb6-b22d-7cc28335a625","resolution":{"observed_at":"2026-08-11T22:06:00.608386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.296954Z","title":"An analysis of single-layer networks in unsupervised feature learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.296954Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:768de48592d810cdb3c4d1f64259682fa6146a11a467989fa7eccac2cb959834","observation_id":"cc95b177-27c6-41dc-b72e-b3cf8d6e0854","resolution":{"observed_at":"2026-08-11T22:06:00.296954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.587822Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":"e9aa0f0c-753e-4f8a-a933-a3f166dfc88a","year":2009},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.300463Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:eddfb801ecbc3d3b4d6ddb44fdd028e752fc09cb956bd9912ed1612331954ecd","observation_id":"c7bee03e-4e57-4228-983c-ec90e8a1a218","resolution":{"observed_at":"2026-08-11T22:06:00.591862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.577665Z","title":"Human action recognition by learning bases of action attributes and 14 parts,","venue":null,"work_id":"7672835c-ce2a-4351-a8b6-472feb7f3841","year":2011},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.303985Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:7dd0f186dcada46d40d372ece00bb99d6ce797aa03ad97e78d7e15583242cc63","observation_id":"fd03d16d-6366-4ec8-aa8f-172ff09cee95","resolution":{"observed_at":"2026-08-11T22:06:00.581109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.567703Z","title":"Do imagenet clas- sifiers generalize to imagenet?","venue":null,"work_id":"1854c619-8d07-4379-bcfb-12383071c5b8","year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.307645Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:a5da62b38a7d11c099cfd666fff4d489bbbe9f0e0c51777fd8e823b3a4cb32cd","observation_id":"a80240a3-fbb7-4a3f-93cf-be9ac967d8a6","resolution":{"observed_at":"2026-08-11T22:06:00.571263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.310953Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.310953Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:de34e8c1f51a834a7d5b2f4fb9bb0fd611f7c03d6a1f43a23be5bc3b328b2a9e","observation_id":"aefd8b45-d5df-49b4-a8e9-d8c3b99f703a","resolution":{"observed_at":"2026-08-11T22:06:00.310953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.314256Z","title":"Natural adversarial examples,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.314256Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:f37d54144fac26a1552bffae5b935e09381ce9889426a29bcf3fb9b8def4ca93","observation_id":"539b9788-7af3-40cf-b5e9-16ba2ea8a00c","resolution":{"observed_at":"2026-08-11T22:06:00.314256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.546178Z","title":"Learning robust global representations by penalizing local predictive power,","venue":null,"work_id":"2169f1e9-3c74-4a03-bfe4-4b4c284e7ba5","year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.317590Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:00ddbef40038bfe5dd1deee52058b4ba7210624e0726110a80e1476df73a8690","observation_id":"3e797959-6474-4019-ab3c-9e05e8030a02","resolution":{"observed_at":"2026-08-11T22:06:00.549967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.320891Z","title":"Cats and dogs,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.320891Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:4a11aae5374b057e307a08eca582a46bd9bf6f2efc7f712503951190d42c5c1a","observation_id":"f2ac2cc0-e8e2-44a5-81a3-e69ae3f039d5","resolution":{"observed_at":"2026-08-11T22:06:00.320891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.323621Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.323621Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:ea790a053cf61bc8ca9e3e373699a4d94d2d0ac0dc58b9e16c952f4c4554464d","observation_id":"a1449af8-2a7c-4dec-87dd-f55bcb7359df","resolution":{"observed_at":"2026-08-11T22:06:00.323621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.326785Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.326785Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:a5cc7e375e0b71c078dd3c20e3fad5e36d236f4638bf91936b5bf931e7eb0f58","observation_id":"29563316-e331-4aa3-80d8-a946108cc0d1","resolution":{"observed_at":"2026-08-11T22:06:00.326785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-11T22:06:00.329530Z","title":"Fine- grained visual classification of aircraft,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.329530Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:2aecb9f89cb0062f090ca2d2247fcd1a614086705586c885ed2554f12e55d908","observation_id":"098783a8-9ee8-4094-be52-00cd110e5e21","resolution":{"observed_at":"2026-08-11T22:06:00.329530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.333125Z","title":"Food-101–mining discriminative components with random forests,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.333125Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:bedb75cdbe5e7788bc8e7438869f2143c44f3bb2b87121c6e9c3e44d47cb2da5","observation_id":"2ba57d51-3a69-41aa-8b41-9e61daa0cb44","resolution":{"observed_at":"2026-08-11T22:06:00.333125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.335701Z","title":"Describing textures in the wild,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.335701Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:69b33fd20418522140f746fe9767475712509361f25ebab720eb6760af3f6baa","observation_id":"c08a64fc-c9f0-4911-a6e4-b56e013a7d3f","resolution":{"observed_at":"2026-08-11T22:06:00.335701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.338608Z","title":"Sun database: Large-scale scene recognition from abbey to zoo,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.338608Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:43f47a97f61e9c9a6f2074dafdf5c4b138d2c8e0c2421b2e1b9b439ed1c0ee8d","observation_id":"52fe8b59-0b0e-4a61-a699-08119d0c2d7e","resolution":{"observed_at":"2026-08-11T22:06:00.338608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.341399Z","title":"Collecting a large-scale dataset of fine-grained cars,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.341399Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:52115bba0bcfbbe5f1226c986ec84b3f90d45e3c505ca4f759b51ca9052a4dcf","observation_id":"4cc371d4-12f0-41b8-b9c9-5bb66dc9ef3f","resolution":{"observed_at":"2026-08-11T22:06:00.341399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.344080Z","title":"3d object representations for fine-grained categorization,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.344080Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:e93e980fa4f294d5e0fb06bd4c632222e6d65638ef725bf4d750858084b7f75a","observation_id":"de58c476-3a39-4ef7-a0a4-50997fcf47cc","resolution":{"observed_at":"2026-08-11T22:06:00.344080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T22:06:00.347067Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.347067Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:ada0b6246c855d4ec49a5bc77151a5f407bb185122b27da1b925955e988a23ff","observation_id":"51ec20a6-c923-4b42-b048-a8bdd9703bae","resolution":{"observed_at":"2026-08-11T22:06:00.347067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.350128Z","title":"Knowledge distillation: A good teacher is patient and consistent,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.350128Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:715b0aee3b372ad63fa3629b046c447334182637b7702047e300d77ba026daed","observation_id":"470a26e8-36c3-46ed-a93a-cf747da79d27","resolution":{"observed_at":"2026-08-11T22:06:00.350128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.486711Z","title":"The efficiency misnomer,","venue":null,"work_id":"440d14f9-0090-4e2e-ae6a-66f7c0fe91ed","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.353383Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:b1eda9d03d7f80c0f5fc1e16131237c131ca487b803025b25c326c68fbc1ee38","observation_id":"c0a7247d-e83d-4c79-ab06-b97a3876c7fa","resolution":{"observed_at":"2026-08-11T22:06:00.490177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T00:53:32.061705Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2412.03871."}