{"as_of":"2026-08-19T01:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58c2a2f3cfa26c69cdf5e4a2182357aec639aca27ed0fb0b00bbe2fbbeae5b3e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":50,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:12:08.581177Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1196,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T10:21:01.062199Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2111.02114"},"observation_digest":"sha256:5d62092891940f6030f9e613ecef37f5b6288fcf8cf56e75b2a52a65969cc17d","observation_id":"eb4228ba-fe36-47c9-87b6-027482e7a144","resolution":{"observed_at":"2026-05-12T10:21:01.079608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:6e57408e0a3523769a286fdf0d0a88c7fae6361843dfae8d34a8701da1745347","observation_id":"6085eebd-ed68-41ce-b8dc-6c865a7e665b","resolution":{"observed_at":"2026-05-16T09:38:09.518303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:a281f42f5543d1dffbfc56dd4d3165f501934fb4a699bc012ff9a4594143c1f6","observation_id":"7fd6cab6-82f1-4d96-a6d7-6e0c3bc84eb8","resolution":{"observed_at":"2026-05-12T04:22:30.583825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2208.14649","last_updated":"2026-04-22T00:33:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-31T06:18:10Z","title":"DetailCLIP: Injecting Image Details into CLIP's Feature Space","version":7},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-24T11:08:20.298043Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2208.14649"},"observation_digest":"sha256:e76512e623e0af0681a31967a8f686797699b1cb21681af4bebfc213745bc8f5","observation_id":"2d8c5e76-6c40-44b1-b0b6-48f810cc2611","resolution":{"observed_at":"2026-05-24T11:09:22.398768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-08-13T17:36:16.794649Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T14:22:16.968028Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2210.08402"},"observation_digest":"sha256:8a93a934db3b2001dafa25cd4098e06352dfa2017cdbe04cb0f78cb916acaf6f","observation_id":"f0e83b57-fdfe-46bf-9ec6-98f03ef143af","resolution":{"observed_at":"2026-05-13T14:22:17.247569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-13T03:27:01.609831Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T08:09:12.716163Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2212.04089"},"observation_digest":"sha256:d98d98e61de2d93483dcbcbfbbb0fe16fcfd16d69d66152d78769f1fd0f0c19c","observation_id":"395f5349-5278-4d09-b17d-16c4222c7f42","resolution":{"observed_at":"2026-05-13T08:09:13.018298Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T00:10:48.610351Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2301.12597"},"observation_digest":"sha256:556a418beac154fba488ffe78a9185d363ec3b6811ca72df6039490103c1fb72","observation_id":"7e9cc680-71f9-4ce0-9e53-16054243c38d","resolution":{"observed_at":"2026-05-12T00:10:49.486795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T09:55:35.452649Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2305.07895"},"observation_digest":"sha256:b88c661c9ace8efa8a583170172bc526ea40d75d479e1a4bcdad552e4cbc1433","observation_id":"f433eb90-0de5-46e5-b917-1700b2cb27ab","resolution":{"observed_at":"2026-05-17T09:55:35.565340Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-12T04:34:52.512550Z","title":"V., Sung, Y., Li, Z., and Duerig, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01271","last_updated":"2025-06-05T10:34:56Z","snapshot_observed_at":"2026-08-13T14:39:27.711270Z","submitted_at":"2024-12-02T08:38:19Z","title":"MuLan: Adapting Multilingual Diffusion Models for Hundreds of Languages with Negligible Cost","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T04:34:52.512550Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2412.01271"},"observation_digest":"sha256:3b20f10dfa20cba49f63877f4462f5f718ef094d5d897042461e5eef5c120933","observation_id":"f58c1641-f862-48e3-b6c6-3f1f598e086f","resolution":{"observed_at":"2026-08-12T04:34:52.512550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-11T22:18:01.462379Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-14T19:57:03.409333Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:18:01.462379Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2412.03704"},"observation_digest":"sha256:aa08f2ad41d90a297283f8d891e72c1b9abd9c78a20e6a1be29b6096da51340c","observation_id":"6e4539fe-dfb6-4e89-bea0-28536504ee53","resolution":{"observed_at":"2026-08-11T22:18:01.462379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-11T20:39:32.454362Z","title":"Scaling up visual and vision-language repre- sentation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05605","last_updated":"2024-12-07T10:22:46Z","snapshot_observed_at":"2026-08-12T16:37:39.913375Z","submitted_at":"2024-12-07T10:22:46Z","title":"RefSAM3D: Adapting SAM with Cross-modal Reference for 3D Medical Image Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:39:32.454362Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2412.05605"},"observation_digest":"sha256:f8eb5d1f43de74e6cf6302d96a5f6e6bfd439ec8b5d38f32c13fd9278063d34e","observation_id":"9a703ba8-af43-4ffd-80e8-072317af3141","resolution":{"observed_at":"2026-08-11T20:39:32.454362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-11T17:16:12.284203Z","title":"Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09230","last_updated":"2024-12-12T12:39:07Z","snapshot_observed_at":"2026-08-15T15:50:09.122394Z","submitted_at":"2024-12-12T12:39:07Z","title":"Foundation Models and Adaptive Feature Selection: A Synergistic Approach to Video Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:16:12.284203Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2412.09230"},"observation_digest":"sha256:863f73a741ccab145887fe8cf8b4b84bf67d40091d524452eb9b2d726669e12a","observation_id":"1d9c4445-c613-430a-8dc7-8b064178e0b1","resolution":{"observed_at":"2026-08-11T17:16:12.284203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-11T14:31:37.223563Z","title":"V.; Sung, Y.; Li, Z.; and Duerig, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11917","last_updated":"2024-12-19T17:57:59Z","snapshot_observed_at":"2026-08-18T22:25:13.456196Z","submitted_at":"2024-12-16T16:01:18Z","title":"Does VLM Classification Benefit from LLM Description Semantics?","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T14:31:37.223563Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2412.11917"},"observation_digest":"sha256:5e839874300259a639bfa26ca66ff17caa4278daddd38d4f80c50fa0d3c73f48","observation_id":"421d0591-c9c0-4f80-bda5-516d35888bb2","resolution":{"observed_at":"2026-08-11T14:31:37.223563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-11T13:08:48.345454Z","title":"Learning With Noisy Text Supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13509","last_updated":"2025-03-25T17:56:01Z","snapshot_observed_at":"2026-08-18T15:28:27.006022Z","submitted_at":"2024-12-18T05:16:11Z","title":"Visualizing the Invisible: A Generative AR System for Intuitive Multi-Modal Sensor Data Presentation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T13:08:48.345454Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2412.13509"},"observation_digest":"sha256:71894d55c502630f22998e9c9c4b8177d575288fb83a4f97994a092b0f7424d1","observation_id":"51ccd206-bab0-4b0f-9913-00968d7d84b7","resolution":{"observed_at":"2026-08-11T13:08:48.345454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-11T16:10:24.421103Z","title":"Scaling up visual and vision-language repre- sentation learning with noisy text supervision.arXiv preprint arXiv:2102.05918,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16188","last_updated":"2024-12-13T17:55:39Z","snapshot_observed_at":"2026-08-15T10:20:46.683996Z","submitted_at":"2024-12-13T17:55:39Z","title":"A Decade of Deep Learning: A Survey on The Magnificent Seven","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:24.421103Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2412.16188"},"observation_digest":"sha256:26ba74e931dd724fa5d8ced24254495e940b3e85e609595a4931b70cb95fd5cb","observation_id":"d4e31344-cc47-4f90-869d-a5e383d9a828","resolution":{"observed_at":"2026-08-11T16:10:24.421103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-11T00:47:52.398127Z","title":"V.; Sung, Y.; Li, Z.; and Duerig, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-15T16:37:06.956343Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.398127Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:8cce11628d89207be931aa21a0bde8937fb210eaaec4bf80ff5b8c2cdb28067f","observation_id":"cdcd0b62-1ac9-42fd-beca-718e10dd8200","resolution":{"observed_at":"2026-08-11T00:47:52.398127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-10T22:55:53.964888Z","title":"V., Sung, Y.-H., Li, Z., and Duerig, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00569","last_updated":"2025-04-12T02:05:56Z","snapshot_observed_at":"2026-08-16T12:30:25.542232Z","submitted_at":"2024-12-31T17:54:29Z","title":"Probing Visual Language Priors in VLMs","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T22:55:53.964888Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2501.00569"},"observation_digest":"sha256:6a05a22d7113ae882330c31ea26838c11a522d5d93cd16775979748ae5621810","observation_id":"7869bfb3-e5ba-4c1e-9e0a-18871455f695","resolution":{"observed_at":"2026-08-10T22:55:53.964888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-09T13:37:11.808123Z","title":"V ., Sung, Y ., Li, Z., and Duerig, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02048","last_updated":"2025-02-04T06:30:12Z","snapshot_observed_at":"2026-08-18T19:18:15.913931Z","submitted_at":"2025-02-04T06:30:12Z","title":"Efficient Domain Adaptation of Multimodal Embeddings using Constrastive Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T13:37:11.808123Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2502.02048"},"observation_digest":"sha256:06f14608eef8c5eb8e9dc1753cfadd0584de27be155db2587547db3d63a78c1f","observation_id":"f46d9fff-300a-4c40-8208-ad430b63b1f4","resolution":{"observed_at":"2026-08-09T13:37:11.808123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-09T12:25:08.797215Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02370","last_updated":"2025-02-04T14:51:29Z","snapshot_observed_at":"2026-08-11T01:46:25.979390Z","submitted_at":"2025-02-04T14:51:29Z","title":"Mirai: A Wearable Proactive AI \"Inner-Voice\" for Contextual Nudging","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T12:25:08.797215Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2502.02370"},"observation_digest":"sha256:28ac691e3f18fca5aeb9f98828e4555ad5edd966fd6f81e1834d2c6c32b2dfe7","observation_id":"2598b6c4-70af-436b-a084-1e18ef239996","resolution":{"observed_at":"2026-08-09T12:25:08.797215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-08T22:41:30.991417Z","title":"Exploring the frontier of vision- language models: A survey of current methodologies and future directions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04470","last_updated":"2025-02-06T19:38:12Z","snapshot_observed_at":"2026-08-10T12:44:46.078504Z","submitted_at":"2025-02-06T19:38:12Z","title":"Color in Visual-Language Models: CLIP deficiencies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T22:41:30.991417Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2502.04470"},"observation_digest":"sha256:aba928b02b5cf0b50d812b18ed44e65c4a2f5ac6270555ce84f85645be3cbc25","observation_id":"c3fd3fae-5c19-434f-930b-fbb8d099ae27","resolution":{"observed_at":"2026-08-08T22:41:30.991417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-08T00:03:16.291602Z","title":"Available: https://arxiv.org/abs/2102.05918","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08643","last_updated":"2025-02-18T16:45:59Z","snapshot_observed_at":"2026-08-12T11:17:44.563445Z","submitted_at":"2025-02-12T18:57:22Z","title":"A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T00:03:16.291602Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2502.08643"},"observation_digest":"sha256:8dfedb0b02f0c678b8a5977c1fe59baac865ac46116646d0bcad7bdc8fd77916","observation_id":"a180953a-5e8a-4335-8ac2-2759aeb5e62c","resolution":{"observed_at":"2026-08-08T00:03:16.291602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-15T23:21:12.793288Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":189,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.793288Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:28f1a51bb86eea52063c0c0be36fde1c6f87b2c5a5b11e0d4812702fdb99de13","observation_id":"5cfe1e3e-0b47-40c5-be01-dc4a7d0c8ca6","resolution":{"observed_at":"2026-08-15T23:21:12.793288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-15T20:21:48.869185Z","title":", Yang, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13281","last_updated":"2025-05-19T16:04:53Z","snapshot_observed_at":"2026-08-18T15:26:34.054488Z","submitted_at":"2025-05-19T16:04:53Z","title":"Computer Vision Models Show Human-Like Sensitivity to Geometric and Topological Concepts","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:48.869185Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2505.13281"},"observation_digest":"sha256:2f82a1b37d0b4ad69c20967d8eda7f30f172407f9b49f2b556a0d939090a520d","observation_id":"1e961784-7c43-4a20-a059-1805906fdc6f","resolution":{"observed_at":"2026-08-15T20:21:48.869185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-07T13:15:35.615457Z","title":"Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-13T08:48:36.820126Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:35.615457Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:3d731db912b8b54fc4a7c028c275d3c9b1644c02452875ce81e10e73ceb2915a","observation_id":"1ffc0213-69d9-479c-9df5-8ce397816749","resolution":{"observed_at":"2026-08-07T13:15:35.615457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-07T06:02:10.304185Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06084","last_updated":"2025-06-06T13:45:34Z","snapshot_observed_at":"2026-08-14T00:18:04.512334Z","submitted_at":"2025-06-06T13:45:34Z","title":"WisWheat: A Three-Tiered Vision-Language Dataset for Wheat Management","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:10.304185Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2506.06084"},"observation_digest":"sha256:a8209d3bf6404a15216dd909f137270209f018114a73efc84352cf17e7c3cb24","observation_id":"f51deee5-ada3-4f9b-867c-8f0d56956134","resolution":{"observed_at":"2026-08-07T06:02:10.304185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-07T01:06:19.262041Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11967","last_updated":"2025-06-13T17:25:27Z","snapshot_observed_at":"2026-08-15T09:07:02.111235Z","submitted_at":"2025-06-13T17:25:27Z","title":"Visual Pre-Training on Unlabeled Images using Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:19.262041Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2506.11967"},"observation_digest":"sha256:2e26785ba1ba5abe5ff9de2f1f6a34054345394bbe4914df2934a065943dea40","observation_id":"c4c8289e-bd1a-4e81-8b09-344fef440dec","resolution":{"observed_at":"2026-08-07T01:06:19.262041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-07T05:01:07.069602Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-14T19:05:16.545014Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.069602Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:d29ff9266518019102335176e9021d37140f27f39bb9eacac95016b647815df7","observation_id":"02c019f0-7f4e-4b7e-b6b5-d13924477716","resolution":{"observed_at":"2026-08-07T05:01:07.069602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-15T17:42:20.457731Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08644","last_updated":"2025-08-12T05:16:00Z","snapshot_observed_at":"2026-08-18T22:39:18.699221Z","submitted_at":"2025-08-12T05:16:00Z","title":"AME: Aligned Manifold Entropy for Robust Vision-Language Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:20.457731Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2508.08644"},"observation_digest":"sha256:1abe27c4bc40f96d3235dd8d51e6e3b6207765a9344135095212d8ba813c051b","observation_id":"6b9a24a1-bcfe-45ed-99ca-0c0b7e41e17d","resolution":{"observed_at":"2026-08-15T17:42:20.457731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2508.09691","last_updated":"2026-04-07T08:20:47Z","snapshot_observed_at":"2026-08-12T21:57:08.717791Z","submitted_at":"2025-08-13T10:37:41Z","title":"PaCo-FR: Patch-Pixel Aligned End-to-End Codebook Learning for Facial Representation Pre-training","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T22:53:23.271423Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2508.09691"},"observation_digest":"sha256:06b593c46ae5cd266e71d574f41a0f669618d1bbf41cc8b873f36d3be6145e4b","observation_id":"69f0053e-9912-4700-8fda-4e1262126377","resolution":{"observed_at":"2026-05-18T22:56:53.171154Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-15T17:15:20.695184Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.13843","last_updated":"2025-08-19T14:06:13Z","snapshot_observed_at":"2026-08-18T03:48:16.397270Z","submitted_at":"2025-08-19T14:06:13Z","title":"UniECS: Unified Multimodal E-Commerce Search Framework with Gated Cross-modal Fusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:15:20.695184Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2508.13843"},"observation_digest":"sha256:a3d246ee1bb881a2e9df6c1cd9af341b87c98a13799a62360126cc2b54cb729f","observation_id":"09f374f6-ef52-41bd-ba6e-19edde942969","resolution":{"observed_at":"2026-08-15T17:15:20.695184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T16:15:06.970353Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.18799","last_updated":"2025-09-08T10:07:31Z","snapshot_observed_at":"2026-08-14T06:21:53.886624Z","submitted_at":"2025-08-26T08:34:04Z","title":"Robust and Label-Efficient Deep Waste Detection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:15:06.970353Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2508.18799"},"observation_digest":"sha256:68c75de6124e0d4f1cf8d332793d8f7ff7bb11afcbbe881d74e7d8973d8cf762","observation_id":"b07fa155-e0df-4e0b-9d51-b6569f4a917e","resolution":{"observed_at":"2026-08-05T16:15:06.970353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T11:11:20.762326Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-15T08:03:25.819249Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.762326Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:3fb8d27719bb4afbd853d31b687cc53933a7c63956f40cfad195de7757f186a2","observation_id":"2504c725-81df-4bb4-873e-cf83c4670f93","resolution":{"observed_at":"2026-08-05T11:11:20.762326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-04T17:18:53.610342Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.11054","last_updated":"2025-09-14T02:45:56Z","snapshot_observed_at":"2026-08-13T07:42:38.307736Z","submitted_at":"2025-09-14T02:45:56Z","title":"Rate-Distortion Limits for Multimodal Retrieval: Theory, Optimal Codes, and Finite-Sample Guarantees","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:53.610342Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2509.11054"},"observation_digest":"sha256:95fc3b3f7879a94713786cf535113a73b18560203feea0a519739386684caa3d","observation_id":"0f60d7bd-3257-4cc5-bc51-5fb93d32a14c","resolution":{"observed_at":"2026-08-04T17:18:53.610342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-02T22:58:07.375228Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15382","last_updated":"2026-05-28T08:46:27Z","snapshot_observed_at":"2026-08-16T04:02:24.978329Z","submitted_at":"2026-02-17T06:31:53Z","title":"The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T22:58:07.375228Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2602.15382"},"observation_digest":"sha256:f77aa2cee897fbb09425852a4b121f51ecccba4230a12a09d611210b28a03a38","observation_id":"8fa62d87-4c65-4139-9306-84d709e30d4f","resolution":{"observed_at":"2026-08-02T22:58:07.375228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T13:11:54.384284Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:e7b699ec0422446434559e9a743d22c08e447fb999120b60d5853ae5924886fb","observation_id":"79e88e60-3b7d-44f2-a561-87a2df459541","resolution":{"observed_at":"2026-05-15T13:15:50.553661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-07-14T23:55:24.006436Z","title":"Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T23:55:24.006436Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:319ad936b61f855e960e6f6876d76c4fde9cfd9cbcd3d74438082fd18249456d","observation_id":"456e6001-3639-4c05-8ea9-b06b04fc89fe","resolution":{"observed_at":"2026-07-14T23:55:24.006436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2603.11689","last_updated":"2026-07-01T08:11:59Z","snapshot_observed_at":"2026-08-14T16:25:56.774747Z","submitted_at":"2026-03-12T08:56:14Z","title":"Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T11:09:51.816554Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2603.11689"},"observation_digest":"sha256:105323f530446bf04e492c3530fc26464b990ee13f07b12ff06c0e106b9b9d44","observation_id":"be20fb00-f225-4467-92b9-931a212c9bb9","resolution":{"observed_at":"2026-05-21T11:10:02.024909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2604.02753","last_updated":"2026-05-13T14:33:13Z","snapshot_observed_at":"2026-08-15T11:02:23.625262Z","submitted_at":"2026-04-03T05:56:29Z","title":"DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T20:30:16.163179Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2604.02753"},"observation_digest":"sha256:250c6f21639729c84158ac3beff0b3064421ce7c6f1ca0a6429505939e77cc63","observation_id":"3d153cec-cc76-4407-83ec-879e1681f651","resolution":{"observed_at":"2026-05-13T20:33:16.707134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2604.02753","last_updated":"2026-05-13T14:33:13Z","snapshot_observed_at":"2026-08-15T11:02:23.625262Z","submitted_at":"2026-04-03T05:56:29Z","title":"DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T21:48:49.892964Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2604.02753"},"observation_digest":"sha256:54b617dba0aaa45bb765c8c709703100a2390505d78871089d29bc3971f32fa3","observation_id":"a5243118-073a-4d3d-9ff6-355111f88bfb","resolution":{"observed_at":"2026-05-14T21:49:29.323542Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2604.07802","last_updated":"2026-04-28T02:50:27Z","snapshot_observed_at":"2026-08-14T02:12:24.002803Z","submitted_at":"2026-04-09T04:54:25Z","title":"Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:25:34.942028Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2604.07802"},"observation_digest":"sha256:9056441964b5990b0a5ac4f97d574fb1205d2abe6f30764cdc56df5b873f19d4","observation_id":"2eac7ce6-23f4-4ea8-ba63-a6293d0feb53","resolution":{"observed_at":"2026-05-11T06:51:16.216373Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2605.01048","last_updated":"2026-05-01T19:23:33Z","snapshot_observed_at":"2026-08-11T09:42:32.928404Z","submitted_at":"2026-05-01T19:23:33Z","title":"Compared to What? Baselines and Metrics for Counterfactual Prompting","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-09T19:02:46.991897Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2605.01048"},"observation_digest":"sha256:afba034ccd34d930e10c87f067b8ea8632d85ed6a39dca99a9f4828f2519656f","observation_id":"4e82d205-e315-41a4-97c8-1d0208ad0f87","resolution":{"observed_at":"2026-05-09T19:05:10.548305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2605.19410","last_updated":"2026-05-19T06:04:23Z","snapshot_observed_at":"2026-08-15T02:04:16.167034Z","submitted_at":"2026-05-19T06:04:23Z","title":"Vision Harnessing Agent for Open Ad-hoc Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:40.429412Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2605.19410"},"observation_digest":"sha256:2532ff176795ac45cf9209b0a6a4a992a5be643581f10f50ee46b297406f4a26","observation_id":"ef87c4ca-e90d-4d07-a1d1-47f52356d4dc","resolution":{"observed_at":"2026-05-20T05:53:04.439800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2606.09881","last_updated":"2026-06-03T05:44:29Z","snapshot_observed_at":"2026-08-12T12:37:31.669797Z","submitted_at":"2026-06-03T05:44:29Z","title":"Toward Calibrated, Fair, and accurate Deepfake Detection","version":1},"reference_index":266,"source":"arxiv_source","source_observed_at":"2026-06-28T07:05:18.026601Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2606.09881"},"observation_digest":"sha256:e1695f7056bb30a1970e5ef5d1ab303b0dbd7dcef3a715fb21ea2811adf166e4","observation_id":"44908e21-1cef-439e-b18d-57458df842c3","resolution":{"observed_at":"2026-06-28T07:11:45.290744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2606.11074","last_updated":"2026-06-10T03:48:53Z","snapshot_observed_at":"2026-08-12T08:49:59.183581Z","submitted_at":"2026-06-09T16:34:37Z","title":"Modeling Complex Behaviors: Multi-Personality Composition and Dynamic Switching in Vision-Language Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-27T13:04:14.886733Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2606.11074"},"observation_digest":"sha256:1616bc775088f0c11917f253c191419a49825181d0e86a216b4e08d3c946cd4f","observation_id":"11c0e04f-f341-4fa2-9ced-cdeb5eab031b","resolution":{"observed_at":"2026-07-03T05:47:41.829444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2606.17030","last_updated":"2026-06-17T13:54:57Z","snapshot_observed_at":"2026-08-18T14:57:25.186447Z","submitted_at":"2026-06-15T17:52:31Z","title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","version":3},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-06-27T04:19:26.332718Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2606.17030"},"observation_digest":"sha256:8a7a56a15b7b65f4be26028f831fe5a672e9613dcd51636f3cb2bad077d0bee6","observation_id":"887c66e1-1378-4117-a8ea-35b4aad639d3","resolution":{"observed_at":"2026-07-03T17:18:43.932557Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2607.02484","last_updated":"2026-07-02T17:50:57Z","snapshot_observed_at":"2026-08-15T22:23:52.808199Z","submitted_at":"2026-07-02T17:50:57Z","title":"Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-03T14:47:35.377391Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2607.02484"},"observation_digest":"sha256:44ec6c006831b74e9ddcdca87f14d68f08577b4991f7f9166ddbc494dcba997c","observation_id":"daa1c166-07ec-40c9-b3f6-4c193ffb0d88","resolution":{"observed_at":"2026-07-03T14:48:32.368383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-07-14T03:31:19.309532Z","title":"arXiv:2102.05918 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-14T13:23:30.029952Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-07-14T03:31:19.309532Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2607.11738"},"observation_digest":"sha256:42be05d0ad6c28f5115fe24488376832a5871c0dc25a924271bbda3db447f8ee","observation_id":"2a4df5d4-58ff-4181-a3bd-baefb693cf78","resolution":{"observed_at":"2026-07-14T03:31:19.309532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-07-31T12:44:13.340533Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28269","last_updated":"2026-07-30T14:23:01Z","snapshot_observed_at":"2026-08-07T04:58:52.190436Z","submitted_at":"2026-07-30T14:23:01Z","title":"Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T12:44:13.340533Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2607.28269"},"observation_digest":"sha256:a50a9fd623fd5baf46d359f98d9ae9fe177d8894da4a8203b31a1e1c999fb520","observation_id":"d4b3338b-8b46-4a9c-a9ae-6a354c1cdbcc","resolution":{"observed_at":"2026-07-31T12:44:13.340533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-15T15:05:38.990379Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-18T12:38:19.644294Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.990379Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:9d8a37580e112b3ce53c5ba12922b1ccae67fd77173176fdd07f003a4000d9d9","observation_id":"a91ac6c3-9552-4fed-ae18-c46aa3d840f3","resolution":{"observed_at":"2026-08-15T15:05:38.990379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-16T00:12:08.581177Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12532","last_updated":"2026-08-12T19:07:07Z","snapshot_observed_at":"2026-08-18T17:51:28.390002Z","submitted_at":"2026-08-12T19:07:07Z","title":"MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:12:08.581177Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2608.12532"},"observation_digest":"sha256:344d376534fae651171b7d7d33a34d71ca4cbdcfcae3bb983ef7b5d46cae6b71","observation_id":"e59a47cb-8137-4931-a00c-1b059f3e6e87","resolution":{"observed_at":"2026-08-16T00:12:08.581177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2102.05918/citation-record","integrity":"/paper/2102.05918/integrity","json":"/paper/2102.05918/citation-record.json","paper":"/paper/2102.05918"},"outbound":[],"paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T18:46:16.265182Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 50 inbound Pith citation observations for arXiv:2102.05918."}