{"as_of":"2026-08-14T09:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2ed2cca50774f839f29f273120f442f0abbba908d167789647d83bfffa95eba","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:46:45.600246Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22431/citation-record","integrity":"/paper/2507.22431/integrity","json":"/paper/2507.22431/citation-record.json","paper":"/paper/2507.22431"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T11:46:45.257026Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.257026Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:68204229460a0229c93bf233438119249618cb623b4577fff71c44ae77ad92ed","observation_id":"8687808d-6b90-469b-859c-9db72dba25ab","resolution":{"observed_at":"2026-08-06T11:46:45.257026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.719768Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"3933ea0d-a87e-4519-a9fc-d653a643f2f9","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.264665Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:8df0b538323be12ee3828a74b781f450f2afd9318f521e9708673bb6dd55aad4","observation_id":"fdb97316-3ec5-4106-9d2a-27cd89f67a64","resolution":{"observed_at":"2026-08-06T11:46:46.727507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.690379Z","title":"Internlm-xcomposer2: Mastering free-form text- image composition and comprehension in vision-language large model, 2024","venue":null,"work_id":"d3d8d11d-1ec7-435f-9729-c2e643ec33b6","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.275197Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:74a249f32c00384ea933a280e4898eadc20fbe5a03c9372ba1a4139b875dadc6","observation_id":"e0755a2a-6891-4009-a98a-81960f9c5784","resolution":{"observed_at":"2026-08-06T11:46:46.697555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.669842Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"3157eca6-1ea7-4366-808a-b4f1e071e8ec","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.285435Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:c9ada57105f14936ddb96663c77943d0a8b157bd8b251535092e5fe29d1b90e1","observation_id":"0313582b-5d45-43cb-9d05-8a60e610ddbd","resolution":{"observed_at":"2026-08-06T11:46:46.677311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.651349Z","title":"Improving clip training with language rewrites","venue":null,"work_id":"149b3e6e-656f-4010-93d6-74c7e9f00111","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.293013Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:ad206b853a2476625a08ecc4b57ee498b863f7aa8970cc7b4a39c9f39a686cf8","observation_id":"da9deaac-5bd3-4c4b-9d39-8fc13fc2bc11","resolution":{"observed_at":"2026-08-06T11:46:46.656336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.633179Z","title":"Data fil- tering networks, 2023","venue":null,"work_id":"26d331c8-a977-476f-bad0-a08f86c8af21","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.306448Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:3eb58e12f8584dc6b519fb9a996e2d9720544454d679f0808c85bbee96cbebed","observation_id":"8494b625-6a4d-4b55-ab54-5a42840d6363","resolution":{"observed_at":"2026-08-06T11:46:46.638350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.606724Z","title":"Eva: Exploring the limits of masked visual representa- tion learning at scale","venue":null,"work_id":"2f42ce71-3212-4f9e-8554-7827ca1744ea","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.313820Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:d2f9fa12c370c2f78e7d5a1bce87bdfaebc2523eef90af4a1b7483a223c75243","observation_id":"039d2dd5-6b27-4bc1-963c-aab84da425aa","resolution":{"observed_at":"2026-08-06T11:46:46.616900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.580676Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":"b5d9780a-c759-4ffa-9053-74515d39cf84","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.325074Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:69eacff5d7ecda56c970fc39582d3bd418c09df1d53fc36f2e2b6dcc5bb2f865","observation_id":"67bff9d6-c2f2-466e-b1f4-172f4223377b","resolution":{"observed_at":"2026-08-06T11:46:46.588004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.559565Z","title":"Datacomp: In search of the next generation of multimodal datasets, 2023","venue":null,"work_id":"ec30f154-0b98-4e37-9af7-7382f545c954","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.332237Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:234b4ed0a94426e947e79fe17a2aa51d1ee072d066bb90758a0515596f00ff49","observation_id":"08175ae1-0b0d-48a8-a002-ca6b7aa2389d","resolution":{"observed_at":"2026-08-06T11:46:46.567545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.540469Z","title":"Classification done right for vision-language pre- training","venue":null,"work_id":"f275c228-60e4-40a1-9f1b-a1ee5f247909","year":2025},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.339790Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:0ad054200c4c1afffcc76a193f5cd37dd76facc324efcdcdf1d61a0be41d2bf1","observation_id":"7262f8be-d511-49d4-9f5f-7e83a661c015","resolution":{"observed_at":"2026-08-06T11:46:46.547919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T11:46:45.348101Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.348101Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:8feca9e9bfcc4aac4225a3f8b3d7a349b10e741d9a1b68461ddbe7bff4c64322","observation_id":"911d6cae-6135-43ee-abee-333269196a7d","resolution":{"observed_at":"2026-08-06T11:46:45.348101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.523288Z","title":"Open- clip, 2021","venue":null,"work_id":"7fe9c39a-3054-445d-87dd-949daf5482d3","year":2021},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.362242Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:a9fabba2465a4c03f748d59869d8a10452f86a842669c26b971588c33415c2b1","observation_id":"f54851e5-6dbb-4eb5-a7ed-24e0d60f14d3","resolution":{"observed_at":"2026-08-06T11:46:46.528791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.501057Z","title":"Veclip: Improving clip training via visual-enriched captions,","venue":null,"work_id":"548efb01-12bb-4157-a7ff-3819fb3315ac","year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.368122Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:7b088331fa9cd6af8fa538aeb1cf3e95508e100e5c08d83049e4b3bf67a8b67d","observation_id":"f0fba9fa-74f1-4a7d-b16e-d53deb8a3785","resolution":{"observed_at":"2026-08-06T11:46:46.508293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.481359Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension, 2023","venue":null,"work_id":"0744e39a-a098-4ac1-a446-db86bb6afbbf","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.375675Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:aa6db99d51fa26b0641888366da45898a21b9dafe5b186ccf72e4560229cced4","observation_id":"372feb51-e920-4792-a9ab-c9d3bc5b0ee6","resolution":{"observed_at":"2026-08-06T11:46:46.486667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.444796Z","title":"Grounded language-image pre-training","venue":null,"work_id":"e398004e-64b5-46dc-8c02-9b581e3365c6","year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.387890Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:c54cc2080b7e63742d17c127a22020180a4fd59cb6d9f16dc13772690d6e61e5","observation_id":"77ed29c0-809d-412b-8fff-de2ece218112","resolution":{"observed_at":"2026-08-06T11:46:46.457246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.423475Z","title":"Clipa-v2: Scaling clip training with 81.17, 11","venue":null,"work_id":"b962b191-5a2c-4c12-a544-3cce3aa452f7","year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.395048Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:5c1f0dca74ed17a0e235fe99f8f5dde11c68b03f3679385d935e0cd34846d31e","observation_id":"3fe468b9-21f8-477f-980b-b93aadf25fa3","resolution":{"observed_at":"2026-08-06T11:46:46.428986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-08-12T23:44:16.304434Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-06T11:46:45.400816Z","title":"What if we recaption billions of web images with llama-3? arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.400816Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:4065261b669d43634140754eeb2b85b1ec3fb1e0a0faae595af00bd0f0bf44de","observation_id":"bca85c64-9114-4285-a012-c084a8a858ba","resolution":{"observed_at":"2026-08-06T11:46:45.400816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.405302Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"afbe6afa-7d03-41ca-9bf1-6600a7fb5193","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.415558Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:7dd62309ad8ec08f67f2dce1cdb45814635f2fbcb11ad56df4fff7a4c2ac2372","observation_id":"12443c6b-bad7-4196-ab35-6c714c0a0a5b","resolution":{"observed_at":"2026-08-06T11:46:46.410742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:45.420691Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.420691Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:1552b65d45ceccd6498ef2ed0eacd91eb24a9c1d7e2da1b8c4bb5e1f1d45eda0","observation_id":"cd5a54de-8e88-4196-9e92-ccfe55968d28","resolution":{"observed_at":"2026-08-06T11:46:45.420691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.366721Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"9e185563-9d0e-4290-a35c-6491f305c01e","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.427199Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:29142afa57999555d6f3d624b55efe2334b3e3edd4d0dbecd2ea027003404b4b","observation_id":"60a38ff6-e757-4a52-91d5-6debf7111c78","resolution":{"observed_at":"2026-08-06T11:46:46.376042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:45.432094Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.432094Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:8c3afe4ed5d6b42df41f5cf2bdd03f332464717665a6fbbdd87f977a0616ebd9","observation_id":"ab674b3e-c7a2-46c9-84cb-9726f7a5cfc4","resolution":{"observed_at":"2026-08-06T11:46:45.432094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.326548Z","title":"Slip: Self-supervision meets language-image pre- training","venue":null,"work_id":"a819a1c0-ebfe-48f9-8575-f678ebf03fbe","year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.440608Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:7ff86d8fbb878547edf27b01ca8fb16e5dd5aa0c5a4160fa8c38c52bcfddd172","observation_id":"bae38e45-a8ab-44c0-866e-28cd93456e8a","resolution":{"observed_at":"2026-08-06T11:46:46.331626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.302765Z","title":"Improving multimodal datasets with image captioning","venue":null,"work_id":"b44d4ace-7199-4199-93ec-eb2851159fe9","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.447199Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:68e338c32e440d7c417fc5d72d031c6a14bde6457e620040323b08198e0a4bf5","observation_id":"51154b03-b426-4fd2-bc89-38e3bcd0ef82","resolution":{"observed_at":"2026-08-06T11:46:46.308562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.273403Z","title":"Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever","venue":null,"work_id":"2eed096e-e88d-40fd-8de1-9f431ed35591","year":2021},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.453397Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:02d9f292bd5a2fc982712e6259dde304de3c630066c96b5ab7d7e0647720df5e","observation_id":"1a6f594c-487c-42a3-be44-5dbf127470de","resolution":{"observed_at":"2026-08-06T11:46:46.282647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:45.459856Z","title":"Denseclip: Language-guided dense prediction with context- aware prompting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.459856Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:f3fcc4ef1d2c017a9111af6688e5ea8f78d8b501dc6cb7bfd2d481eb94c7156d","observation_id":"21558c4b-2ba8-43ad-a5c6-19f6ce3b1c71","resolution":{"observed_at":"2026-08-06T11:46:45.459856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.230630Z","title":"Fusecap: Leveraging large language mod- els for enriched fused image captions","venue":null,"work_id":"09dbaf15-25ee-4302-84c5-f214dd470354","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.465588Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:a59067690b3d0d85ec4123ba607fce2b347e2416d59129f84c594fc0218f8906","observation_id":"d1b1a601-d1dd-4e87-a7f7-aaddb8730b77","resolution":{"observed_at":"2026-08-06T11:46:46.237591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T11:46:45.476634Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.476634Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:a2b44881cf5a24b28247dd7436b091ce3df17b20b3dc77e4746e90b7e19801af","observation_id":"972fd9d1-1252-4f40-af1c-da919df8a99f","resolution":{"observed_at":"2026-08-06T11:46:45.476634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.207340Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"b0d7d3e1-bfe9-4f3a-9cc4-f0a3aa4c3c83","year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.483145Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:5f0583d474b8f837fdafe73d1bfffed51831b89108bef5313b5ee1b2d823a390","observation_id":"3d5e3a2d-5cc3-4ce9-839f-03e51b64573c","resolution":{"observed_at":"2026-08-06T11:46:46.214046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T11:46:45.488144Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.488144Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:2a677604aa2c92392453eac18845031de61595fb6fd6228cbb312673c167b832","observation_id":"41e5be2f-a1ec-40fe-b8be-6310f94a4b85","resolution":{"observed_at":"2026-08-06T11:46:45.488144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T11:46:45.494374Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.494374Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:5387120fb8e60c46a3e7703b339379dbd1fe526301222dc3a8584fb2dc5d21bb","observation_id":"b64dc236-7bd4-4c47-b9e5-56161efecd1a","resolution":{"observed_at":"2026-08-06T11:46:45.494374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T11:46:45.499725Z","title":"Siglip 2: Multilingual vision-language en- coders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.499725Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:71e42a3dbec42011c3c3abf1142f9d48da7e70d4e23ed307274fe1d396ec4ec1","observation_id":"2e124188-8a4c-472c-8dab-0138ecb71694","resolution":{"observed_at":"2026-08-06T11:46:45.499725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.178905Z","title":"Locca: Vi- sual pretraining with location-aware captioners","venue":null,"work_id":"7e55ad1c-c231-4a38-882a-58bf4763ce3c","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.505688Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:89d683b33354a53dd9e382ae72b933bbfec901716165e3a287ff1b758fedd3f1","observation_id":"54248436-f71d-4947-a733-fae403771130","resolution":{"observed_at":"2026-08-06T11:46:46.184807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T11:46:45.512014Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.512014Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:a7c79102581088fa681da547e97fed7a3621c92529a7a00fdd85ad0f3e8869fb","observation_id":"1fbfab01-1955-4999-a42c-e42b7267011d","resolution":{"observed_at":"2026-08-06T11:46:45.512014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-13T18:03:15.705177Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-06T11:46:45.517124Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.517124Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:d27127e8dabeff7437b3a0fc3eaf221be2297484c55f23dd4d929186ceef930f","observation_id":"2335abde-285a-4cac-8447-b1a2c9cbfa25","resolution":{"observed_at":"2026-08-06T11:46:45.517124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-06T11:46:45.524128Z","title":"Demystify- ing clip data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.524128Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:800989b72af790adb2dd0f8ba585bd34af3c8723362cd1b1775a40b7d6dd7327","observation_id":"04d2f84a-85a6-43b4-b30b-3156a9177e25","resolution":{"observed_at":"2026-08-06T11:46:45.524128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.140060Z","title":"Coca: Contrastive captioners are image-text foundation models, 2022","venue":null,"work_id":"f23e25f3-dbf5-4223-9996-40191d958afc","year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.531912Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:7bdaa38d5477443fc2f59ed854f52fa69c201f9de74c9b7be0fd5b2866dcded0","observation_id":"8a8a5c90-6af3-4ba7-85d2-b63b449ccf57","resolution":{"observed_at":"2026-08-06T11:46:46.148854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-08-13T05:35:44.608694Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-08-06T11:46:45.543788Z","title":"Caps- fusion: Rethinking image-text data at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.543788Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:5ac50fa7d9c153ff262b581a5f04297074c001a636ee1965953e820ba8875d64","observation_id":"85b5c121-2c3c-4e77-9e74-d93c9127a5d4","resolution":{"observed_at":"2026-08-06T11:46:45.543788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.110316Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi","venue":null,"work_id":"8eeb3506-79f6-403f-a2c9-d9e802b6dd35","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.550364Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:d04fb9ee343b4b5f76f80af8249aa04df81c7fcd587bad4a28cecbc265083b81","observation_id":"c059c51c-33df-4d19-b842-cd199730cd5a","resolution":{"observed_at":"2026-08-06T11:46:46.116925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.085423Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? In International Conference on Learning Repre- sentations, 2023","venue":null,"work_id":"8741b7dd-a931-4545-881c-b5ac3f337a67","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.558671Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:1165e1e6a68269e2222604f195d1c762890d58b1ae15b9a8361bd85d409e1065","observation_id":"8b7f51ce-0d25-44d5-9ed3-2353ba1dacc2","resolution":{"observed_at":"2026-08-06T11:46:46.091776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04867","last_updated":"2020-02-21T13:36:15Z","snapshot_observed_at":"2026-08-09T06:48:42.729935Z","submitted_at":"2019-10-01T17:06:29Z","title":"A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04867","snapshot_observed_at":"2026-08-06T11:46:45.568273Z","title":"A large-scale study of representation learning with the visual task adaptation benchmark","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.568273Z"},"links":{"cited_paper":"/paper/1910.04867","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:0743d76259aa5c47ee63b07958bbe9d5cd251aa0f86f5fb9dffe68be366a38fe","observation_id":"9669d846-da58-4512-9db6-0f32adf4edfc","resolution":{"observed_at":"2026-08-06T11:46:45.568273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.061203Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"cd7a4825-e6af-4316-a2bf-f0817f313919","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.577179Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:35f8d51d8d931ca2ca28b3f325d04c17203929b42f777a6f2cbca2084c3139eb","observation_id":"0a7d25ac-ca9c-4a7c-8755-c435c58b6959","resolution":{"observed_at":"2026-08-06T11:46:46.069538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.033861Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"3084d9ce-6acc-4c34-ac0d-9858dd8a4c9e","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.583471Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:7eb90880a662c0ceb363837919c5e62d835a990e2da5f50da70616514f10cd47","observation_id":"8f631553-cbb2-41ca-b062-ad3de7d05214","resolution":{"observed_at":"2026-08-06T11:46:46.041210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.005064Z","title":"Glipv2: Unifying localiza- tion and vision-language understanding","venue":null,"work_id":"733ffbd4-ac33-4c3c-a3d5-7c2ba341707b","year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.588353Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:e8cee06fa2cbd54b525e9f09269b3d26ba0bdaea451030acda73ab2db25009ae","observation_id":"4adfeb5e-0eca-42d0-8e52-8e9c2088bd60","resolution":{"observed_at":"2026-08-06T11:46:46.010744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:45.978815Z","title":"Training setup and dataset scale","venue":null,"work_id":"b1ea089d-1ea7-42a9-ad3a-c529a56c0bf7","year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.593767Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:b7d96a549e0b324f13291d1641278cd7a5744ab829340d5f48c2a065c61b529c","observation_id":"d794a3e4-5197-44fc-963e-5adfd3f1bf62","resolution":{"observed_at":"2026-08-06T11:46:45.988293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:45.951549Z","title":"Examples We present some examples from the acquired dataset","venue":null,"work_id":"3ef7c314-09af-432f-9d3a-ad3249999015","year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.600246Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:e995124333054e199efac9c32538a10046f4ec605d351dcf2b435609f46b2056","observation_id":"72ead4ff-f661-4f49-ac37-0df59345b06e","resolution":{"observed_at":"2026-08-06T11:46:45.961209Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T02:29:56.004773Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2507.22431."}