{"as_of":"2026-08-20T17:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df752ef771571e85e14072e7042a5d1f8992949729bb95599ebe4735b8812d7f","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:36:31.289564Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.16096/citation-record","integrity":"/paper/2411.16096/integrity","json":"/paper/2411.16096/citation-record.json","paper":"/paper/2411.16096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.600916Z","title":null,"venue":null,"work_id":"19dca2e5-ce56-4bf2-82e3-a5b65d854c0a","year":2023},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.204302Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:1df022d7e7d3956852d7ac1ee990cf1673f3db46a586ee70181cacd09acff09e","observation_id":"2e685331-7066-4a3b-8cf4-6ab60c403645","resolution":{"observed_at":"2026-08-12T13:36:31.605326Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.586396Z","title":"L., & Parikh, D","venue":null,"work_id":"61335213-aa9f-444c-b893-e753f5afde45","year":2015},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.209588Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:c4966101f508759b1211eadcdd06c2a10f1dd12db749cc9ef2021894c131d8f5","observation_id":"f5fa784c-993f-4628-ac60-286748c46294","resolution":{"observed_at":"2026-08-12T13:36:31.590838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.573031Z","title":"K., Hossain, M","venue":null,"work_id":"b1d2fe6e-1b61-443d-b258-c27f4bce8c34","year":2010},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.215189Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:3a4c3f709a0fe35f7e0d99e0405b00f19f53326f8699eb97ae29410e9052805b","observation_id":"1ea99098-f609-4e93-860a-59784d59a18f","resolution":{"observed_at":"2026-08-12T13:36:31.576790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.559283Z","title":null,"venue":null,"work_id":"62dcb10d-2a03-430c-8057-cc278e3f7ca4","year":2017},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.219882Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:cc72f3229b2779b38861ac5f62b9829032b9d0b95a5f7ba57a2f181b904a446a","observation_id":"ab7d3878-ccc2-4f63-9fd3-4904ae56d06b","resolution":{"observed_at":"2026-08-12T13:36:31.563342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.546455Z","title":"J., Attanasio, G., Bianchi, F., Terragni, S., Magalhães, A","venue":null,"work_id":"69b12115-3b57-42fe-ae5f-7b971f3e8d99","year":2022},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.224788Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:d8b79f0666f22aad1a4a3a049ab728f8fddbfafe82d78f78242822c98a774645","observation_id":"39818b5d-8258-4246-8f10-06ac1cfa79c3","resolution":{"observed_at":"2026-08-12T13:36:31.550526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02473","last_updated":"2022-04-11T16:34:06Z","snapshot_observed_at":"2026-08-16T17:09:03.211434Z","submitted_at":"2022-04-05T20:15:23Z","title":"\"Does it come in black?\" CLIP-like models are zero-shot recommenders","version":2},"cited_work":{"arxiv_id":"2204.02473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.02473","snapshot_observed_at":"2026-08-12T13:36:31.418104Z","title":"\"Does it come in black?\" CLIP-like models are zero-shot recommenders","venue":"cs.IR","work_id":"f21dbb94-45fd-470b-b992-15b7e2dbec05","year":2022},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.229725Z"},"links":{"cited_paper":"/paper/2204.02473","citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:dbfabeef5914b1cdd1c1dd0e0c3da1e56e10b49bd589a4437df4212c9deacf5f","observation_id":"de609c51-a0c8-487f-8710-5b818c3a415a","resolution":{"observed_at":"2026-08-12T13:36:31.422986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.531960Z","title":null,"venue":null,"work_id":"205b0c30-3b1b-434d-9d50-8dd954b0878a","year":2023},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.235358Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:5c2000a1939ec956d9a46d5f772afc0e3477f5b3249320e24e7487d3c03b3e23","observation_id":"60aba286-61f6-439c-a798-8279288b78f7","resolution":{"observed_at":"2026-08-12T13:36:31.535931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.518364Z","title":null,"venue":null,"work_id":"37140463-7d9d-4b0c-aa9e-5ca8a948eecd","year":2023},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.239767Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:b10b79063f08c56dc2aba28a23aac4beb95f310a3d280334ccbe8538ffd1c0e1","observation_id":"8c5e55a3-e7b9-4768-92b5-e9032ece4751","resolution":{"observed_at":"2026-08-12T13:36:31.522817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T13:36:31.243869Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.243869Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:3bf79b40e1cd4adaf80eb97e586b9dd52040e4e128683a2e4617dfe0c7c44c91","observation_id":"9910f583-69f7-409a-98f9-9ee0800d2196","resolution":{"observed_at":"2026-08-12T13:36:31.243869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T13:36:31.248017Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.248017Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:18864b9286cd433450655e85f43c8bef6dec6fa86aca385f2bf20ed67204dec1","observation_id":"d1fc6ce1-7678-42f2-bfcd-c3de2a382401","resolution":{"observed_at":"2026-08-12T13:36:31.248017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.504512Z","title":"C., Xu, Y","venue":null,"work_id":"ded4a9e4-4325-47e4-85c2-5ae10db6526a","year":2008},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.253064Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:3cb92e86cc751d2f026141f697405341c0f0df03d07eb9a8212d4e39f9fcc77b","observation_id":"3ab640a7-3c5b-46cc-97db-ac55af986912","resolution":{"observed_at":"2026-08-12T13:36:31.509099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/su12072809","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.328568Z","title":null,"venue":null,"work_id":"9ac3cd1b-5851-467a-8508-d2bf94281ebc","year":2020},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.256951Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:c0628807db486a219773c4ac71c5ea9ca4cd9127cb2b6bd9674a3588a4bcfdd4","observation_id":"cb7cdf11-bf3b-4a57-8bf9-4b81de5f59a0","resolution":{"observed_at":"2026-08-12T13:36:31.332725Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.490043Z","title":null,"venue":null,"work_id":"28cc4b77-d480-4666-afd0-c1401e212547","year":2020},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.261572Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:1d7e78641ada8f734ec0e87acd56dda69b665e49a9041628c10bb24b86c43051","observation_id":"56320bbd-2ef0-45b3-bd0c-50213a9e189a","resolution":{"observed_at":"2026-08-12T13:36:31.494799Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/2954930","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.313621Z","title":null,"venue":null,"work_id":"88eab36c-9db6-4553-9b39-3b7e673a1487","year":2017},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.264967Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:c9dc18217faf2defa111bc1ede0e06c474d9065706b4b530e70a4bb0422ea959","observation_id":"791f3717-8637-41a7-b3b4-3fa1aa85da03","resolution":{"observed_at":"2026-08-12T13:36:31.318926Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.476692Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., & Sastry, G","venue":null,"work_id":"25e4d4d7-0d73-4254-99d4-383fd4b61f7b","year":2021},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.268946Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:723791432355ac4b2b08610bcf0cb38409c166aece643ae4547ef6bd85c76724","observation_id":"c283ea03-9bd9-48e4-8781-7ebabe876048","resolution":{"observed_at":"2026-08-12T13:36:31.480604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.463125Z","title":null,"venue":null,"work_id":"940520b7-4fc5-4338-a887-7a92cb32a3fd","year":2023},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.272535Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:7d1fca22374604167a27435621824c02168b84c68db3850744355ba762fdd654","observation_id":"dec98f9e-95cc-4c87-9fb6-9e279b23b09f","resolution":{"observed_at":"2026-08-12T13:36:31.467670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12033","last_updated":"2022-07-25T10:15:56Z","snapshot_observed_at":"2026-08-20T08:36:44.208907Z","submitted_at":"2022-07-25T10:15:56Z","title":"Contrastive Learning for Interactive Recommendation in Fashion","version":1},"cited_work":{"arxiv_id":"2207.12033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.12033","snapshot_observed_at":"2026-08-12T13:36:31.368924Z","title":"Contrastive Learning for Interactive Recommendation in Fashion","venue":"cs.IR","work_id":"6a83906f-11ef-4cda-bea2-607715ad9b8c","year":2022},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.276133Z"},"links":{"cited_paper":"/paper/2207.12033","citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:c0e29cebec126f3474dfabdc56e7d62a019f0a1b48c7ff62a540b164b1d07772","observation_id":"41a5d6d3-41fa-4746-a97b-827b9fe896ef","resolution":{"observed_at":"2026-08-12T13:36:31.374066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.448973Z","title":"P., Brocki, Ł., & Marasek, K","venue":null,"work_id":"a7de5ccc-a733-47df-bd51-e1e114737029","year":2019},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.280725Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:dccb1c56ff1568274a77fc74739ea29f9ff335b2238e8c1211709c971acec28e","observation_id":"8753ce72-0091-48fc-a7fb-cdafd9f55e08","resolution":{"observed_at":"2026-08-12T13:36:31.453129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.06620","last_updated":"2019-06-15T21:50:31Z","snapshot_observed_at":"2026-08-14T16:15:04.951211Z","submitted_at":"2019-06-15T21:50:31Z","title":"Joint Visual-Textual Embedding for Multimodal Style Search","version":1},"cited_work":{"arxiv_id":"1906.06620","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.06620","snapshot_observed_at":"2026-08-12T13:36:31.346977Z","title":"Joint Visual-Textual Embedding for Multimodal Style Search","venue":"cs.LG","work_id":"14d1a61d-b1b3-479b-b759-2817a43c61dd","year":2019},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.284753Z"},"links":{"cited_paper":"/paper/1906.06620","citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:cfb8567ea355f0a712ca71812c1ed39a0ae051406f1a22e5b14e1ae91aad77c6","observation_id":"d9c3690f-8a12-4c09-8b85-89df4d741509","resolution":{"observed_at":"2026-08-12T13:36:31.353138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.433522Z","title":"M., Saputra, D., & Oswari, L","venue":null,"work_id":"f0c44a15-89b2-4575-a3ad-a3c29e7771ef","year":2020},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.289564Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:90c7996313b675c2f06e337bd052b7230b5d9d9dd3a1740d5c65dcbf9a9ac8c5","observation_id":"77d36c33-86a7-45ec-9f24-366316693c72","resolution":{"observed_at":"2026-08-12T13:36:31.438668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T13:06:01.880721Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":5,"verified_fuzzy":7},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2411.16096."}