{"as_of":"2026-08-16T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d755da4b96756498d7b0026833c2bd7d6729934593813821e9d313e91500e60","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:59:52.281615Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14789/citation-record","integrity":"/paper/2411.14789/integrity","json":"/paper/2411.14789/citation-record.json","paper":"/paper/2411.14789"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.114205Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.114205Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:8f17bb14a0b6e3d03c1f444f4edd94c29dceeafaaae1b763cca326ec72072368","observation_id":"3667f728-116f-4d70-8df0-b86563989a6b","resolution":{"observed_at":"2026-08-12T14:59:52.114205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.783217Z","title":"Mobileclip: Fast image-text models through multi-modal reinforced training","venue":null,"work_id":"66bf4b88-d19a-4fae-86d9-8b6b68a15da9","year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.119201Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:06df24131878dbbaa0b17f4a019610aeef3099d9ecb952822cfce2668ba76483","observation_id":"7f3b4057-6abf-4e5c-ba0f-6635cd45248c","resolution":{"observed_at":"2026-08-12T14:59:52.788275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.123160Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.123160Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:6e1a1bf6fa697311e374ee890da989231e74de47a2e6717f71b84621ed22decb","observation_id":"bd51ce5b-e1d3-47b9-939d-baad2c37c84a","resolution":{"observed_at":"2026-08-12T14:59:52.123160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-08-13T15:16:57.345726Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-12T14:59:52.127302Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.127302Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:7f47651cc525f3683fad620ffeee088ff76096be4dabcc75c7bda301ade66db6","observation_id":"95ba7f40-9837-4a6a-96f4-48f3644cb71e","resolution":{"observed_at":"2026-08-12T14:59:52.127302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.765242Z","title":"Slip: Self-supervision meets language-image pre-training","venue":null,"work_id":"85f0e201-d12c-4f35-87b9-d0a28e5a80ab","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.131546Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:42ddca0417b099fed8661f107a6f07c1137ac0a6153cfbc91958c7e2ecb6cd87","observation_id":"772f5775-3f49-4cc9-96ca-86ee78d549a0","resolution":{"observed_at":"2026-08-12T14:59:52.768761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05208","last_updated":"2022-03-14T08:53:07Z","snapshot_observed_at":"2026-08-13T17:55:27.704848Z","submitted_at":"2021-10-11T12:17:32Z","title":"Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05208","snapshot_observed_at":"2026-08-12T14:59:52.135248Z","title":"Supervision exists everywhere: A data efficient contrastive language-image pre-training paradigm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.135248Z"},"links":{"cited_paper":"/paper/2110.05208","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:d6f750b6fb65d044920f2ca362def3dbd2befd7fab350d21fc02dedef50f3cbd","observation_id":"9e9d7ef6-4019-4fdb-ad6a-63b163c52140","resolution":{"observed_at":"2026-08-12T14:59:52.135248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.753902Z","title":"Unified contrastive learning in image-text-label space","venue":null,"work_id":"e7da00d8-e1fa-45f6-81cb-ee935ae07dda","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.139565Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:bb59d8055c85319bf239af094e7b222a7dba9f70d4550c21211cc58174513536","observation_id":"deefb527-540a-4655-a01e-204eb4de7628","resolution":{"observed_at":"2026-08-12T14:59:52.757540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.741907Z","title":"Sigmoid loss for language image pre- training","venue":null,"work_id":"afd3b9ba-d5ae-4954-8c9e-05fcb4a3a43d","year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.142687Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:f3b061ade79074a93f1ec49076fc4d3e84d72b095a53c09e3a026d47c24cd6b4","observation_id":"befa4a88-7088-4800-977f-9293a0e45170","resolution":{"observed_at":"2026-08-12T14:59:52.745608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.729437Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"a2471ec2-43aa-4b76-ab5e-f972d269088d","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.145599Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:8b246fd27112dbd11b49ed85adeb2bec5080c25c89e4526e05768d5995abca80","observation_id":"d224ba9a-6194-4892-b457-f70d39b92c84","resolution":{"observed_at":"2026-08-12T14:59:52.733608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T14:59:52.148493Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.148493Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:41fe7683ed163f9e095a202a3f2ce4f516a92c751aa5502b3c184e738afc2d40","observation_id":"d2113434-c7b6-416a-b61d-d75c170e37ad","resolution":{"observed_at":"2026-08-12T14:59:52.148493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.151714Z","title":"Tinyclip: Clip distillation via affinity mimicking and weight inheritance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.151714Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:70708aa88600397e42893c19b5ad225d504b5f77339353741318cba0075ed905","observation_id":"0e814fee-c16d-467d-a4cc-56dc16025f96","resolution":{"observed_at":"2026-08-12T14:59:52.151714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.154940Z","title":"Clip-kd: An empirical study of clip model distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.154940Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:1dedb784e980fe3e4756cde828eb3124a14eb029e363ebdd08a27052aca2d62c","observation_id":"d09a2960-9757-4414-b699-6877ec18ba32","resolution":{"observed_at":"2026-08-12T14:59:52.154940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-08-14T02:42:50.349648Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-12T14:59:52.157799Z","title":"Data filtering networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.157799Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:e2a0822968025d9a85eaec61048c416245e87a865925705b53f8175848291e73","observation_id":"06934296-ab32-4eb8-921d-1b70242d165a","resolution":{"observed_at":"2026-08-12T14:59:52.157799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.161256Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.161256Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:5bb355bb02649e3912a43f80ba7e912de475fbd9cabe761fcb43364b481b7dd7","observation_id":"6da76b83-de18-419b-b00f-2480161d7073","resolution":{"observed_at":"2026-08-12T14:59:52.161256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.686535Z","title":"Alip: Adaptive language-image pre-training with synthetic caption","venue":null,"work_id":"e4c505e9-353f-44ba-af9d-573536646d6f","year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.164341Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:de35fed1a9461fdf107582ff9ba0d263b46ec21ae9fe04c9a69a16f481a65b66","observation_id":"0046f2d9-6ffa-40b8-8898-93617acc3956","resolution":{"observed_at":"2026-08-12T14:59:52.689960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07699","last_updated":"2024-03-13T22:27:08Z","snapshot_observed_at":"2026-08-13T05:51:56.999684Z","submitted_at":"2023-10-11T17:49:13Z","title":"VeCLIP: Improving CLIP Training via Visual-enriched Captions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07699","snapshot_observed_at":"2026-08-12T14:59:52.167679Z","title":"From scarcity to efficiency: Improving clip training via visual-enriched captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.167679Z"},"links":{"cited_paper":"/paper/2310.07699","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:340d15ac945d530a7674ebf07b3bb9aea78298b464abf5ea85359fb6ce961431","observation_id":"99f775da-c713-4249-abd7-54cd86e75a8d","resolution":{"observed_at":"2026-08-12T14:59:52.167679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.676145Z","title":"Metaformer is actually what you need for vision","venue":null,"work_id":"f9193165-9874-4cdb-a6fc-2bf4ede5ddb9","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.171120Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:5fb5a9fea72eb720edd0cdf6927523066bd1e3cd3eaa5649dabd9fb47e6804ed","observation_id":"36e15436-1244-43c3-8391-60b30af1edca","resolution":{"observed_at":"2026-08-12T14:59:52.679633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.664777Z","title":"Deeply supervised salient object detection with short connections","venue":null,"work_id":"fa3a99bc-0a85-4d12-ae1e-2fe9ef0355e3","year":2017},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.174562Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:2debdb91c11eec69993bb1468caf9edbd03cac94653a91e14c483aec9d2919f7","observation_id":"c8118bb7-c484-474a-83da-f2b90090f27f","resolution":{"observed_at":"2026-08-12T14:59:52.668728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.653106Z","title":"Cascaded partial decoder for fast and accurate salient object detection","venue":null,"work_id":"0f5e1156-d9b6-4322-8878-b8ddd58abcf4","year":2019},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.178714Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:e97ddb3bf678890521f4277ada462ced3749bf96e247ba2d8d1fae9957690a23","observation_id":"ecfb34f2-c296-4364-86e2-a67e3bae9621","resolution":{"observed_at":"2026-08-12T14:59:52.657079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T14:59:52.182930Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.182930Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:333b00f893c4f58ff56895c1e27ee9707aa24c977a7384212b8e3dd0d78a8810","observation_id":"ec24a1d5-3abc-4585-ae60-f988163ab6d0","resolution":{"observed_at":"2026-08-12T14:59:52.182930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.186821Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.186821Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:10ff63c0ba844a8b0e467d7184fc7255cb2785578784f8aa5d06338ef4bd3983","observation_id":"fd94dcaf-8fd9-41bc-acb9-11a1dab9fa50","resolution":{"observed_at":"2026-08-12T14:59:52.186821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.633832Z","title":"Less is more: Pay less attention in vision transformers","venue":null,"work_id":"04b287b5-b556-4863-9f31-b4f77217268c","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.190581Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:6222db21cc7bf362153270d25fee79dd9691ccbefa55f9abab7e256faa62531f","observation_id":"abbf80c6-af9b-4da1-b80a-8f4a4d48a0d3","resolution":{"observed_at":"2026-08-12T14:59:52.637839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.621642Z","title":"Cmt: Convolutional neural networks meet vision transformers","venue":null,"work_id":"73883c8a-4f66-4cc7-aaec-87034695caf3","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.194481Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:5519b5a0ca9004bc3a6d568767b509ef092dd1ac6c3c007f8d4323bac67ce5d1","observation_id":"fd86234b-74ed-4a34-821a-ad2ef9365662","resolution":{"observed_at":"2026-08-12T14:59:52.625709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.608705Z","title":"Fastvit: A fast hybrid vision transformer using structural reparameterization","venue":null,"work_id":"f84d1825-62c8-48d2-83a0-43de5b4af0d0","year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.200277Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:2f92fd7f5452fd497c8e0cf09e385936bce846e18bc38d3517d1d56a3e71660b","observation_id":"ddca9952-036c-4d8c-8fc8-ac33cd6bcebb","resolution":{"observed_at":"2026-08-12T14:59:52.613709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03819","last_updated":"2019-03-05T16:46:19Z","snapshot_observed_at":"2026-08-13T07:34:17.550838Z","submitted_at":"2018-07-10T18:39:15Z","title":"Universal Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03819","snapshot_observed_at":"2026-08-12T14:59:52.205965Z","title":"Universal transformers","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.205965Z"},"links":{"cited_paper":"/paper/1807.03819","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:4cb935ea30cadb9d832c82e81cf581429968707103675b4f1b63b0e958e159c6","observation_id":"97a4c6e0-62c2-4894-9c15-4ad64edd5671","resolution":{"observed_at":"2026-08-12T14:59:52.205965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.210190Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.210190Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:9b5109c78dd1a12bb1e45b7431c90c5407dc3e6ad85e75c59e3705e1c1a44412","observation_id":"e5f31a3b-c752-4246-8d4a-651867b554eb","resolution":{"observed_at":"2026-08-12T14:59:52.210190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.589676Z","title":"Sharing low rank conformer weights for tiny always-on ambient speech recognition models","venue":null,"work_id":"114238c9-95aa-4456-bf04-ff05ac3fd252","year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.214395Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:936b3323d889b5888a3e583c7b51c5c307fdbb97b985f7b120118da63af548ab","observation_id":"645b9ae5-35a5-4397-b4ef-4028d0cb4d43","resolution":{"observed_at":"2026-08-12T14:59:52.593450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T14:59:52.219465Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.219465Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:04a59eb13569f072d213d45829d5731fa65f40c25b0e1e95799edd6d17334f0e","observation_id":"de702da3-e804-42f5-9342-b6696ed0b4fb","resolution":{"observed_at":"2026-08-12T14:59:52.219465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.578116Z","title":"Simplifying transformer blocks","venue":null,"work_id":"563853a9-18c4-452d-bd7f-529338494fab","year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.223873Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:6a24193c2424ac3b08b2bd1bcd8c9dbc58e36708f34582554b80061bf0eaca34","observation_id":"19bc353d-c96a-4333-9622-b5e048a40494","resolution":{"observed_at":"2026-08-12T14:59:52.581833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.227589Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.227589Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:4857541d00fbd0ae45f4cd63e502c0b894ed5db7eea564b3e885704d30ab3347","observation_id":"26350de0-be99-4fa9-aadd-01befde4bec1","resolution":{"observed_at":"2026-08-12T14:59:52.227589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.560054Z","title":"The shaped transformer: Attention models in the infinite depth-and-width limit","venue":null,"work_id":"014eeeb4-5015-42a3-8e59-cec826fc92fe","year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.232264Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:dd7f7d30bc97381aec80ab59310c4ce016846744401d7d10e5a8c7aabdcec73d","observation_id":"011605a2-487f-4b23-815c-7495e8f36552","resolution":{"observed_at":"2026-08-12T14:59:52.564010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01470","last_updated":"2019-07-02T15:56:20Z","snapshot_observed_at":"2026-08-13T11:06:33.334750Z","submitted_at":"2019-07-02T15:56:20Z","title":"Augmenting Self-attention with Persistent Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01470","snapshot_observed_at":"2026-08-12T14:59:52.236035Z","title":"Augmenting self-attention with persistent memory","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.236035Z"},"links":{"cited_paper":"/paper/1907.01470","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:f84a1c8eb909ec9f5bd1a58fe7bcdf9e951223f442251a014bdccdc97c1c980e","observation_id":"5d5940fc-69ea-4bae-852d-4586dd2e2c14","resolution":{"observed_at":"2026-08-12T14:59:52.236035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08707","last_updated":"2024-11-28T03:20:49Z","snapshot_observed_at":"2026-08-13T07:38:22.339335Z","submitted_at":"2024-05-14T15:48:36Z","title":"Beyond Scaling Laws: Understanding Transformer Performance with Associative Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08707","snapshot_observed_at":"2026-08-12T14:59:52.240108Z","title":"Beyond scaling laws: Understanding transformer performance with associative memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.240108Z"},"links":{"cited_paper":"/paper/2405.08707","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:a4f5ec39eb4d4cb922fe3709fde5de9e9123345397fab87b3193f93639bf791b","observation_id":"d4744f33-043d-4ad0-b297-e92d696d6a8e","resolution":{"observed_at":"2026-08-12T14:59:52.240108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T14:59:52.244204Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.244204Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:ccfbfc2fd3766cb246ab8f8406fce1006da7e520fdab993480da703944cfadbf","observation_id":"4a2d84b0-0353-4449-84eb-a5c79032403e","resolution":{"observed_at":"2026-08-12T14:59:52.244204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-12T14:59:52.247115Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.247115Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:0d62a1f92e8a9147aa31d5ba263677f75f9ee25d253e3d7dff914cbd5fa3f1a9","observation_id":"a43af1cc-e3a0-4340-9a0b-9d5d8037fd69","resolution":{"observed_at":"2026-08-12T14:59:52.247115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.250581Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in Neural Information Processing Systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.250581Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:d11323852bf74280ee10781a0c2681e89060c85e10bbd64eda8743bea16dd52b","observation_id":"57d172d9-f745-4b17-acf7-c7d30bbe706b","resolution":{"observed_at":"2026-08-12T14:59:52.250581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.539506Z","title":"Rils: Masked visual reconstruction in language semantic space","venue":null,"work_id":"536c05b3-55f3-4245-a724-dd85de575ca1","year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.253198Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:33165f72c7185da49b4b5e23bce399e68a11e53ddb28732bbbf91eba6e73d446","observation_id":"1ed292a2-cff2-4386-9a2c-90537d6deea3","resolution":{"observed_at":"2026-08-12T14:59:52.543998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.255907Z","title":"Extract free dense labels from clip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.255907Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:29a536a65725bc3aa8c4c3177de7d8aafa9728330466f17b8656b6b4434ef9f6","observation_id":"8e900ed7-dc7f-4e8d-b091-74c8b1ba186c","resolution":{"observed_at":"2026-08-12T14:59:52.255907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.517025Z","title":"Openclip repository, 2021","venue":null,"work_id":"12a3640d-c4e5-40e5-982a-4ab352b63b0a","year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.258639Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:00c0d601a41d1e39301d4233939de1f195fee1918b0d00beec9f363e3f66cec2","observation_id":"a2a50556-d133-47dc-bc8d-39e181098183","resolution":{"observed_at":"2026-08-12T14:59:52.520710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.261429Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.261429Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:e1b34db473f2f83cdb21777b26769121afe9d193583b155b1315cfd402ef8560","observation_id":"f7f7c6fd-a8e6-4aab-911b-4e83350e8020","resolution":{"observed_at":"2026-08-12T14:59:52.261429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.264271Z","title":"Do imagenet classifiers generalize to imagenet? In International conference on machine learning, pages 5389–5400","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.264271Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:fbb10daa88373d76ae4ad640f49aff4bdc5b71cfc88a7a353ec781ca792c570c","observation_id":"4241ff8b-9f35-40f9-bf3d-38bb0188fd6d","resolution":{"observed_at":"2026-08-12T14:59:52.264271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.267287Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.267287Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:ff86d4151e2bf49ae7bfb74f709a9924904012fb24297eaaeaef67332e80974d","observation_id":"f0d35b14-1eaa-45ee-b25b-470128a85c44","resolution":{"observed_at":"2026-08-12T14:59:52.267287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.270399Z","title":"Learning robust global representations by penalizing local predictive power","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.270399Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:b53a1f8363274765dc774dd7955fb7ebabbe1fae30f209e8a0a31d0604aba293","observation_id":"c38f53c5-6c36-4c81-917b-9db95a4c2a22","resolution":{"observed_at":"2026-08-12T14:59:52.270399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.273910Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.273910Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:86a955f4efc598e239c52b7199b6feffb2710450391ad8fa4ac2931994ef4de2","observation_id":"7d573126-e6cb-48ac-b674-e921a159f385","resolution":{"observed_at":"2026-08-12T14:59:52.273910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.277763Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.277763Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:baac91acbd6d36635d16145b3b7be1b17eb08207b4b497f54f4a2b28ecc439c7","observation_id":"84f5fab0-faaf-4a37-ba18-c40afd5f6426","resolution":{"observed_at":"2026-08-12T14:59:52.277763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.445807Z","title":"Randaugment: Practical automated data augmentation with a reduced search space","venue":null,"work_id":"5936951a-96e3-458f-96ad-f1e4b7629451","year":2020},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.281615Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:c8c3bebbe4e55da81088466bcb742cd207c7b70c0f8927205213f49d4f47ac79","observation_id":"d1580e7f-5c9a-4e48-959a-6db2de7f8d86","resolution":{"observed_at":"2026-08-12T14:59:52.452649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:44:10.408662Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2411.14789."}