{"as_of":"2026-08-10T01:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec196f78960cd67bb4e78b78dfb19951feff33021deb60315d42fcca51b838ee","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:41:44.214299Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T03:31:33.964471Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T03:40:54.141854Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"cited_work":{"arxiv_id":"2506.16673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16673","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.16673 , year=","venue":null,"work_id":"06100205-6ec7-495f-8ffd-2d4bc07cea60","year":null},"citing_paper":{"arxiv_id":"2605.07271","last_updated":"2026-05-08T05:35:32Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T05:35:32Z","title":"Understanding Performance Collapse in Layer-Pruned Large Language Models via Decision Representation Transitions","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-11T02:23:52.589354Z"},"links":{"cited_paper":"/paper/2506.16673","citing_paper":"/paper/2605.07271"},"observation_digest":"sha256:22a1fdcb75778ee0e69bf70b4012a3fe7960e9bb76eb4d7eb880af551d1c1d85","observation_id":"cddb2aaa-c23f-4a4c-ae77-8b645044def7","resolution":{"observed_at":"2026-05-11T02:25:53.878606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"cited_work":{"arxiv_id":"2506.16673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16673","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.16673 , year=","venue":null,"work_id":"06100205-6ec7-495f-8ffd-2d4bc07cea60","year":null},"citing_paper":{"arxiv_id":"2605.07783","last_updated":"2026-05-08T14:21:05Z","snapshot_observed_at":"2026-07-06T23:20:06.574823Z","submitted_at":"2026-05-08T14:21:05Z","title":"Chain-based Distillation for Effective Initialization of Variable-Sized Small Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-11T03:31:33.964471Z"},"links":{"cited_paper":"/paper/2506.16673","citing_paper":"/paper/2605.07783"},"observation_digest":"sha256:d847541fdc1afac29357dbc9321111ac9777f926f52e088bcc6b0c7e116f751f","observation_id":"ce73f04e-e77b-4e33-a86e-6f8d47c2ade2","resolution":{"observed_at":"2026-05-11T03:40:54.143600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16673/citation-record","integrity":"/paper/2506.16673/integrity","json":"/paper/2506.16673/citation-record.json","paper":"/paper/2506.16673"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T23:41:39.653398Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:39.653398Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:364d987bda74c8802f64703a05d792eb0b37bff195f24acd83310d24688af342","observation_id":"bb0d8947-a5cd-476a-a08b-6a3b270f23f1","resolution":{"observed_at":"2026-08-06T23:41:39.653398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T23:41:40.603499Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.603499Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:e6baa2c45305390e9bade28d5615086be962d6d01876b1ffb5c6289966a577b8","observation_id":"1210daea-a2a6-4b2a-8591-31dd5b9ec0f7","resolution":{"observed_at":"2026-08-06T23:41:40.603499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.783886Z","title":"Scaling up visual and vision-language representation learning with noisy text su- pervision","venue":null,"work_id":"37ab0d0b-27e1-40fb-aa14-68bfbfe57d95","year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.818042Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:73836ffed6796614f8dc729b9bce4242d72aa094f3110324448918f192cfc87e","observation_id":"8d20089f-b83f-4d4d-af8c-0e25addf1014","resolution":{"observed_at":"2026-08-06T23:41:46.787183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.774076Z","title":"Learning multiple layers of features from tiny im- ages.Handbook of Systemic Autoimmune Diseases, 1(4),","venue":null,"work_id":"9949acb2-0695-4d13-b30a-bf8eb0ddf4b7","year":2009},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.919321Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:26342dc0d8e6f784627f0e3444e57db6cba617dab946041bc4e16a8371f82811","observation_id":"e51020db-c6d2-4e42-8726-38decccecdf1","resolution":{"observed_at":"2026-08-06T23:41:46.777334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.763595Z","title":"Clipath: Fine-tune clip with visual fea- ture fusion for pathology image analysis towards min- imizing data collection efforts","venue":null,"work_id":"bd903ed9-1209-40c9-85a6-33c58f54904a","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.059755Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:a25ddd10f194b01f005f84da572839d0b7b260f1de9717bf43c4da7a5e811a7f","observation_id":"77274896-7a07-4c53-bc8b-be4c9ac55907","resolution":{"observed_at":"2026-08-06T23:41:46.766897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-06T23:41:41.156877Z","title":"Albert: A lite bert for self-supervised learning of lan- guage representations.ArXiv, abs/1909.11942,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.156877Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:9bb0cf48462746cbfc619ad6bb3220011648dc593ee3cffa5a8c967bc0eddee0","observation_id":"9f089dd5-871e-45fd-8274-8df9a9fc5a1f","resolution":{"observed_at":"2026-08-06T23:41:41.156877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.753044Z","title":"Align before fuse: Vision and language representation learning with momentum distilla- tion.Advances in neural information processing systems, 34:9694–9705,","venue":null,"work_id":"fc2a9ca4-c36c-4797-b32b-e57d130eee61","year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.226742Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:ceb511dd5a5725f8d61602e784c4cd363e61df0a59cc84ffcbf053fc8b44552c","observation_id":"942f3b57-1b3f-4ff5-aa75-1a36304224d2","resolution":{"observed_at":"2026-08-06T23:41:46.756791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:41.302093Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.302093Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:23c02d49adffff18c8a32e3d8751e1a2da1cf1b9c04b4e48394cb634ea6481b8","observation_id":"34d6268d-ed76-42af-b3aa-77edaa48c71d","resolution":{"observed_at":"2026-08-06T23:41:41.302093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.735011Z","title":"Automatic evaluation of machine translation quality using longest common subsequence and skip-bigram statistics","venue":null,"work_id":"e49cc3bd-c316-4185-bfdc-486f07265875","year":2004},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.381057Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:bad5f7fb15a8e187b6d09516424cbe93f3edb32fd1a84566f4bd91010aeb2a12","observation_id":"983c5e6a-388b-4d59-8928-9ce5afa2e772","resolution":{"observed_at":"2026-08-06T23:41:46.738963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00928","last_updated":"2024-07-01T03:17:53Z","snapshot_observed_at":"2026-08-03T19:05:40.087675Z","submitted_at":"2024-07-01T03:17:53Z","title":"FoldGPT: Simple and Effective Large Language Model Compression Scheme","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00928","snapshot_observed_at":"2026-08-06T23:41:41.576024Z","title":"Foldgpt: Simple and effective large language model com- pression scheme.ArXiv, abs/2407.00928,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.576024Z"},"links":{"cited_paper":"/paper/2407.00928","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:a8425d26e13dc29a46f392d8bc01af6bc3a9f3101bae3e48a3408b291bb58cd2","observation_id":"e4239e0a-3066-4fb3-9eaf-840639acf3d5","resolution":{"observed_at":"2026-08-06T23:41:41.576024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.717133Z","title":"Clip-branches: Interactive fine-tuning for text- image retrieval","venue":null,"work_id":"08d1d301-b44c-4532-8e1d-6ea5da6b3f23","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.680090Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:a89dcadff686108fbc4f7f875ffa73153cd338b1e5cf5fd5d86c12e569e8ff14","observation_id":"78e710c1-ceb4-43b7-a2bc-32a33ff584d7","resolution":{"observed_at":"2026-08-06T23:41:46.721080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T23:41:41.828926Z","title":"[Mokady and Hertz, 2021] Ron Mokady and Amir Hertz","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.828926Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:df47fc7181d65c54b07b9ee73e0146b60b1bb70ed9e506f184cb905e5b0abed1","observation_id":"59700003-ea25-4573-9220-5fa415e5f49c","resolution":{"observed_at":"2026-08-06T23:41:41.828926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.707277Z","title":"Compact language models via pruning and knowledge distillation","venue":null,"work_id":"19cb318d-01a6-448a-b602-789aa1fe314d","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.888375Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:ac022c5adc11a7265e4862e6454fea4909585e995abf0a09106d1abe568d0ec1","observation_id":"55ca4b34-9252-4ad3-9b9b-57979f93adda","resolution":{"observed_at":"2026-08-06T23:41:46.710512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.697253Z","title":"CHiLS: Zero- shot image classification with hierarchical label sets","venue":null,"work_id":"7fb38640-4c37-46b9-825b-91846e64f51d","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.974012Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:e0a62d711bffdbb8afd6b98cb18f0cd1fb35e4bfdc8867a392fee4a96fd2d610","observation_id":"149bad71-fc54-4a54-929f-b7bfae66a016","resolution":{"observed_at":"2026-08-06T23:41:46.700607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.685843Z","title":null,"venue":null,"work_id":"f0c394c2-614f-43b7-818e-77e9f3d6ec55","year":2001},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.038682Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:568258d5de10712f11ff0e29fcd50bdb2c496dc239193aa8520d7a4b82439873","observation_id":"d22b41c4-e8de-4f9d-b8d1-42281a2efdb2","resolution":{"observed_at":"2026-08-06T23:41:46.690119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:42.417659Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.417659Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:13844bed5698d64971893398be47585a7f37148c2c3d2c7fe825a0179c95d504","observation_id":"1c4ace28-b9e0-45ec-a7f1-0dbdb30aa7ca","resolution":{"observed_at":"2026-08-06T23:41:42.417659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:42.525499Z","title":"Learning transferable visual models from nat- ural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.525499Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:8f6d5f1497722c68a70dce8adbb694389e1af3a316b2146d3f5851ecda19c8f9","observation_id":"e7913e60-7df6-4ba1-b8bb-b6570d741f7e","resolution":{"observed_at":"2026-08-06T23:41:42.525499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.644612Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"620c8cc6-6379-4319-a16e-7cb8cc5cc49c","year":2018},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.594229Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:96af62854cb93e3a41be356052b2bbd94942ecd7e754f4be34f8d14929066bd1","observation_id":"a98d3e93-39aa-42b4-b253-5f8146c3135b","resolution":{"observed_at":"2026-08-06T23:41:46.648692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.623918Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"d61bdacb-90da-45a6-a537-8c4f7aed2e2a","year":2017},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.730440Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:420be44213236632ed1c2b2699c04bfce142abb773d6ec9b90ce1ad8318b1967","observation_id":"87482803-e7a0-4381-952c-bae8b819c481","resolution":{"observed_at":"2026-08-06T23:41:46.627340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.455720Z","title":"Characterizing and avoid- ing negative transfer","venue":null,"work_id":"cc59be89-9cee-4b50-a180-7ba57c58c43a","year":2019},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.923374Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:bee3e662753789d8eb3fad2e8cc284c9642500a0005674b6b12edf3211146f4c","observation_id":"f62f778a-ab77-42f5-ba9c-37c4ea823d8e","resolution":{"observed_at":"2026-08-06T23:41:46.597299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.167353Z","title":"Learngene: From open-world to your learning task","venue":null,"work_id":"ceec54ab-8ffc-44e0-8d77-c746e34f2f0d","year":2022},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.944359Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:ac28ab208ce45df0442f99e2bdb73ec0c2620c77df632cb630ac9109a11e11dd","observation_id":"8b136c55-2dc0-455d-87f1-4f9dd86c18f7","resolution":{"observed_at":"2026-08-06T23:41:46.291286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02279","last_updated":"2023-06-29T14:04:26Z","snapshot_observed_at":"2026-08-01T12:20:53.734135Z","submitted_at":"2023-05-03T17:15:58Z","title":"Learngene: Inheriting Condensed Knowledge from the Ancestry Model to Descendant Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02279","snapshot_observed_at":"2026-08-06T23:41:43.035082Z","title":"Learngene: Inheriting con- densed knowledge from the ancestry model to descendant models.arXiv preprint arXiv:2305.02279,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.035082Z"},"links":{"cited_paper":"/paper/2305.02279","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:b136e900a87e20d8740a74c0501e4704df769135b2a354f8a1bb3edf6dd45194","observation_id":"8ec5d236-9419-43ea-ae21-f9ceb50cc882","resolution":{"observed_at":"2026-08-06T23:41:43.035082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.154797Z","title":"Vision transformers as probabilistic expan- sion from learngene","venue":null,"work_id":"6e8963fa-7996-4eba-b815-6e7e74d9d2c8","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.198681Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:cc14db821e44eccd5e18332db11820fcaa7ebd02e14e21d78f3d0ae783358a83","observation_id":"a355136e-4ae3-4159-beae-2294fd60338a","resolution":{"observed_at":"2026-08-06T23:41:46.158677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16897","last_updated":"2024-04-25T06:04:34Z","snapshot_observed_at":"2026-08-09T14:45:12.926145Z","submitted_at":"2024-04-25T06:04:34Z","title":"Exploring Learngene via Stage-wise Weight Sharing for Initializing Variable-sized Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16897","snapshot_observed_at":"2026-08-06T23:41:43.321605Z","title":"Exploring learngene via stage-wise weight sharing for initializing variable-sized models.arXiv preprint arXiv:2404.16897,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.321605Z"},"links":{"cited_paper":"/paper/2404.16897","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:1df5af89e6b296b5b861ac4f0ebd8ddf5b9687c55e007e7439d5abebbe8893e2","observation_id":"a023133f-f8b6-4034-acdd-d7b6fd96b9ca","resolution":{"observed_at":"2026-08-06T23:41:43.321605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07337","last_updated":"2025-05-20T17:08:45Z","snapshot_observed_at":"2026-08-02T05:15:10.456595Z","submitted_at":"2024-08-14T07:22:28Z","title":"KIND: Knowledge Integration and Diversion for Training Decomposable Models","version":2},"cited_work":{"arxiv_id":"2408.07337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.07337","snapshot_observed_at":"2026-08-06T23:41:44.688842Z","title":"KIND: Knowledge Integration and Diversion for Training Decomposable Models","venue":"cs.CV","work_id":"1ad00004-f38e-4c95-857d-a6ed9ae6454a","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.487929Z"},"links":{"cited_paper":"/paper/2408.07337","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:f38483d31b5d732e4ddbcb837b970b7dab11dadbbf948a8fac5d3d0fff28c662","observation_id":"996b9d26-f958-4d91-8ac7-493294c8f537","resolution":{"observed_at":"2026-08-06T23:41:44.756302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09441","last_updated":"2024-12-16T11:26:26Z","snapshot_observed_at":"2026-07-06T19:02:03.017798Z","submitted_at":"2024-08-18T11:23:21Z","title":"CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09441","snapshot_observed_at":"2026-08-06T23:41:43.615143Z","title":"Clip-cid: Efficient clip distillation via cluster-instance discrimination.ArXiv, abs/2408.09441,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.615143Z"},"links":{"cited_paper":"/paper/2408.09441","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:b6ef0578dcbcfdaadabb848056e1203ce7f0fade733f93d0ef1152aee81be239","observation_id":"ceb347dc-1b90-4c89-aef2-57be930a8a3b","resolution":{"observed_at":"2026-08-06T23:41:43.615143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.011817Z","title":null,"venue":null,"work_id":"69e365a6-ae6b-4554-94ad-58f1e20e8ebb","year":2014},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.735490Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:f619f50094754a7870f36dc60f9778f41d3ac3e269757fc4fbaa23814abd05c8","observation_id":"70dfdb34-7ca4-40d8-9c41-b1766c1acbcd","resolution":{"observed_at":"2026-08-06T23:41:46.137224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:45.739181Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"6c078153-1513-4013-9861-97a1e8726a40","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.840052Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:b9bf00261a2c83259226937bb4ee1ebc278f3ba614f4eeb2269df5b93a8bd36d","observation_id":"2082631f-286b-4761-b5a2-68274aff7dbd","resolution":{"observed_at":"2026-08-06T23:41:45.888512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:45.414529Z","title":"Minivit: Compressing vision transformers with weight multiplexing","venue":null,"work_id":"29db6d99-021d-4bcc-85e6-612aec3424ba","year":2022},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.907351Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:6c1f5ceee81cfe2dae6b2a0031b3ea861c4c66596b2f217be630b708c09cebf9","observation_id":"13984ce2-e02d-4297-8d68-991175959fc3","resolution":{"observed_at":"2026-08-06T23:41:45.576440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02582","last_updated":"2024-01-05T00:26:07Z","snapshot_observed_at":"2026-08-09T16:57:52.708316Z","submitted_at":"2024-01-05T00:26:07Z","title":"CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02582","snapshot_observed_at":"2026-08-06T23:41:44.018505Z","title":"Cocot: Contrastive chain-of-thought prompting for large multimodal models with multiple image inputs.arXiv preprint arXiv:2401.02582,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:44.018505Z"},"links":{"cited_paper":"/paper/2401.02582","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:d606317359efcfac8b6b2e4a67b25381267a54af067469e8a6a6e48310dd9c5e","observation_id":"db9e8f2c-82da-40c2-9525-65d048c539d0","resolution":{"observed_at":"2026-08-06T23:41:44.018505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:45.191913Z","title":"Learning clip guided visual- text fusion transformer for video-based pedestrian attribute recognition","venue":null,"work_id":"f7d31fec-e440-474a-8959-e01b527e2701","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:44.116542Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:94fc0a7c9f32a3a2761edd5710e800209782495987f827f703f2ce47da41eafc","observation_id":"0ee55134-129c-450b-b7d0-5db5854a84ca","resolution":{"observed_at":"2026-08-06T23:41:45.302679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7653.5584","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:44.445493Z","title":"8 with the loss weightλ set to1","venue":null,"work_id":"33b811e4-f4e9-47bc-b198-07753e81cd83","year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:44.214299Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:abe04d1f56a1f293b359984b5bc06c7557672e556a3df0ea16a9928f37c5fddd","observation_id":"64496046-0093-4afe-b0ab-3ea71dd38fb8","resolution":{"observed_at":"2026-08-06T23:41:44.546243Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:42.159844Z","title":"Cats and dogs","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.159844Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:2f8e826ef23a72371e0cfc9046235c09d5f3f0968ed22838a0eec43bec525874","observation_id":"98ba2ed7-0ac0-4d72-8e15-208b5f67e433","resolution":{"observed_at":"2026-08-06T23:41:42.159844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:41.496223Z","title":"Microsoft coco: Com- mon objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.496223Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:9e6ff13a3b43d32170e019934797626de039a6acc1a496d0618d451b0a4a132f","observation_id":"c309051c-b47c-4cb4-aa55-c012e17239d6","resolution":{"observed_at":"2026-08-06T23:41:41.496223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.805312Z","title":"Bert: Pre-training of deep bidirectional transformers for language understand- ing","venue":null,"work_id":"74dcb712-88f0-451a-9c88-30e20495e629","year":2019},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.172526Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:8a155ee4923383f591c993ad0c3156d403fa6a7ec1344b8333d159123712dc15","observation_id":"a7a89bf2-2990-40f3-abc5-b4dcd4f3ff9b","resolution":{"observed_at":"2026-08-06T23:41:46.809002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.669036Z","title":"Clipping: Distilling clip-based models with a stu- dent base for video-language retrieval","venue":null,"work_id":"e1c0fb1a-946d-4152-baa9-95a6df2a318e","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.268837Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:5f34a0c4ff9418d1c9e109ffb1b3d22136110eb1a45ad4f313a67f55cbf8dfb4","observation_id":"6005b785-7aaf-4522-895b-91e43ca15514","resolution":{"observed_at":"2026-08-06T23:41:46.673029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.836360Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"d115802f-44d7-4782-a9f3-62b143066e73","year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:39.926867Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:f4b767c7308abb0f145f08fb0dff7c13c1e464f48cc52cb6a1282710f8b2543d","observation_id":"fefd7bed-e213-4290-b97c-7aa5e6336261","resolution":{"observed_at":"2026-08-06T23:41:46.839841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.794789Z","title":"Openclip, July","venue":null,"work_id":"601d077f-6d60-419c-ad2f-cbc637c3088e","year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.705044Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:f8058080f453e673bd368376d368b105c7e92e74b4c734247a20066b1c13d449","observation_id":"02cce5a3-27e0-4c63-b4aa-0d7b7c05fe3e","resolution":{"observed_at":"2026-08-06T23:41:46.798397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.853204Z","title":"Vlmo: Unified vision-language pre-training with mixture-of-modality- experts.Advances in Neural Information Processing Sys- tems, 35:32897–32912,","venue":null,"work_id":"2d4a4249-32b9-4a64-ae93-b6f648b9ecc6","year":2022},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:39.722053Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:e027f799e091b26c3bd4dd1e695fe4d0b09bbf2159a34505b90fed25bee7a660","observation_id":"0f226c26-7bbe-4ff2-a102-1d8c3ee06c94","resolution":{"observed_at":"2026-08-06T23:41:46.856955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.612125Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"c16a07e8-0e37-4a28-ac03-b458fa8f4ace","year":2015},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.843705Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:09122dbb7c9759d02cfb3233e1faaa9e605df5ea083fbb2cc5017501a35de6fa","observation_id":"8661aa16-e518-4425-bef4-13ac93d6980a","resolution":{"observed_at":"2026-08-06T23:41:46.616326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.634335Z","title":"Building variable- sized models via learngene pool","venue":null,"work_id":"b6f7cb9a-4791-4918-b375-b82e46b37add","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.654304Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:7f58eb095387904991cac7bed4a65195bfbdeae685a66ab49b147287e2763fd0","observation_id":"0da41141-771f-40f8-aeda-fcc84f6ac6df","resolution":{"observed_at":"2026-08-06T23:41:46.637519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T23:41:40.275604Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.275604Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:6dfe3f9beaf98fdba5a8b75f4345fcfb42dd6a46e21fc02ed5bd61455d81d529","observation_id":"73c67a20-8c1a-40ae-bdf5-6971a45b3686","resolution":{"observed_at":"2026-08-06T23:41:40.275604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08139","last_updated":"2024-01-16T06:18:11Z","snapshot_observed_at":"2026-08-03T21:21:39.295155Z","submitted_at":"2024-01-16T06:18:11Z","title":"Transferring Core Knowledge via Learngenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08139","snapshot_observed_at":"2026-08-06T23:41:40.379368Z","title":"Transferring core knowledge via learngenes.arXiv preprint arXiv:2401.08139,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.379368Z"},"links":{"cited_paper":"/paper/2401.08139","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:5e50bf8e2536b12d5a2f75ca3f109c1ccc509d1a2b15824d7671f6075110a44c","observation_id":"f24fbc33-3743-436b-89f8-99ac3074417b","resolution":{"observed_at":"2026-08-06T23:41:40.379368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.823967Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"5c9f7867-8d97-4af0-bde3-ee568fc57fb0","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.005207Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:3bec381cee81e5d21bb40fb487930790054a2871348d51ada72ca3c2c1c554b7","observation_id":"59e47a0f-3e1a-43cd-b200-b7144e282dc5","resolution":{"observed_at":"2026-08-06T23:41:46.829621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:39.837013Z","title":"Food-101–mining discriminative com- ponents with random forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:39.837013Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:6d431b0ea903d1c6ac1dd106422e1130a2ef982c1b258e3af1d0c70fc3c77d84","observation_id":"2a080e28-5759-4fe3-ad22-af9afa26175d","resolution":{"observed_at":"2026-08-06T23:41:39.837013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:40.089980Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.089980Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:2997196aea713da8d15faa281a8448bc773e327a7af29e2b898cc0e35b6c9000","observation_id":"9612f030-0cc3-4c8e-b862-f57471afba35","resolution":{"observed_at":"2026-08-06T23:41:40.089980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17503","last_updated":"2025-03-15T17:21:38Z","snapshot_observed_at":"2026-07-06T18:36:42.830927Z","submitted_at":"2024-06-25T12:43:33Z","title":"WAVE: Weight Templates for Adaptive Initialization of Variable-sized Models","version":3},"cited_work":{"arxiv_id":"2406.17503","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17503","snapshot_observed_at":"2026-08-06T23:41:44.920006Z","title":"WAVE: Weight Templates for Adaptive Initialization of Variable-sized Models","venue":"cs.LG","work_id":"57c3eb61-38ab-4771-8423-02618b6c8272","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.522210Z"},"links":{"cited_paper":"/paper/2406.17503","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:bc36f1e1ce1d4690870002468e2f2f3f8ec7b1e26d6692fde9146ee7a61d5e3f","observation_id":"1645c199-146a-4897-910e-bac736c52528","resolution":{"observed_at":"2026-08-06T23:41:45.019297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T16:59:07.884090Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2506.16673."}