{"as_of":"2026-08-13T05:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f32232dfcbbe98df60b1af66d8916617209570b5cd3cfd952fbdff39cab005ca","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:38:19.066615Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:20:50.578691Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11927","snapshot_observed_at":"2026-08-03T04:20:50.578691Z","title":"Flame: Frozen large language models enable data-efficient language-image pre-training.arXiv:2411.11927, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-08T17:38:17.395786Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.578691Z"},"links":{"cited_paper":"/paper/2411.11927","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:93e83fb1a355ab54b5a14958b30c02f9e61a0d917b47a4b301a8e21e6a9a0053","observation_id":"dccbc202-eb71-431c-a90a-e929ada7b54e","resolution":{"observed_at":"2026-08-03T04:20:50.578691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.11927/citation-record","integrity":"/paper/2411.11927/integrity","json":"/paper/2411.11927/citation-record.json","paper":"/paper/2411.11927"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-12T18:38:18.787439Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.787439Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:8566c96e3dbd1d806784ad65cea929d13a58817c9b1a47d7809da6cab9004e3e","observation_id":"5fc2996f-d8e4-4fdc-8e1c-b26acbc91c16","resolution":{"observed_at":"2026-08-12T18:38:18.787439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T18:38:18.792629Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.792629Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:d61a096553ae67ace08182f6a015f0742dfcdc2aae23f1480f25b73753ad0ae8","observation_id":"771fe683-689f-441d-b6e9-682a5f800c57","resolution":{"observed_at":"2026-08-12T18:38:18.792629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T18:38:18.797615Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.797615Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:af273d5607b5ce7ecc5e110dca1ba1e446592f60fd8ea46ee77a14290ee8a2c5","observation_id":"660777d5-cb9c-4b98-b151-3a197f179d4e","resolution":{"observed_at":"2026-08-12T18:38:18.797615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18361","last_updated":"2024-05-28T16:57:44Z","snapshot_observed_at":"2026-08-12T23:55:56.455828Z","submitted_at":"2024-05-28T16:57:44Z","title":"Is a 3D-Tokenized LLM the Key to Reliable Autonomous Driving?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18361","snapshot_observed_at":"2026-08-12T18:38:18.802194Z","title":"Is a 3d-tokenized llm the key to reliable autonomous driving? arXiv preprint arXiv:2405.18361, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.802194Z"},"links":{"cited_paper":"/paper/2405.18361","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:71ad5d8dc3df459f2471b6099231ec324f1287dd4e1c5173c01fa71a875e69f2","observation_id":"ffdf892f-bd6e-4a73-abd7-c55e88b008fd","resolution":{"observed_at":"2026-08-12T18:38:18.802194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.988165Z","title":"Ar- trackv2: Prompting autoregressive tracker where to look and how to describe","venue":null,"work_id":"a361b1fe-2554-4206-b473-093da5a1b36c","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.806733Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:efaefea3c588dff5bf7951a190812df5d5d5473059323941443736b83fa24b67","observation_id":"4c869d3f-597c-4e61-92cc-3786a74a9fb0","resolution":{"observed_at":"2026-08-12T18:38:19.991922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05961","last_updated":"2024-08-21T22:46:05Z","snapshot_observed_at":"2026-08-13T00:34:33.528585Z","submitted_at":"2024-04-09T02:51:05Z","title":"LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05961","snapshot_observed_at":"2026-08-12T18:38:18.810790Z","title":"Llm2vec: Large language models are secretly powerful text encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.810790Z"},"links":{"cited_paper":"/paper/2404.05961","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:8bf99f8e40aa470964244380eaaa25fe358f953784fafd4a5305f57604544bbd","observation_id":"c4c56f93-3de8-484b-a1ad-86a340e98125","resolution":{"observed_at":"2026-08-12T18:38:18.810790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.976932Z","title":"Language models are few-shot learners","venue":null,"work_id":"e9aba53e-a3cd-400f-bc9c-a66564a2df69","year":2020},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.815209Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:467087bdd34a42c974f4e514b8c2f972930a59c77767ef655027d2844d1161cb","observation_id":"5e25dad2-cdbc-4c67-a9af-08fa36885ddf","resolution":{"observed_at":"2026-08-12T18:38:19.981028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.964128Z","title":"Cross-lingual and multilingual clip","venue":null,"work_id":"906cf581-8005-48df-a6f6-feedec1c3d87","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.819267Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:62027f047c5a651924a1cd2aeca0f8021557e9711f80e3421f274fa8f052ed75","observation_id":"0c0df006-4258-4b48-ba93-2aa5bcbf47b9","resolution":{"observed_at":"2026-08-12T18:38:19.968846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-12T18:38:18.823234Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.823234Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:575db86c2e8f7157dee885e2da4e8648ce5427bfc49c0eb9a4ff80a8b59eca05","observation_id":"f2176700-0419-4c48-b9f3-f506a023749c","resolution":{"observed_at":"2026-08-12T18:38:18.823234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.949929Z","title":"Pali: A jointly- scaled multilingual language-image model","venue":null,"work_id":"fb44cb47-34c9-4b63-9706-37938755fae4","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.827882Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:669b730585050c9b6155afae58d0d9455b53e67813b1d9deb47e5b6f22095ac6","observation_id":"99a2709e-9a1a-4d99-890b-3cf78d420f12","resolution":{"observed_at":"2026-08-12T18:38:19.954196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.936697Z","title":"Altclip: Altering the language encoder in clip for extended language capabilities","venue":null,"work_id":"b6d6631f-9612-4dd2-bf56-726b7d48cd82","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.833993Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:e52173bdbc343affe2952b68e783be789fa091264b9aca4de831ed26c447294f","observation_id":"d1b03554-275a-471a-bd59-81be51e97053","resolution":{"observed_at":"2026-08-12T18:38:19.941293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.922194Z","title":"Maskclip: Masked self-distillation advances contrastive language-image pretraining","venue":null,"work_id":"69e7da17-ad4e-459f-b9ea-b530e35cb16e","year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.840322Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:a1f86199a6f07a8b1e455e99d99c0359cff8fa441444ece9fe5e1362470fd4af","observation_id":"818f101b-df01-47cb-9ef8-8d580dbea403","resolution":{"observed_at":"2026-08-12T18:38:19.927385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.900667Z","title":"An image is worth 16x16 words: Transform- ers for image recognition at scale","venue":null,"work_id":"871a2f88-6f0e-4698-b9c1-cbff7ba82782","year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.845096Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:1a8b536983622abb9bd498e099084620a1bd3f013053393b4ead7a4e17bc4beb","observation_id":"d7465e84-03ff-4c58-ba74-e7446b4560ab","resolution":{"observed_at":"2026-08-12T18:38:19.906995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.887953Z","title":"Improving clip training with language rewrites","venue":null,"work_id":"1781a834-70cd-47e0-acb8-3ce3ab377849","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.849417Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:6ab983830a989602abbccc2693bc2f1195fc39aee002c9a67d4daef25384aa56","observation_id":"10bec2c1-eddb-469a-9391-df7cae57fefa","resolution":{"observed_at":"2026-08-12T18:38:19.891952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:18.853452Z","title":"Pyramidclip: Hierarchical feature alignment for vision-language model pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.853452Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:a9c4646306be278e00b9ee707062371154e5c085c46e46078b0d221c0faaad31","observation_id":"2dc147cf-df78-40ce-8f07-695493844f6b","resolution":{"observed_at":"2026-08-12T18:38:18.853452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.869404Z","title":"Softclip: Softer cross-modal alignment makes clip stronger","venue":null,"work_id":"11436a05-001e-4967-8036-2474a8aec2e3","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.857225Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:f430a5b578f4c0feec48704307c468fbc543301312469e713d7a3b9258e513e6","observation_id":"f562151e-0523-4909-994a-422254de4be5","resolution":{"observed_at":"2026-08-12T18:38:19.873648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.857573Z","title":"Hiclip: Contrastive language-image pre- training with hierarchy-aware attention","venue":null,"work_id":"b9ff0bc6-520d-455b-83f1-9ec4d7eccdfd","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.861394Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:07e954078e41cfdecaef251dc4c57a29de86d204ae9c199133c53f310ca7134b","observation_id":"a44e35a2-0ca5-42d9-9767-00719897ee77","resolution":{"observed_at":"2026-08-12T18:38:19.861679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.845853Z","title":"Sugarcrepe: Fixing hack- able benchmarks for vision-language compositionality","venue":null,"work_id":"5727b92c-5d88-4464-aeda-720324187615","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.865235Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:f096b5d94a9b3fefff4ed224368a3907f559a34cbe1af1caab50bd0da2630007","observation_id":"f8b962ac-6dc7-4488-a66d-56777c37f4a0","resolution":{"observed_at":"2026-08-12T18:38:19.849945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.832477Z","title":"Openclip, 2021","venue":null,"work_id":"98795cb0-5bdb-44e4-831e-4ba38d42748f","year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.869235Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:d21c638351a7ea0e35b3fe6abeb47aa4f1b26fb0806a36de6eac0414212443f7","observation_id":"8a850156-b50c-410f-a52f-a7e55f11e682","resolution":{"observed_at":"2026-08-12T18:38:19.837127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.820407Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"10e17752-bab1-4ec9-9ba8-099d77b57b57","year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.873432Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:17b71db5eda8296239eb1650be441c83122e13e3c565c69b9a691e3432f1fb8e","observation_id":"cd64749d-6852-4338-bceb-c524d5dfda4c","resolution":{"observed_at":"2026-08-12T18:38:19.824649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T18:38:18.878448Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.878448Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:2717b094826e06753045f1f976c9fd78f4e3b5f647ad2d3757994c87e25879e3","observation_id":"00cb0a3b-3899-409a-b0e7-2a1a893c0f8f","resolution":{"observed_at":"2026-08-12T18:38:18.878448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16645","last_updated":"2023-07-31T13:26:03Z","snapshot_observed_at":"2026-08-01T09:03:35.501236Z","submitted_at":"2023-07-31T13:26:03Z","title":"Scaling Sentence Embeddings with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16645","snapshot_observed_at":"2026-08-12T18:38:18.882734Z","title":"Scaling sentence embeddings with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.882734Z"},"links":{"cited_paper":"/paper/2307.16645","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:82d42d76a74940fd31241c8e0b519d48a6e8779d488eddfecc538f2673c3ebb4","observation_id":"8d033562-e4e6-40c2-97d8-eb4b9b788d4f","resolution":{"observed_at":"2026-08-12T18:38:18.882734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.808380Z","title":"Misalign, contrast then distill: Rethinking misalign- ments in language-image pre-training","venue":null,"work_id":"3aa4b48d-7df1-463e-8535-511c9b9753cb","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.886495Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:8143ddf1a4644746f337603597ee460459df0947f42c550a8d65bb8e4a232e6a","observation_id":"9523231a-5fe3-433f-b323-a0f5e73eb07c","resolution":{"observed_at":"2026-08-12T18:38:19.812134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-08-12T23:54:01.626288Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-12T18:38:18.890177Z","title":"Jina clip: Your clip model is also your text retriever","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.890177Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:022c87e3f3226d16c53f1df8458e2d3cfbcabc739386cf8b210bf8ed9027767a","observation_id":"03a6eaf3-1f33-47d8-b5fd-cbadd5602711","resolution":{"observed_at":"2026-08-12T18:38:18.890177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07699","last_updated":"2024-03-13T22:27:08Z","snapshot_observed_at":"2026-08-13T05:51:56.999684Z","submitted_at":"2023-10-11T17:49:13Z","title":"VeCLIP: Improving CLIP Training via Visual-enriched Captions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07699","snapshot_observed_at":"2026-08-12T18:38:18.894281Z","title":"From scarcity to efficiency: Improving clip training via visual-enriched captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.894281Z"},"links":{"cited_paper":"/paper/2310.07699","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:d3d693f136d8122979c3fd9fdebf5a299716c47f6a31926d43ffdb45e3da585c","observation_id":"df8046fa-aa08-4e92-9781-8bcb8859ac51","resolution":{"observed_at":"2026-08-12T18:38:18.894281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.796426Z","title":"Uni- clip: Unified framework for contrastive language-image pre- training","venue":null,"work_id":"389d8605-68c7-404f-8c37-dbb2b621bd14","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.898476Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:6ed9b538ac8a9c22fab88ea8c4dd24d68ed30f5ed151d5b88c23a51b8afd6f7e","observation_id":"e468e0e3-9f0b-4f11-9434-debbc4ba3d07","resolution":{"observed_at":"2026-08-12T18:38:19.800689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20327","last_updated":"2024-03-29T17:56:40Z","snapshot_observed_at":"2026-08-13T00:41:52.368105Z","submitted_at":"2024-03-29T17:56:40Z","title":"Gecko: Versatile Text Embeddings Distilled from Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20327","snapshot_observed_at":"2026-08-12T18:38:18.902333Z","title":"Gecko: Versatile text embed- dings distilled from large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.902333Z"},"links":{"cited_paper":"/paper/2403.20327","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:14964dc40a7f559dda216bf7a5e52a4ac6c7f2feb38e885e6a90f34c20a3c482","observation_id":"e9c16874-4ff8-4c72-9d0b-036dbe818bdc","resolution":{"observed_at":"2026-08-12T18:38:18.902333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.784158Z","title":"Meta-task prompting elicits embedding from large language models","venue":null,"work_id":"6612a673-97bc-44d0-bf12-c8e792ebc5b0","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.906723Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:78f12bf55f33e7a40842ed0c2ce64cf6fa20bc2bc141efa5f367d621e84ce30a","observation_id":"10ee5516-cff1-45b8-be52-193017adfe4b","resolution":{"observed_at":"2026-08-12T18:38:19.788710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.771871Z","title":"Scene graph generation: A comprehensive survey","venue":null,"work_id":"694564f4-19c9-4637-9cb4-3090263dd6a0","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.910853Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:69bc7c4be7a2c9723479b1556d91b2ef87568ffbdd0c264c07e97d8bd11f54d2","observation_id":"6eccc694-931a-4ab0-8990-fbe6fecc8037","resolution":{"observed_at":"2026-08-12T18:38:19.775909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.760158Z","title":"Grounded language- image pre-training","venue":null,"work_id":"507b75b4-a71d-4e07-b99a-92ac8913a1c0","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.914822Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:d190e6618c11e88a431dc0a198484adf625b9b1c22b5297e8400fe912e900619","observation_id":"16d083a4-7b19-4f7e-861f-e3aa071eb484","resolution":{"observed_at":"2026-08-12T18:38:19.764217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.748574Z","title":"An inverse scaling law for clip training","venue":null,"work_id":"22afc593-c2cd-482f-9bd1-8a5f4f77f29d","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.919615Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:e57febb1c3bb29cf5b57393c6167522ce2025e8357992271708775d5b5216f26","observation_id":"c291c074-5c93-4778-b7b3-73303cae886f","resolution":{"observed_at":"2026-08-12T18:38:19.752353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.737636Z","title":"Scene graph generation from objects, phrases and region captions","venue":null,"work_id":"d240da04-20a5-43a3-8a17-4c97b7d0ddea","year":2017},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.923463Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:5621fd86cd5f62c5b8a4f55739f5c2efed3c49ba6a6dcfa34f2f4eb1001069fa","observation_id":"ad7acedf-ad08-4128-aa9b-576f699a806f","resolution":{"observed_at":"2026-08-12T18:38:19.741521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.725650Z","title":"Supervi- sion exists everywhere: A data efficient contrastive language- image pre-training paradigm","venue":null,"work_id":"3646dd21-51ce-4d5e-9a61-d07c55661b23","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.927328Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:acbcfb81674faa50ca37dd7c59e27e167ba5520e4f4807d6c32f70b3796b0e0b","observation_id":"a00fbd1f-04a6-4e30-bb3a-28cd27b1015b","resolution":{"observed_at":"2026-08-12T18:38:19.729879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:18.931234Z","title":"Scaling language-image pre-training via masking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.931234Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:efd2bc9f087e3014f99a4861d0b93db64b3af8898cc19a911aa9957097351b39","observation_id":"27244eb8-92a5-4a14-9c51-e2409d99e880","resolution":{"observed_at":"2026-08-12T18:38:18.931234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.705723Z","title":"Language quantized autoencoders: Towards unsupervised text-image alignment","venue":null,"work_id":"143e46de-d3b4-403a-aab8-acb3acff45c9","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.935183Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:63c967845922bec320b3f1c148c075552e124863339e6d0bf3b05cf882481aae","observation_id":"7358f3c8-a38c-4ecc-ac23-1f39083baa42","resolution":{"observed_at":"2026-08-12T18:38:19.709761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18765","last_updated":"2024-03-13T08:47:32Z","snapshot_observed_at":"2026-08-13T05:13:02.978242Z","submitted_at":"2023-11-30T18:05:52Z","title":"MLLMs-Augmented Visual-Language Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18765","snapshot_observed_at":"2026-08-12T18:38:18.940013Z","title":"Mllms- augmented visual-language representation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.940013Z"},"links":{"cited_paper":"/paper/2311.18765","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:f15ca62d1411ffef04eeb7c910becfeea2f31f63ccf34acd604d4dbddd97f3af","observation_id":"07d857dd-9ef6-473b-aeff-8efc72d12d18","resolution":{"observed_at":"2026-08-12T18:38:18.940013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T18:38:18.944402Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.944402Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:253e2be3780c949f4100998279039851f974a51b52b805a26dfae1d66a9ed9ac","observation_id":"eb291ae4-5fcb-422f-bd0d-46559506bd91","resolution":{"observed_at":"2026-08-12T18:38:18.944402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.692117Z","title":"Slip: Self-supervision meets language-image pre- training","venue":null,"work_id":"704f0328-f76f-4028-9512-f94fde11221b","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.948730Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:f106e206af4b39899d52b6799ce70c41cf66b37147b017714ea58a7565591251","observation_id":"0686173c-cdf0-4d4b-b1df-3615ec2ce85e","resolution":{"observed_at":"2026-08-12T18:38:19.696620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09906","last_updated":"2025-03-03T04:28:49Z","snapshot_observed_at":"2026-08-13T04:18:23.781512Z","submitted_at":"2024-02-15T12:12:19Z","title":"Generative Representational Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09906","snapshot_observed_at":"2026-08-12T18:38:18.952619Z","title":"Gen- erative representational instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.952619Z"},"links":{"cited_paper":"/paper/2402.09906","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:36f285bc00f0201d91414a536eafb3a09d27364746be1e36186947c2294f8f30","observation_id":"ecf32336-bbed-4254-bbdc-e17cb97b2bcf","resolution":{"observed_at":"2026-08-12T18:38:18.952619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.679519Z","title":"Docci: De- scriptions of connected and contrasting images","venue":null,"work_id":"61aeb964-f610-4f91-ab97-ae2564f8f57f","year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.956758Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:0fd35e6c94199ab896b5b6ec4271a21a35f873e579f6b3f5f2cec77615730177","observation_id":"e9fcf66c-1c73-49af-a6c7-910c486ad503","resolution":{"observed_at":"2026-08-12T18:38:19.683887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.666761Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"c5dea3ef-11f3-47b1-8efd-d4087b94210f","year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.960633Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:133eac52da760b9feb2cf53df869fc7d46aaf2f22ea74d4bad673c3cc858399e","observation_id":"37cbdc5f-e82c-4926-8245-1520109e40ca","resolution":{"observed_at":"2026-08-12T18:38:19.670928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:18.964348Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.964348Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:6f421c6c72e7b4eb22f17461d18b5d3788a440bc475e11d38e7b5291b396f3ba","observation_id":"5d1b15dd-82f4-4705-b955-ae8943f16fcc","resolution":{"observed_at":"2026-08-12T18:38:18.964348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.644408Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"af5d2055-0a6a-47fc-a953-16339177654f","year":2018},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.968709Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:bef7091651d3511441ae8acecf31d1fc468d6317619b5c200f1ad940afe066f9","observation_id":"00ea4c14-7c8a-47b0-b0eb-3be3273f8e55","resolution":{"observed_at":"2026-08-12T18:38:19.648904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15449","last_updated":"2025-09-07T18:50:16Z","snapshot_observed_at":"2026-08-13T04:11:58.141409Z","submitted_at":"2024-02-23T17:25:10Z","title":"Repetition Improves Language Model Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15449","snapshot_observed_at":"2026-08-12T18:38:18.973434Z","title":"Repetition improves lan- guage model embeddings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.973434Z"},"links":{"cited_paper":"/paper/2402.15449","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:3f4acd40bad6e5c8423fff3bc091a80d6f12c0a61a16fd232ff4c3386e267ee2","observation_id":"b94bf483-407b-4f26-b040-3338f133aeb3","resolution":{"observed_at":"2026-08-12T18:38:18.973434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-12T18:38:18.979973Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.979973Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:1698c7afff964d65b473f16ec68a19d5930269bfdf7d4d32701b72eaad6c9e8a","observation_id":"1b1a5244-7d1c-4258-b856-f9a6ca575b3c","resolution":{"observed_at":"2026-08-12T18:38:18.979973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.629030Z","title":"Crossmodal-3600: A massively multilingual multi- modal evaluation dataset","venue":null,"work_id":"c6a013da-6a00-48af-b86b-413c0fc0463b","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.985183Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:8601750287606d92a789c041e9fdeb70e515619d636c80cfad0b78f6334c44f4","observation_id":"64e4cd87-453e-4e07-aac4-042fc769be0f","resolution":{"observed_at":"2026-08-12T18:38:19.635017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.616141Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"5408f0a6-4107-4895-9efa-c1fb7fae574f","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.989037Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:b79788a88e86df9e3d0d9fb42e3b81e958d3c780faa9b2367fd892a4f39040c3","observation_id":"a603a36f-318c-49e6-9fb0-e34cf50d15a4","resolution":{"observed_at":"2026-08-12T18:38:19.620165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.603825Z","title":"Stablerep: Synthetic images from text-to- image models make strong visual representation learners","venue":null,"work_id":"14b6e95e-e16f-438f-aa34-1ec2c35b15c2","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.992900Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:d1478a0c10ea7def746ff5cab6b53c0e13524808e60af53104cdff4b16cb8c6d","observation_id":"49222733-a491-46c9-accc-61f176f490a4","resolution":{"observed_at":"2026-08-12T18:38:19.608271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T18:38:18.997000Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.997000Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:d3458c6838d69e6423d3723f93a4498eb9556093a755ba87c665b674b8a91a43","observation_id":"3d212d76-ad4e-4472-a9a6-86c71f9e7b44","resolution":{"observed_at":"2026-08-12T18:38:18.997000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.591953Z","title":"Multimodal few-shot learning with frozen language models","venue":null,"work_id":"137b9b3e-6138-494e-81e1-2a10f28f088d","year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.001300Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:adf09b8948ac9843ff3c9d28d9468102839c9af72dd8456c68ba4793cc6c5746","observation_id":"181ea0ff-5cca-4aec-aaee-a07ffa20816e","resolution":{"observed_at":"2026-08-12T18:38:19.596000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01859","last_updated":"2023-11-01T18:43:34Z","snapshot_observed_at":"2026-07-06T16:14:13.509663Z","submitted_at":"2023-09-04T23:26:11Z","title":"NLLB-CLIP -- train performant multilingual image retrieval model on a budget","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01859","snapshot_observed_at":"2026-08-12T18:38:19.006394Z","title":"Nllb-clip–train performant multilin- gual image retrieval model on a budget","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.006394Z"},"links":{"cited_paper":"/paper/2309.01859","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:3e9dc9acca518934ecef13724840b0ea26fb430328085cf7e412ca6389ee707e","observation_id":"ee888382-854d-4e60-8872-239e223ef6e8","resolution":{"observed_at":"2026-08-12T18:38:19.006394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00368","last_updated":"2024-05-31T07:22:01Z","snapshot_observed_at":"2026-08-13T04:50:57.181092Z","submitted_at":"2023-12-31T02:13:18Z","title":"Improving Text Embeddings with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00368","snapshot_observed_at":"2026-08-12T18:38:19.011691Z","title":"Improving text embeddings with large language models.arXiv preprint arXiv:2401.00368,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.011691Z"},"links":{"cited_paper":"/paper/2401.00368","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:8d4c4acbb9b35695a1f438dc3963129b3147998662dfc7dde00be8d8a4f64f9c","observation_id":"b07fbd1e-0b69-4a54-bc5e-52af05dbb357","resolution":{"observed_at":"2026-08-12T18:38:19.011691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.580094Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"82e93f5c-a4af-4a4b-892b-2e5b6934a1b5","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.017503Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:a1b8b5a260f34e3150b5884538807cab44798f56af5fae01b833dd45a2d7ba53","observation_id":"ef407a48-25e3-4da7-8ac7-cbc02f5c9153","resolution":{"observed_at":"2026-08-12T18:38:19.584093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-09T14:06:46.815770Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-12T18:38:19.021241Z","title":"Chinese clip: Con- trastive vision-language pretraining in chinese","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.021241Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:5f0afada10146ba5f419de43eabb139c1fd68ffebafd0f3b4f6961717a245ae2","observation_id":"5ba97f96-d30f-4d48-8a22-a1c68accd075","resolution":{"observed_at":"2026-08-12T18:38:19.021241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.567878Z","title":"Alip: Adaptive language-image pre-training with synthetic caption","venue":null,"work_id":"c8311049-d35a-48cb-8d1b-435f3b7c8e14","year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.025421Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:fb791faed540921abb620d14c4629aa0830e59a6e72dc6f822a7a7481d75996e","observation_id":"0d6bbb8b-f28e-4df6-b230-c09b5f4bffa4","resolution":{"observed_at":"2026-08-12T18:38:19.572338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-12T18:38:19.029722Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.029722Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:3dca6b57c9a90feb5ca47b6231c878a6264ebdd2e82ee1caadeeee25937788c6","observation_id":"08a0c0fb-f71e-41cd-9394-4ac6a690eb78","resolution":{"observed_at":"2026-08-12T18:38:19.029722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-12T18:38:19.034360Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.034360Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:99ebcc74cdec1fcbc1235bda79539d4090e1af06e4407645105c8ded11e5c7bb","observation_id":"b9688f0f-3c42-4e1c-8b41-f20410f578c1","resolution":{"observed_at":"2026-08-12T18:38:19.034360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.453050Z","title":"Spae: Semantic pyramid autoencoder for multimodal generation with frozen llms","venue":null,"work_id":"599699d8-58f5-4ebc-a542-97570ba993bf","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.038843Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:88ef93eb2215a52b131dc5ce36df28fcfd281865dbc09a55eef4af1620f2cfc9","observation_id":"6700abaa-d14e-4096-b8d4-80892ca4f79f","resolution":{"observed_at":"2026-08-12T18:38:19.456970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.442052Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"2c07b239-0c81-4d9c-aa31-6de889dfee84","year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.042838Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:3ebeaeac9e174ed829eba09344a2e9f648b4f0b2e39a19f54c0dac324c59c23c","observation_id":"46fbb959-e44a-465c-a66f-4232af836c81","resolution":{"observed_at":"2026-08-12T18:38:19.445829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.428622Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"222f955f-f47b-4d82-9af0-2df5c7e4ed37","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.046846Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:5154343f97be589e0b13d5144a66e0c8e97df8a190202a549debe308d2a0e079","observation_id":"24684c16-7b27-4655-9deb-003400c7547c","resolution":{"observed_at":"2026-08-12T18:38:19.433717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.415384Z","title":"Simple techniques for enhancing sentence embeddings in generative language models","venue":null,"work_id":"2bdb12d0-899e-49ab-8e69-bcce3dae11e4","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.051036Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:5ced4c08579213f8cf5508238273b9c2f85225c8c29fcc2bba1068f06a0ae909","observation_id":"0a8f4552-a5fc-4809-bdf8-9683dbfab0d1","resolution":{"observed_at":"2026-08-12T18:38:19.420132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.402789Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"464ba178-0000-4033-90fe-d40672135900","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.054747Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:0d1d3bdea2ff6eaf0cd5a7003b3c4ca12a6c72812a8707c55efab72412208c94","observation_id":"688377fb-d2d8-4516-b32b-70dc64e34dc9","resolution":{"observed_at":"2026-08-12T18:38:19.406652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.391018Z","title":"Dreamlip: Language- image pre-training with long captions","venue":null,"work_id":"b6c73986-6d65-4385-bb9e-ea366fe30bea","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.058927Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:f6daacb98dff7db16bfb5df821ee585e5b57276a219d2b06477c3375da142431","observation_id":"d5678b42-79b4-4865-aee6-2f0a69950a5f","resolution":{"observed_at":"2026-08-12T18:38:19.394875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.378811Z","title":"Beyond text: Frozen large language models in visual signal comprehension","venue":null,"work_id":"12f1136c-5829-4b25-afb5-c57ed1d08480","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.062778Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:465cb4d106ebb4075fda614bd68f48168f32132db5e3ae86c444e23e3023a4bb","observation_id":"31db733f-781e-4cc3-a199-1dcc8e19c9c8","resolution":{"observed_at":"2026-08-12T18:38:19.382821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.364051Z","title":"yi”. After thinking step by step, the category of the main object in this image means in just one word:","venue":null,"work_id":"ec0dc157-e530-4842-a7ab-cfa4ed84563b","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.066615Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:59356c5481c3a1d93aca91c5ba5b853941d28e6d381e36d6023e5b84812dc3de","observation_id":"bbb638db-a5df-4c67-a476-1f77e401f0d7","resolution":{"observed_at":"2026-08-12T18:38:19.370466Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2411.11927."}