{"as_of":"2026-08-14T09:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b506b32a4f4b512304bfb29f2f8850453ea97532e412266c23e38db5a111e54","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:22:55.635316Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:54:09.796839Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T18:54:12.830432Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"cited_work":{"arxiv_id":"2412.06774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06774","snapshot_observed_at":"2026-08-06T18:54:12.830432Z","title":"Visual Lexicon: Rich Image Features in Language Space","venue":"cs.CV","work_id":"301c2883-8571-438a-930c-d16df23ac732","year":2024},"citing_paper":{"arxiv_id":"2507.07104","last_updated":"2025-07-11T03:43:50Z","snapshot_observed_at":"2026-08-13T04:04:58.548265Z","submitted_at":"2025-07-09T17:59:04Z","title":"Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:54:09.796839Z"},"links":{"cited_paper":"/paper/2412.06774","citing_paper":"/paper/2507.07104"},"observation_digest":"sha256:f44784c0c24b08311bc2dafc8e85b596488c01b3c1bf176fa3a26c9f01adae18","observation_id":"e599697c-7bea-411d-b4f2-60dcfa7a302b","resolution":{"observed_at":"2026-08-06T18:54:12.941828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.06774/citation-record","integrity":"/paper/2412.06774/integrity","json":"/paper/2412.06774/citation-record.json","paper":"/paper/2412.06774"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T19:22:54.902029Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.902029Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:defaaf13539d057660ea403b7f5329fb2bce7240328a1a73d0b64ffc72bf744b","observation_id":"fa53fbcf-cfba-451d-b919-ac685e9b21d2","resolution":{"observed_at":"2026-08-11T19:22:54.902029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.911285Z","title":"BEit: BERT pre-training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.911285Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:3953f90dab1ec1c9a0d8e8fe125aff0e3e840711cab48f7c03141b7c42a6c779","observation_id":"df5898d1-f414-46de-844d-3616b039a90c","resolution":{"observed_at":"2026-08-11T19:22:54.911285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.918280Z","title":"Label-efficient se- mantic segmentation with diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.918280Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:a0e51d9b76635dae7d01bf7e232d1881115be482e790fd16e65d32c05f5a0afe","observation_id":"8110e71e-2571-433c-812b-960dd4e6a763","resolution":{"observed_at":"2026-08-11T19:22:54.918280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.925181Z","title":"Generalized denoising auto-encoders as generative models","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.925181Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:3910e5c648b5c5fe19d1a2f36855b67edf1da36bb949875f78bb0d03c88c0a9a","observation_id":"11a12ab5-d0aa-4f21-b0e2-42b25e537971","resolution":{"observed_at":"2026-08-11T19:22:54.925181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.931763Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.931763Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:d57aa1957091a6b38176d3f9e573abb9a738697552aea1493aeb8b9e233f62c6","observation_id":"2bf1a14f-f047-4925-b72f-44ddb677ce87","resolution":{"observed_at":"2026-08-11T19:22:54.931763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-11T19:22:54.939829Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.939829Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:dfbe0898f0b12a3c318b83a6a3db3aff23a99b5213d049dd6f04373d58f7b9fc","observation_id":"187cf068-12cc-4afb-89fd-f1b572370631","resolution":{"observed_at":"2026-08-11T19:22:54.939829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T19:22:54.949489Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.949489Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:7186cb9a34ca24d89fcc0dab08a4a574aadd2e508008aa55ec5619960f36f95d","observation_id":"a7233933-ab07-44fb-91cf-bdef1edd0a01","resolution":{"observed_at":"2026-08-11T19:22:54.949489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.957417Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.957417Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:8b2afa9a85d3ec9d9d46b8ab104211008f1d45eba338703210facfc69f1ed976","observation_id":"34f3191c-b220-4d09-b037-40fae470963c","resolution":{"observed_at":"2026-08-11T19:22:54.957417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.966657Z","title":"Generative pre- training from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.966657Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:f2212bfc6fffb074ee494d8624502d0462cc65d386d5fbde6b9aae294fbee2ed","observation_id":"1cf3a614-1b2c-4dd0-b362-f39cbf9c9fa8","resolution":{"observed_at":"2026-08-11T19:22:54.966657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T19:22:54.975741Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.975741Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e22573bd1521450dbf614d1dcd0b12c367c6839c6b2ec2636546fbab14151a1e","observation_id":"ed4090ed-fc6a-48d9-acaf-358c37ae14e3","resolution":{"observed_at":"2026-08-11T19:22:54.975741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-11T19:22:54.983804Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.983804Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:83b95166839345f2652e139fb899a780d7aea9c44d3e01df9bf043993daaf279","observation_id":"4471d54f-f548-4395-83ad-6a7ecc68b03c","resolution":{"observed_at":"2026-08-11T19:22:54.983804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14404","last_updated":"2024-01-25T18:59:57Z","snapshot_observed_at":"2026-08-13T04:34:32.714579Z","submitted_at":"2024-01-25T18:59:57Z","title":"Deconstructing Denoising Diffusion Models for Self-Supervised Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14404","snapshot_observed_at":"2026-08-11T19:22:54.993646Z","title":"De- constructing denoising diffusion models for self-supervised learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.993646Z"},"links":{"cited_paper":"/paper/2401.14404","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e32033cb0033b0bfdc05cb4f86b3ef04d4c60f269fa3d275b740aaf63bb73b46","observation_id":"5ed146b8-028f-4577-a6e2-05d74d7da021","resolution":{"observed_at":"2026-08-11T19:22:54.993646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.003755Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.003755Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:834f78b7315bd288405317d02fd5f593f66d477a3bb32fcc767a850c6e19f198","observation_id":"7541b5ae-c73c-49bb-853f-026e0c757138","resolution":{"observed_at":"2026-08-11T19:22:55.003755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.010841Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.010841Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:4a61bdec0c5b461076229e4759ce5d31b6de839e35a380b4d2952e18eeddf255","observation_id":"5f2108ee-e53b-4aaa-9503-3a674420d1c9","resolution":{"observed_at":"2026-08-11T19:22:55.010841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.017006Z","title":"Large scale adversarial representation learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.017006Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:8cb41a959cc6e5941ad90195d3265db6fc7610bafe73b53f37da7ca6113ae753","observation_id":"03c98d72-164b-46e9-8f91-76a18d6c12ef","resolution":{"observed_at":"2026-08-11T19:22:55.017006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.023580Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.023580Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:875e0391893545a3449784e4d4f4c4f827cf2ea1acfda62a57cf724590a73909","observation_id":"dfbf0931-9762-45ec-a0db-b6e1c13dcffa","resolution":{"observed_at":"2026-08-11T19:22:55.023580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.404184Z","title":"A new algorithm for data compression","venue":null,"work_id":"ed6f771f-85c8-472e-8e6e-d055f3b8512c","year":1994},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.029405Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:24ae2dd8b6ede70ac00a953f8d551d512fb1e94c3ab8ba47d2bd1ad01c42e243","observation_id":"6ccb5774-6814-46c8-833f-2be2bdda1bf9","resolution":{"observed_at":"2026-08-11T19:22:57.410098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.372961Z","title":"An image is worth one word: Personalizing text-to-image gen- eration using textual inversion","venue":null,"work_id":"591734c1-4083-48c6-a36d-bff650f725ba","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.034815Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:32563cda04f231ac113c35015392a8a60cc4d33e6bb23eccc46a21ff6e34ed8d","observation_id":"af91a1d3-e1e5-4ffb-918d-634b705575b9","resolution":{"observed_at":"2026-08-11T19:22:57.383161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.346912Z","title":"Instructcv: Instruction- tuned text-to-image diffusion models as vision generalists","venue":null,"work_id":"3bec327f-bca3-48dd-847b-d3c40e7694a6","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.046351Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:87287372036327cdac6234f43b947ab5c84fc38a8c14e6bc4cde91230ee1473a","observation_id":"1d414d07-28c6-4f8d-89ae-da66703c8d72","resolution":{"observed_at":"2026-08-11T19:22:57.352919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.056655Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.056655Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:bacb004f7e6637820fa778013d9655de12981a0ba6f328a450d9c732a4fca3de","observation_id":"9ebe5898-7155-478e-9f7c-984e83ac06bf","resolution":{"observed_at":"2026-08-11T19:22:55.056655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.307334Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"5bc332fd-9b46-414e-bb19-ba7b4b40b462","year":2017},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.065525Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:980e7b1f596b72e08e2059a2acf045f788f66d90b00ea28aa479ca34320cda46","observation_id":"8fcdbec4-24b4-4a5d-9cd8-4672cdd60922","resolution":{"observed_at":"2026-08-11T19:22:57.313708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.072741Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.072741Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:5cff2b1d0ef29f74cacf1ea87a3eafceb1f14a7d4cb8ab901973ba7b101ee410","observation_id":"3d9bdb7a-b3b2-4aba-8c93-62428a98577e","resolution":{"observed_at":"2026-08-11T19:22:55.072741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.274455Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"4af1a185-fa92-41ad-abf0-ffaa626dbf57","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.078927Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:bcd34ae4d6c6d1e845875ad5a7f875674337be199675e70dba152fb4016b4626","observation_id":"dfda47b2-9d57-4352-bc29-30acf26db66c","resolution":{"observed_at":"2026-08-11T19:22:57.281433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.089100Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.089100Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:86759866e39b424584e23e4cdc860a2988c4d749c09a2679ffb755bd1b0f2b5f","observation_id":"7bc44f81-38ce-4805-bc07-4364fc897ec9","resolution":{"observed_at":"2026-08-11T19:22:55.089100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.243947Z","title":"Autoencoders, mini- mum description length and helmholtz free energy.Advances in neural information processing systems, 6, 1993","venue":null,"work_id":"772a30df-9540-4465-b9e3-afa7bb31e022","year":1993},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.098671Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:338aabe8b2431a2e33a2952a8ceebd63be85bda878b5df6c35853db532c62e8c","observation_id":"ec23e6a0-1c94-4aab-a2a6-dc8159441e07","resolution":{"observed_at":"2026-08-11T19:22:57.250336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.108679Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.108679Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:6d0bf6bc3ee975dc796cfb74234373e991c283bc45df124b54ee5497289fa7be","observation_id":"f8c2c37b-6659-46f5-b568-2aeafbbc2a9a","resolution":{"observed_at":"2026-08-11T19:22:55.108679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.115996Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.115996Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:25615467369288c5176144efe9ac1599e9b66faebb4750c41deeffa350ff9691","observation_id":"38770467-6fb6-47fe-a205-3d69acc679aa","resolution":{"observed_at":"2026-08-11T19:22:55.115996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11624","last_updated":"2021-10-25T04:37:30Z","snapshot_observed_at":"2026-08-13T17:48:19.451598Z","submitted_at":"2021-10-22T07:10:41Z","title":"SciCap: Generating Captions for Scientific Figures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.11624","snapshot_observed_at":"2026-08-11T19:22:55.125210Z","title":"Scicap: Generating captions for scientific figures","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.125210Z"},"links":{"cited_paper":"/paper/2110.11624","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:ce051a4e6f0ed1031053b6c47811df982e347067b8f1440d04504d11bb87c63e","observation_id":"bd3f989b-bf23-49db-b91e-65274e5f4643","resolution":{"observed_at":"2026-08-11T19:22:55.125210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T19:22:55.132713Z","title":"Lora: Low-rank adaptation of large language mod- els","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.132713Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:929e4f253e9298ef88d8ede480fd5c104030b7353d1e74110d0d4242e8b48992","observation_id":"77acda40-70fd-45e1-8a62-9ffb034197ec","resolution":{"observed_at":"2026-08-11T19:22:55.132713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.199820Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"6c8a20e4-dc60-4af9-be35-87310dac16fb","year":2019},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.140234Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e31a662437f7f725ced9e1b255b7d2fd980b58f0c2b637bbf806b171758adf76","observation_id":"820a3d38-192c-4903-8b28-2b68487e3ded","resolution":{"observed_at":"2026-08-11T19:22:57.205052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.181650Z","title":"Soda: Bottleneck diffusion models for representation learning","venue":null,"work_id":"736f8163-ea16-439d-91fd-940baa7fbeca","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.153036Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:f26aa19e5a30d736a0a1a827d1d458837ced06adfe025b126f67800dd60752e1","observation_id":"214ad2ed-739b-401b-a78e-4a7e7ceb5abb","resolution":{"observed_at":"2026-08-11T19:22:57.187455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.161598Z","title":"Open- clip, 2021","venue":null,"work_id":"9faaf5a4-5014-4432-80f5-364a33aee074","year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.163968Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:870c37cc148dfdd7e09efa21d8577952f02fb60725865ef4c6bf81b989a8cfb7","observation_id":"d048583f-2d3a-4248-995e-33dbe42e710a","resolution":{"observed_at":"2026-08-11T19:22:57.168440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.138852Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"beee715e-c8bb-44ee-9609-2932f6bf5034","year":2014},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.171855Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:f032dd0a7abc754c51d4fa3cc22ede29a6161bda15d02b239285a361e3417d2f","observation_id":"cbb5b517-af0f-4458-aca6-fa74ef836242","resolution":{"observed_at":"2026-08-11T19:22:57.145340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T19:22:55.180039Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.180039Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:816918eb0d1256ad92672bdb36d624fb6d682a2a6782a8fdd4035a03e16276c5","observation_id":"48d02701-c186-4f6d-a14f-6b27347adc43","resolution":{"observed_at":"2026-08-11T19:22:55.180039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.189781Z","title":"Your diffusion model is secretly a zero-shot classifier","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.189781Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:fa075f374b2e08148fe72546455e1f36c1e22ad800e0de5939aa187f24f37418","observation_id":"5722e5a2-58b1-469f-8f16-4016ff76d8ee","resolution":{"observed_at":"2026-08-11T19:22:55.189781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T19:22:55.196482Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.196482Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:b3fab6710ac8831e2c9518c5b116f2048fc8fa8cf826049a91686fb34f16fb2b","observation_id":"60760f2a-1876-4691-81ba-2bfdefc76522","resolution":{"observed_at":"2026-08-11T19:22:55.196482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.102016Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":"fbe19393-936d-4bc2-91f0-06eda6bdfc05","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.203918Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e1ca22184a96a62015536bc395d78f71f0b6660e3e3e9bdbfa76c0ebcca4eb30","observation_id":"0f506868-c561-40dd-ba55-39aa22e4f875","resolution":{"observed_at":"2026-08-11T19:22:57.108917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-08-12T22:32:20.078181Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-08-11T19:22:55.217594Z","title":"Imagefolder: Autoregressive im- age generation with folded tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.217594Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:be811b2125f1b505da25dffa798be77b22e3bea473b2c3518e6bb90514d047f4","observation_id":"2881563e-06ee-46ce-a4d5-84293a2247eb","resolution":{"observed_at":"2026-08-11T19:22:55.217594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.084843Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"957ac239-8368-4199-9dc8-c0704bfeeab8","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.226402Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:678fdb49ed0d1d5eec0664d722b4d341476f41bccc2da045082845329c7347c4","observation_id":"4234095f-c9a6-412e-920f-8b00f32cbcad","resolution":{"observed_at":"2026-08-11T19:22:57.090493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.066025Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"b702a170-5011-4344-9970-c76806446555","year":2014},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.231979Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:ecc2d77664653a896f8c96d15403f35c9beaccdb4e667695df5a90071fe49f95","observation_id":"51f159c9-6975-4607-9083-ce26e41d3649","resolution":{"observed_at":"2026-08-11T19:22:57.071696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.237076Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.237076Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:8b5ede883e0ab4169e795e1013a95d294f6e5d1a8364103a5655ff7aa288294a","observation_id":"31ef5b21-af4d-4adb-af7c-7cf765f11b39","resolution":{"observed_at":"2026-08-11T19:22:55.237076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.032562Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"37120dcd-a6a4-4150-a326-571182084fa4","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.244513Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:3d8cacb52e9af468515a10a7cedb7763d49de1625612c40c31cd1c3b1cd585fb","observation_id":"73a78549-8fda-415f-b5fd-31b0fe850442","resolution":{"observed_at":"2026-08-11T19:22:57.038651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.251306Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.251306Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:dbb8ce309dfb27264d56f69040aba3d35242a7d1a3de19042ce19eead465d7b9","observation_id":"16f3383e-3957-4fb6-87bd-f7260ef7f4b9","resolution":{"observed_at":"2026-08-11T19:22:55.251306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.998119Z","title":"Prompting hard or hardly prompting: Prompt inversion for text-to-image diffusion models","venue":null,"work_id":"b0b49b2d-5d26-43d6-b836-9c7877101530","year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.256987Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e32b857a8250b424848792a53930d0ca85bea8b368e41341b896db23f823f6e3","observation_id":"e9a4194e-ccde-4b59-b7a6-20b105456862","resolution":{"observed_at":"2026-08-11T19:22:57.004154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.979519Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"af72d000-0c66-4412-925c-4dda356e0c27","year":2016},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.265281Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:41ee67455397af0f3b24cacb8329debec5e644d56118a6540c909129d6018cc7","observation_id":"2c298753-c6e2-42fc-aa86-fc2884543f2c","resolution":{"observed_at":"2026-08-11T19:22:56.985685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.960108Z","title":"Ok-vqa: A visual question answering 10 benchmark requiring external knowledge","venue":null,"work_id":"70ae8d36-ab96-47bb-9997-d2e7910bd056","year":2019},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.273236Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:87b3861397c4654edbe45080a0504ddbefadc16d6d4141ac979c560b8ce99a00","observation_id":"11192204-bfe0-41cd-99de-3e2e4013ef88","resolution":{"observed_at":"2026-08-11T19:22:56.966163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.942286Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":"670698ec-0fec-4f3d-9ee7-cd9bda1d1eb8","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.282252Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:78174921cc4025dda1c74e76e6d9f40b30c7729289f6b42ded5447cbd5b40138","observation_id":"343df608-9cd4-4d54-8b63-dabefd91fb01","resolution":{"observed_at":"2026-08-11T19:22:56.947678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.288368Z","title":"Null-text inversion for editing real im- ages using guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.288368Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:9ab4d104590cb1cf168ecc8e6b676c1ccfb2c6127acc2e0cb26a76507c3cdb6f","observation_id":"7e9a96d0-4db1-4a8f-85d1-d0e9c6846b71","resolution":{"observed_at":"2026-08-11T19:22:55.288368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.911479Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":"ba7a46cf-c739-40f8-982f-bebe34641016","year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.297128Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:a9e44ee9a1a2754a29676a522dff0a224b01c46c2902f5413c801053dc195f83","observation_id":"25210b1e-3cda-4333-a301-8ae368bff820","resolution":{"observed_at":"2026-08-11T19:22:56.917686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T19:22:55.305714Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.305714Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:8027b445c949d976de738f94e3550bf7a085b6d0ea6a07e79603e2a5c9cc267e","observation_id":"c3683f6d-6730-4d9f-b0d9-bcad9a0e70ad","resolution":{"observed_at":"2026-08-11T19:22:55.305714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.314781Z","title":"Styleclip: Text-driven manipulation of stylegan imagery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.314781Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:c92bcd5d6349b1aacd36d8fc9c9bdd28eb248beca9c60cfc23d8af729cf8a136","observation_id":"780337ba-4573-47fb-973f-c07c08df00a6","resolution":{"observed_at":"2026-08-11T19:22:55.314781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.877188Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"cb43328b-29d2-42d7-8be4-01fe57ffddb7","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.329481Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:f7db59c98dc47ed4eec7e8d9ebe1b7e90134e2943fcdb44ee4e9a305d7a6209b","observation_id":"6972a36d-6ad5-4e07-979e-bd5d9eae5668","resolution":{"observed_at":"2026-08-11T19:22:56.883818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.857387Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"da8ff107-7e1e-4bad-a99f-34c6badbb1d5","year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.346679Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:2a8acae1cec60ebf7ef8015d975280139442a7e594fa4d87cc1d63874b826e6a","observation_id":"3526c95c-494c-45a0-9b7d-392445279843","resolution":{"observed_at":"2026-08-11T19:22:56.863188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.833701Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"8484ad49-0568-4254-9720-c5de280f226e","year":2020},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.352693Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:0b5b8d099cf9ca9eb0b5354dca14e45d27d7feba38bc9afe08927ede1188f915","observation_id":"07ccb4c7-7fe7-4226-9664-470eb4c50e37","resolution":{"observed_at":"2026-08-11T19:22:56.839149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T19:22:55.360946Z","title":"Hierarchical text-conditional image gen- eration with clip latents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.360946Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:ce36130a8d6ba07af17a02cb518e2293d38bf1cb02a8a0507ad5dd69a377b720","observation_id":"97de4469-4aca-463b-ac3c-1f848dbc3502","resolution":{"observed_at":"2026-08-11T19:22:55.360946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.812524Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"14df24fd-9785-402f-be51-b942d5ca273f","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.367294Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:01f5e36db1b4b7ad74ad63d123861964a8d988250e95a18be6cc5b0cce44267e","observation_id":"08351e34-873d-4549-b142-3807ea059427","resolution":{"observed_at":"2026-08-11T19:22:56.819093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.789799Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"edf4b794-1afe-46ac-8de2-d2a7ba960a97","year":2015},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.375945Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:1f46f54a854ee1970e839b37bc9ecab99194e4244289c12e211db79f84280ccf","observation_id":"1741204b-4a84-47fc-8dc5-cca29e09855f","resolution":{"observed_at":"2026-08-11T19:22:56.799309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.766282Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"df0996ba-aab0-4da4-812d-096d7f32237e","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.383169Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:bad8dc7092dde46aac333aa6c9fc267494e40dda6cc76edc69165a8250c5f6a5","observation_id":"e9180746-7448-4671-93cd-2e7235e8e822","resolution":{"observed_at":"2026-08-11T19:22:56.772700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.745038Z","title":"Hyperdreambooth: Hypernetworks for fast personalization of text-to-image models","venue":null,"work_id":"e6018bc0-a7d4-44a8-9cf4-421bf99a071a","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.390493Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:1ce1069ab7a6330d7610e9ed759a62e9082358297996f94be03088d112681a12","observation_id":"726ffdd5-ad93-4285-875c-1b79fdb9ee05","resolution":{"observed_at":"2026-08-11T19:22:56.751649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.724462Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"471b025d-0bea-49ef-869e-12c70ea1ad90","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.398079Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:b35cc00a5977440540fc60448291d4f3909c87db7ab5575fe28054df48356441","observation_id":"b21586a3-038e-4654-ad79-7db984e8432f","resolution":{"observed_at":"2026-08-11T19:22:56.730199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.705996Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":"0168036e-8b1b-4fa7-9ee5-fd5da65f8fa5","year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.405021Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:248d45709d8f114190c1eaa2527c9365dee53e21b6659117b644131a46edad1f","observation_id":"9cb61f0b-e9c7-4677-80ee-4c886789ddef","resolution":{"observed_at":"2026-08-11T19:22:56.711979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-13T18:41:35.355818Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-11T19:22:55.415902Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.415902Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:7d84614b6b1d2130ded546b6fbcd79108573f932c7fb21d19cc1f71d267524d0","observation_id":"e1062836-6fdf-430a-b5fe-b1e2ceafd75c","resolution":{"observed_at":"2026-08-11T19:22:55.415902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.683227Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":"88134d94-3fc9-4130-a264-98c6ff422aef","year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.423417Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:89640017a59ead0d8a78cb0c36811246503babd1b429779892a151a43aeab603","observation_id":"dbb4e182-7d1f-47d6-aba4-56cd33b86dd6","resolution":{"observed_at":"2026-08-11T19:22:56.690894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.432155Z","title":"Textcaps: a dataset for image caption- ing with reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.432155Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:ae0f2560aefab84a96f8f7f2a4d5e0a1570dc62f37a5866353291d1e5416bb09","observation_id":"98c570c5-8c58-4703-9090-7ceb5fd670a4","resolution":{"observed_at":"2026-08-11T19:22:55.432155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.442633Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.442633Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:f7623e41ffae91c1237b4bcec1bdf2db2ae170cda13c4302a69d00dc863b3016","observation_id":"6a0cd468-0675-418e-adb7-e63546c0b297","resolution":{"observed_at":"2026-08-11T19:22:55.442633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.631774Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"cec5a590-d7d1-4ffc-a8a0-9c1b554119c0","year":2015},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.455532Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:4bc59414794b36bf208dbe8f3d67f71671efe5f8ec3b0a907c0a7f8765fa79b0","observation_id":"40168739-51f3-494d-82b2-52916c5d5d37","resolution":{"observed_at":"2026-08-11T19:22:56.638259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.610772Z","title":"Generative modeling by esti- mating gradients of the data distribution","venue":null,"work_id":"8aae07dc-f520-447d-ba88-70a17c55ee14","year":2019},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.465049Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:63835507402a074dd73f484ac6fdd94cc36ea66dee005564d450df04a62a139a","observation_id":"9d5d67f3-4ce2-4d40-8d65-5b72cb5ddac6","resolution":{"observed_at":"2026-08-11T19:22:56.617318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.471866Z","title":"Rethinking the inception archi- tecture for computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.471866Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:8ab01e5f25db009e8510fab2624887877347b96721f5b3286b506ab57da5e2fd","observation_id":"c0291128-0b6e-4d13-b777-f912c63b328c","resolution":{"observed_at":"2026-08-11T19:22:55.471866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T19:22:55.481135Z","title":"Gemma: Open models based on gemini research and tech- nology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.481135Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:d556e5f56210fb7524c741c6dc16f96b316c52834211e5d2991d4be82ddc8215","observation_id":"92366efc-2d27-4d38-a7f1-4ad0d2a9d062","resolution":{"observed_at":"2026-08-11T19:22:55.481135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12522","last_updated":"2022-10-10T10:39:10Z","snapshot_observed_at":"2026-08-13T15:37:33.180267Z","submitted_at":"2022-05-25T06:30:19Z","title":"Crossmodal-3600: A Massively Multilingual Multimodal Evaluation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12522","snapshot_observed_at":"2026-08-11T19:22:55.487818Z","title":"Crossmodal-3600: A massively multilingual multi- modal evaluation dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.487818Z"},"links":{"cited_paper":"/paper/2205.12522","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:c2b88526839842ab1c4b865e48ce86a881e9a3c9020e5dd194adfc1a3376febd","observation_id":"72cfda0f-2a18-454e-90c0-ee95e2dbf7d5","resolution":{"observed_at":"2026-08-11T19:22:55.487818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.571885Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"8c7977fe-82b8-4f70-9c75-ed49d112454e","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.493448Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:c6bb4ebca05a06087cb8eedfa01003412910354ab36dcb7dcec3740d9f2cf64e","observation_id":"b6ef4604-a898-4f20-9585-20a277c9e7ea","resolution":{"observed_at":"2026-08-11T19:22:56.579690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.549391Z","title":"Con- trastive multiview coding","venue":null,"work_id":"fef7c1f2-62d1-4e62-8040-9a1bf3cac0ad","year":2020},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.498748Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:eae8ef1bda26f61b05b66b2e8db9f48e43b9dbda2191d9029a4377eb2ec0407f","observation_id":"3617e7a4-14ec-4c25-9ab0-df3055614c94","resolution":{"observed_at":"2026-08-11T19:22:56.554902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.529431Z","title":"Extracting and composing robust features with denoising autoencoders","venue":null,"work_id":"cd5b6da9-7d38-42ed-9871-3de91680b1e0","year":2008},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.506084Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:4cfb91958148c2e867bd8ef187178508e35542938ce87c1edc3035680a712cb1","observation_id":"787f805e-c67a-4a2f-b217-0d5cea682b99","resolution":{"observed_at":"2026-08-11T19:22:56.535837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20171","last_updated":"2024-08-24T03:55:36Z","snapshot_observed_at":"2026-08-12T23:12:40.280328Z","submitted_at":"2024-07-29T17:00:09Z","title":"Diffusion Feedback Helps CLIP See Better","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20171","snapshot_observed_at":"2026-08-11T19:22:55.515775Z","title":"Diffusion feedback helps clip see better","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.515775Z"},"links":{"cited_paper":"/paper/2407.20171","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:99d90aabe16161edced92df5e49e644e657e42e3fca8d8c8318b58c41ffc4cd1","observation_id":"bed01bb0-dc17-4af1-a093-924f36bfa87c","resolution":{"observed_at":"2026-08-11T19:22:55.515775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.498657Z","title":"Unsupervised feature learning by cross-level instance-group discrimina- tion","venue":null,"work_id":"62ef40bb-8a62-46cf-921a-a39681dbf069","year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.525424Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:459a9bdd219cce2106d8b3b02b778a5bae9c35171fb13b1d353f2beb3b2cf75b","observation_id":"7ca3aeca-eb7a-4e63-b017-670a2fa7dc70","resolution":{"observed_at":"2026-08-11T19:22:56.508284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.470478Z","title":"De-diffusion makes text a strong cross- modal interface","venue":null,"work_id":"0c1d6524-6335-4d4e-a713-87c665ba4c01","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.535074Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:c8c1b8da33264168ea8eeb55d3431fbac7a5bd8ab550b435b458cac4cbfbc627","observation_id":"cefa8917-1ddc-48fc-8ebb-d62875f10f97","resolution":{"observed_at":"2026-08-11T19:22:56.477684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.441221Z","title":"Unsupervised feature learning via non-parametric instance discrimination","venue":null,"work_id":"c38535f0-861a-4c08-88b1-d698d9959d89","year":2018},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.544008Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:70d2a346f1d73d895c385e009e8839bffce7f0338eda1119b8360697d7927e30","observation_id":"d6b9ab6d-99e3-45f6-abac-85d7c6cd926e","resolution":{"observed_at":"2026-08-11T19:22:56.450250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.421604Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"61424f5f-bad8-49c4-b0a7-4e5d37e31aea","year":2016},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.553657Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:23c1798910d62d0fd88ffb2a45419387aa1d788e5190448ff63842db1c642113","observation_id":"ea83b458-1ff4-4fb3-aa0f-d4a9ebc34188","resolution":{"observed_at":"2026-08-11T19:22:56.427896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.392726Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"9a3ce0e8-4de7-4c9e-acea-a75e66bd9b53","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.559898Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:6fcb5b4028d61c07a30e24999dfcc6bcdab43c7ed7dff99b51bca4dd4cd4c094","observation_id":"c8af8a4d-ca0b-4740-8d1b-0dc86c4cc6d6","resolution":{"observed_at":"2026-08-11T19:22:56.401306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.362002Z","title":"Diffusion model as repre- sentation learner","venue":null,"work_id":"6dad00bf-f3ac-4e05-af0c-afebb8fb3d38","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.569386Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:232295e08038cf84f0c3cc2ab201bbbcbdb6deba460c0389e8f344046bea5ca3","observation_id":"13b41e26-cd54-491f-a928-9d7d24d32d7a","resolution":{"observed_at":"2026-08-11T19:22:56.371408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.336599Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":"2ee7afa2-fb2c-460e-9975-5a57b6003033","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.579225Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:6eb1308d4bd8a2f0aaaf5789f73cff19df2e8632905ee2d329cf6a3ccba0d25b","observation_id":"8ef7244e-c05c-46dc-8b6c-94b0e5886f8e","resolution":{"observed_at":"2026-08-11T19:22:56.343354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.314350Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":"3d4b54ae-783a-4267-8b65-9e8a5c880f28","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.592159Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:ee1bf2efa2683e47ea18d81d890272c1fcf270eaa488dd6f008ae05cb6e68cbc","observation_id":"cfc5324d-733c-4bbe-9044-d46b3037695a","resolution":{"observed_at":"2026-08-11T19:22:56.320682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.290828Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"8d401c93-e2ce-49d7-8f12-45b9291016cc","year":2016},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.598680Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:b407155942de4b0724d5bff3c0917ac861b3fc8a622ac1cfa498b3bbf76e9aea","observation_id":"17770810-7065-4cf0-9f7f-97014c3b3370","resolution":{"observed_at":"2026-08-11T19:22:56.298202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.265291Z","title":"Spae: Semantic pyramid autoencoder for multimodal generation with frozen llms","venue":null,"work_id":"d9f9dea7-ccf9-4942-a13c-f892fb29b277","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.605122Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:ce6c62b5ff1b03025c6c48205d4e1fc45961a3981df85f71c600cde3dcc3b2ac","observation_id":"cf55616b-e5eb-4651-afb4-d0794ba586d7","resolution":{"observed_at":"2026-08-11T19:22:56.273396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.612012Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.612012Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:3ea45da9ba17287c5ae6317f097a5c098a47f5a50363a1892a3628eebed4d3a7","observation_id":"e45783fa-396d-4806-9a3c-bc9e234330df","resolution":{"observed_at":"2026-08-11T19:22:55.612012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.225868Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":"2c766f95-304c-4dd6-a614-b2a8e30d00a1","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.618321Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:527c90dbb2931c09e3ec0a2ce9e6662de06e457beec3012dc8ece399a16038f2","observation_id":"fbda5d99-2584-4952-9df4-2b260fc56b0d","resolution":{"observed_at":"2026-08-11T19:22:56.232376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.200607Z","title":"Soundstream: An end- to-end neural audio codec","venue":null,"work_id":"bd1b56f5-4f74-44df-a507-ba20c7c7c1d0","year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.624640Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:12e06f7a3b356ab112ff067933eef01d9c4a24f356163ff4f3f88098a2c79348","observation_id":"9cfe70ec-22c6-428e-8c94-9b9fd7270e0a","resolution":{"observed_at":"2026-08-11T19:22:56.207434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.174405Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"1c04ccbf-1773-4dc1-b86e-3e27eddbd4f3","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.629661Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:2c1bf32245589db5d88c5cf0c66c243439334f1dc7a39ca157d488391fdf767e","observation_id":"69467f88-3b85-4b8c-ba8d-eb8f8942aaf0","resolution":{"observed_at":"2026-08-11T19:22:56.185620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07548","last_updated":"2024-06-11T17:59:53Z","snapshot_observed_at":"2026-08-14T02:44:15.496372Z","submitted_at":"2024-06-11T17:59:53Z","title":"Image and Video Tokenization with Binary Spherical Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07548","snapshot_observed_at":"2026-08-11T19:22:55.635316Z","title":"Method A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.635316Z"},"links":{"cited_paper":"/paper/2406.07548","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:77fa9204fcf0c353a82349583caea79f2c118fa50939ceefd347db88b3675562","observation_id":"2e2c4c98-8c3b-434a-857d-ddd25aef3edd","resolution":{"observed_at":"2026-08-11T19:22:55.635316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T02:45:16.393076Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":47},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 1 inbound Pith citation observation for arXiv:2412.06774."}