{"as_of":"2026-08-09T17:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:deeb60e621e5ce4f64b00d194b9362029652451ab7003bac9dfb87b5ab02e7ac","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:17:14.935499Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00754/citation-record","integrity":"/paper/2507.00754/integrity","json":"/paper/2507.00754/citation-record.json","paper":"/paper/2507.00754"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:24.054748Z","title":"Language models are few-shot learners","venue":null,"work_id":"c8093092-8caf-4efb-b6a2-0cc4d24ad587","year":1901},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:06.174747Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:ab2bf9b8be15ad4f1596c4ee7eec583bd54a19be90439ea722176f21c3ffacd4","observation_id":"cf57972b-3253-4d67-8cc2-8dbcf447dd24","resolution":{"observed_at":"2026-08-06T21:17:24.184422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:22.874755Z","title":"In these works, they provided litmus tests for measuring how focused the attention patterns of particular models are and how they relate to model robustness","venue":null,"work_id":"eb60e52d-5049-45ed-b0a5-947d761986c4","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.783929Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:ee8cb47825c872911120e57c49c0922d01796ee007fe9882593727febb374fb1","observation_id":"0d832a76-bf8a-4879-b8af-89e85431c105","resolution":{"observed_at":"2026-08-06T21:17:22.984748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:20.764752Z","title":"the standard deviation of the accuracy values divided by the number of different seeds","venue":null,"work_id":"e7cb74b6-d451-4011-a739-1958179abe3e","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.633122Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:5128816c59713390ae868ecc04d6056f28d328a454fc484601bf70d8b367f5cd","observation_id":"80bb878e-7eab-488d-bf54-fac98f9d577b","resolution":{"observed_at":"2026-08-06T21:17:20.966369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12973","last_updated":"2024-05-06T15:45:30Z","snapshot_observed_at":"2026-08-07T22:14:28.327485Z","submitted_at":"2023-10-19T17:59:05Z","title":"Frozen Transformers in Language Models Are Effective Visual Encoder Layers","version":2},"cited_work":{"arxiv_id":"2310.12973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.12973","snapshot_observed_at":"2026-08-06T21:17:16.309288Z","title":"Frozen Transformers in Language Models Are Effective Visual Encoder Layers","venue":"cs.CV","work_id":"9a576f92-0710-488a-98ea-0ff7654f1982","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:06.952393Z"},"links":{"cited_paper":"/paper/2310.12973","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:6eb9b725d57b009361bfe9e24150b4929b73033e980a53dec79bdf8a2b679233","observation_id":"7df17b61-bd53-4908-bfe4-0825ff4c8666","resolution":{"observed_at":"2026-08-06T21:17:16.472633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T21:17:07.140211Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:07.140211Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:23ad9600776e7fd905f91f540c6797aa1507510631fb35f00745c2078c726af9","observation_id":"8067ec4b-4bd5-4eab-8942-b273bfb5247d","resolution":{"observed_at":"2026-08-06T21:17:07.140211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08202","last_updated":"2025-03-13T06:09:17Z","snapshot_observed_at":"2026-08-09T05:13:18.023230Z","submitted_at":"2024-10-10T17:59:22Z","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08202","snapshot_observed_at":"2026-08-06T21:17:08.054862Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.054862Z"},"links":{"cited_paper":"/paper/2410.08202","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:fb3dfccdcc5dbec268a49095bf3658a194e76a60829dd05d68b3e9ff63d6c406","observation_id":"f0432910-0c1c-432f-b169-d2edd481baa3","resolution":{"observed_at":"2026-08-06T21:17:08.054862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T21:17:08.132343Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.132343Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:af99a16d43311261ee1cbb6408251d8061d1ee18139669baea4171b465a0dd1a","observation_id":"a6a28afd-2ec9-47d8-a024-7db7890eb3fc","resolution":{"observed_at":"2026-08-06T21:17:08.132343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:08.286198Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.286198Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:9e07e46f76308700ddff6a08b4ae1dcea66bc8278f1551c53e84db6df643051d","observation_id":"f5907d37-48d9-4cc7-9e57-bc8d05756ac8","resolution":{"observed_at":"2026-08-06T21:17:08.286198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:08.730823Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.730823Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:e369fdf699dc87a9cfda875051aaf3402c490815aa090fb6f4422e070befeea6","observation_id":"b3724c4e-8c25-47a4-8b1f-0025c935b7d9","resolution":{"observed_at":"2026-08-06T21:17:08.730823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16545","last_updated":"2025-06-25T02:28:36Z","snapshot_observed_at":"2026-07-06T20:11:24.538172Z","submitted_at":"2024-12-21T09:04:51Z","title":"Attention Entropy is a Key Factor: An Analysis of Parallel Context Encoding with Full-attention-based Pre-trained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16545","snapshot_observed_at":"2026-08-06T21:17:08.954914Z","title":"Attention entropy is a key factor: An analysis of parallel context encoding with full-attention-based pre-trained language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.954914Z"},"links":{"cited_paper":"/paper/2412.16545","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:7fae8c20698835aa73ebe19a645bbb590c08cfa0691cb43a35dfe46f869ff583","observation_id":"dbb7affd-7b08-4c85-9bcd-6eb3e47e0215","resolution":{"observed_at":"2026-08-06T21:17:08.954914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08203","last_updated":"2023-05-11T21:36:07Z","snapshot_observed_at":"2026-08-05T15:38:15.380186Z","submitted_at":"2021-09-16T20:10:12Z","title":"Torch.manual_seed(3407) is all you need: On the influence of random seeds in deep learning architectures for computer vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08203","snapshot_observed_at":"2026-08-06T21:17:09.069919Z","title":"Stabilizing transformer training by preventing attention entropy collapse","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.069919Z"},"links":{"cited_paper":"/paper/2109.08203","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:f102686c389645c7bd2098c85c71b138488b495f257d88c09aef5f1bc3b29176","observation_id":"54bfea88-6ae9-486d-80d8-fe4d093f67bc","resolution":{"observed_at":"2026-08-06T21:17:09.069919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07384","last_updated":"2020-02-24T10:47:39Z","snapshot_observed_at":"2026-08-08T09:21:58.309770Z","submitted_at":"2020-01-21T08:33:29Z","title":"Understanding Why Neural Networks Generalize Well Through GSNR of Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.07384","snapshot_observed_at":"2026-08-06T21:17:09.234749Z","title":"Understanding why neural networks generalize well through gsnr of parameters","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.234749Z"},"links":{"cited_paper":"/paper/2001.07384","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:ef5283fcc958c94068ad049e3fb0a0d31fe56556e4ad5fbe94a7a505bc9f925a","observation_id":"6a846dd8-e028-4ee5-ad8d-aa0c10fafebe","resolution":{"observed_at":"2026-08-06T21:17:09.234749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T21:17:09.364748Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.364748Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:ed40c7c26220b4467ce094d17d5baca3ab8f0af99f8b1006a9a2fc0471e4d2b7","observation_id":"a964eac8-6510-4018-b4b1-d0208ec5c971","resolution":{"observed_at":"2026-08-06T21:17:09.364748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-08T01:21:54.937517Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-06T21:17:09.614748Z","title":"A single transformer for scalable vision- language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.614748Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:3fc3d16cfd61b933021165d2097e9620cc2dcc350e2e2f972478c59a5796dabb","observation_id":"c1b79421-ce28-4c47-b15b-bc68e211d958","resolution":{"observed_at":"2026-08-06T21:17:09.614748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T21:17:09.764750Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.764750Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:8e5d5296fc80ddc16af7a62bb3ab42b8850e1d86646c8bdb039b133108c33534","observation_id":"7eb34fdb-15b0-4387-afd5-973902d3b467","resolution":{"observed_at":"2026-08-06T21:17:09.764750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T21:17:10.275076Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.275076Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:329cd3294e568ad32c73323bf5974494de738f1d915b0630a819206ef0f12fdd","observation_id":"36fc9a21-bae4-4c9b-82ca-5261a805f6d7","resolution":{"observed_at":"2026-08-06T21:17:10.275076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-06T21:17:10.544749Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.544749Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:b60be3505c65d611f8ded8e03f04c0daba0f421587c0e8f22df97da49b75371c","observation_id":"b9ac64ec-a47d-4723-b68d-338970fc7d57","resolution":{"observed_at":"2026-08-06T21:17:10.544749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:23.394825Z","title":"Deep networks with stochastic depth","venue":null,"work_id":"a11c18e0-32bf-4a57-9b0d-9a28ef4be282","year":2016},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.764825Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:56fd04bd8120efb71ca8352eeec26a5d8d34b4da9f4ecf907f92283e78230e2c","observation_id":"330ec6c4-24c3-4029-9c70-faf41c147242","resolution":{"observed_at":"2026-08-06T21:17:23.564748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-06T21:17:10.884728Z","title":"mixup: Beyond empirical risk minimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.884728Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:c5d1f488122a948bf5a00c5f282badfbca94abe285c3e276aee9e6bb516c6825","observation_id":"dde40791-2763-47ba-85c7-68ab4f603424","resolution":{"observed_at":"2026-08-06T21:17:10.884728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-06T21:17:11.024571Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.024571Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:6117fb84a585b9208d63941b3a491c202bf024779bb6e6f2adb73834c8db25e5","observation_id":"e882166e-8e34-4822-a2a3-3639df5af93f","resolution":{"observed_at":"2026-08-06T21:17:11.024571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-03T13:01:27.142233Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-06T21:17:11.224870Z","title":"Mmdetection: Open mmlab detection toolbox and benchmark","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.224870Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:043da966b13b2038879a38e6f48f5f334a2b66cdb9c62e5085df80676bcd0bcb","observation_id":"3551f281-1f14-42b8-9919-51b480181047","resolution":{"observed_at":"2026-08-06T21:17:11.224870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09700","last_updated":"2019-11-04T20:37:33Z","snapshot_observed_at":"2026-07-06T08:31:12.309726Z","submitted_at":"2019-10-21T23:57:32Z","title":"Quantifying the Carbon Emissions of Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09700","snapshot_observed_at":"2026-08-06T21:17:11.392668Z","title":"Quantifying the carbon emissions of machine learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.392668Z"},"links":{"cited_paper":"/paper/1910.09700","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:d44ec25e693575dc0e2df315c3b66e7c8f35fa150ed88df0bc2122ccb5e1f574","observation_id":"ea12eca6-b266-45dc-be83-1cae9595b108","resolution":{"observed_at":"2026-08-06T21:17:11.392668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:23.100462Z","title":"Attention Entropies","venue":null,"work_id":"3523c768-8cc2-4cee-a8c4-629a503c1622","year":2020},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.624886Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:093c3b9797b67e460eec77a72867b186148947f27c451f3fb07909147e1688ad","observation_id":"fa83d959-90c6-4d5a-91d8-f7ecd2af6b26","resolution":{"observed_at":"2026-08-06T21:17:23.194826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:22.536783Z","title":null,"venue":null,"work_id":"e2af9871-0d83-4cb1-a7db-fe6bf993e219","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.899321Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:6b3201833724b0c8790c219b4f82dd77b95c148f092d433efe8ce8fa07d10427","observation_id":"fb0eeb87-84ec-4df2-8f9f-f3d8bb842029","resolution":{"observed_at":"2026-08-06T21:17:22.707460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:22.170929Z","title":null,"venue":null,"work_id":"49ddad33-435d-4778-bf57-160eaea2b7c3","year":2022},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.054837Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:18eaad811cd64ffb178258e803ddcc9f79bd0f1c37985c82b9d4d361cf1932bb","observation_id":"b46e9033-6c7b-4434-83ac-9d401faf3c38","resolution":{"observed_at":"2026-08-06T21:17:22.273985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:21.904787Z","title":"Finally, we highlight the high quality of the attention maps of LUViT in the Imagenet-Segmentation dataset [Gao et al., 2022] in Section B.3","venue":null,"work_id":"30e888c7-29ad-4063-8be8-64b97a840591","year":2022},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.195882Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:b724224fb5c0f43615c8ce4ea5c1f851a429f34646d6a22c5174cf73bdcd95e0","observation_id":"23b300f3-d459-43fd-81fd-970983943bcc","resolution":{"observed_at":"2026-08-06T21:17:21.994766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:21.634745Z","title":"The results of both our reproduction of Pang et al","venue":null,"work_id":"62e4e235-595f-4b9b-8ded-e758eafc5856","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.304770Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:148eadbaee9ba0d06824c968010e15e077f34c096b40a4bcde890fffed8ce19e","observation_id":"308f5b8b-7143-4025-8fdd-d4e5232c97ad","resolution":{"observed_at":"2026-08-06T21:17:21.721932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:21.184754Z","title":null,"venue":null,"work_id":"1d897f21-6519-4566-b0ef-06878ac72de1","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.514747Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:69b0836a9858ccf9be4dc2793b16225d343d878e2394ed21b0c8a3d068032432","observation_id":"2c539026-45a4-408b-8d8f-6f6784ee44f9","resolution":{"observed_at":"2026-08-06T21:17:21.364775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:20.404749Z","title":"Each reported value is an average of three training runs with three seeds, (0, 1, 2), and the subscript ± denotes the standard error for each setting","venue":null,"work_id":"c3409d72-ce98-42bb-8f31-30230efced89","year":2022},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.805484Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:ef7635a7557629713ab3279f2290df2121d4292e9246035b3dbfd22644cdc0a6","observation_id":"5dc585a5-23fb-4816-8628-515f380fa421","resolution":{"observed_at":"2026-08-06T21:17:20.534750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:20.144752Z","title":"A cell in the downsampled mask is assigned a value of 1 if it overlaps with the original high-resolution mask","venue":null,"work_id":"adbfeded-f1f1-4b49-807e-0e6d0228eedc","year":2022},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.974750Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:453b23699cd72d0b1a32e6d3e897ec0ba8f2695fcf0f8f2952c48ba1b12ff264","observation_id":"e26f0bfe-e2bf-4b04-861c-9b75690a5919","resolution":{"observed_at":"2026-08-06T21:17:20.254747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:19.725234Z","title":null,"venue":null,"work_id":"225e843c-bfb4-4cb9-a985-01ed12e338e7","year":2021},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:13.145214Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:680b9523df8c4cbdbc7d077a1c1063a9ac0ea48518124e38ce2e1ddf55835a4c","observation_id":"839f31c0-7bc6-4924-8a4c-354758aaeef4","resolution":{"observed_at":"2026-08-06T21:17:19.894763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:19.404751Z","title":"While LUViT differs from Pang et al","venue":null,"work_id":"a8dcf170-c35e-4950-877f-e676d672197a","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:13.371752Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:fdd2fea6e9a3edbbac641f79d465f45fc50e56fcc1d48ddcd5c4e9e6f095d453","observation_id":"c1b92f23-9be1-49a0-89cd-15577e5ca49c","resolution":{"observed_at":"2026-08-06T21:17:19.505420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:19.076857Z","title":"The authors quantified this alignment through demonstrating improved gradient-signal-to-noise ratio (GSNR) under the presence of the LLM block","venue":null,"work_id":"7f2fa0bb-f153-4dbd-a078-3b9ec83d5ac9","year":2020},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:13.524735Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:003fff9a2c977332ecb561c34068af92126bf98f9945b91d1e98b5a5740a2703","observation_id":"da3ffe0c-fa7e-4a2a-9b93-62a4ef5b3ec6","resolution":{"observed_at":"2026-08-06T21:17:19.186193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:18.869230Z","title":"Following up from this observation and taking inspirations from Tiwari and Shenoy [2023], Bai et al","venue":null,"work_id":"a6b43883-6b45-4a98-b256-358193e9984a","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:13.682924Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:47d84b23cd55e3e2a8d7f46bb229a925db2c26975a0aeb900c0595f4e9bc03ea","observation_id":"5de44f84-dac2-4840-ac07-61247b0d0f55","resolution":{"observed_at":"2026-08-06T21:17:18.974743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:18.624747Z","title":"This auxiliary training objective distills the representations of the frozen-LLM-appended ViT to a vanilla ViT through a similarity loss in-between [Hinton et al., 2015]","venue":null,"work_id":"9142f7bd-898a-4bae-a0c8-88317ff9fe7e","year":2015},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:13.865294Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:95c443a70ff3dec06651d1f94194c3b617ec343e47026d5ab221d9064309c139","observation_id":"b93c1078-e07f-4bf8-b17e-4ba73ffc0095","resolution":{"observed_at":"2026-08-06T21:17:18.727982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:17.871308Z","title":null,"venue":null,"work_id":"04f98c72-4223-4070-83aa-e0c243ce4fc1","year":2017},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.464832Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:2e589337fd9b3f76f3fb3ba2d332c63297e4469db15ce58c3294a3fa9b42d867","observation_id":"d454685a-4cad-4bbe-8758-f8265300bd6a","resolution":{"observed_at":"2026-08-06T21:17:17.959249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:17.286321Z","title":"Notably, we utilize average pooling setting instead of relying on the [CLS] token for performing classification","venue":null,"work_id":"7608b501-5464-448b-a8ea-3dd4e026751f","year":2020},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.713999Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:000b15c1fb8880c3151b85436eacec15e1cd890404c8a2e186440c61a8062a56","observation_id":"9fdb8a9a-67fb-40f9-a4c6-fe9a7102f9ac","resolution":{"observed_at":"2026-08-06T21:17:17.384759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:16.968226Z","title":null,"venue":null,"work_id":"14220f68-b230-4181-8575-30a39bfc0bc4","year":2017},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.794778Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:c402650382afd2b5df4c25e10f0945cc070521cdd4143029564a9ad71c938ee2","observation_id":"698b20cc-0325-4398-a81c-e2335a8c7cb1","resolution":{"observed_at":"2026-08-06T21:17:17.103304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:16.715079Z","title":"renditions","venue":null,"work_id":"43bd14aa-6196-4e7b-8f20-9fade1e273fe","year":2019},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.935499Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:5a69acf5cbb9e7c4081fc0e12f9ffaddf9067787abd8da2e5e35f201b6990174","observation_id":"fc64965e-b720-4e62-8ec6-4f0240a71397","resolution":{"observed_at":"2026-08-06T21:17:16.834523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:17.602841Z","title":"Finally, the additional capacity baselines in Section 4 all have additional linear projection layers at the head, analogously with where they are placed in LUViT","venue":null,"work_id":"388a9ca9-dc81-466d-8b92-fd833c08c044","year":2022},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.573708Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:78e7bc80dae51e78f283c7d231a1fde2766be3385497a1b6ad547bc787635730","observation_id":"e6e964db-c461-44ad-aad6-b0501c535c97","resolution":{"observed_at":"2026-08-06T21:17:17.747453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:18.338649Z","title":null,"venue":null,"work_id":"7400dec9-06d9-4d6a-b2ae-d74cd2b12d14","year":2017},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":768,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.072992Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:6c24ff09ac3b721ebb8e7d90eae0d92026da3fdb9ed55e9dc833e9a098f46485","observation_id":"7d8a0460-13f5-4f0f-ae51-22d3e18d2b07","resolution":{"observed_at":"2026-08-06T21:17:18.423887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-09T13:36:49.416146Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-06T21:17:08.425779Z","title":"Benchmarking neural network robustness to common corruptions and perturbations","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.425779Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:61231b7dab629842ecff69af6921236b71dc9664bce2d102f8714b6a482b64ea","observation_id":"75a915c7-eb95-4384-a911-b85a519eb630","resolution":{"observed_at":"2026-08-06T21:17:08.425779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-06T21:17:07.315858Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:07.315858Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:4a30b3c6d0ec992b4605dbecb889de17f81da8226a3d096ddf8c5d8ac74f201d","observation_id":"027f2cbc-e45a-4f23-a60b-184b396ade95","resolution":{"observed_at":"2026-08-06T21:17:07.315858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T21:17:10.424828Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.424828Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:327d7e0fbd37d90f0ae43bbc46234c60da927ad906f11230f90309ddb4c6c8b3","observation_id":"47bfb469-ff1f-4a19-829b-6e2b16311c60","resolution":{"observed_at":"2026-08-06T21:17:10.424828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-06T21:17:09.482217Z","title":"Evev2: Improved baselines for encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.482217Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:7d9e1bc51fe57dd230eceb5aeaf1ff9599ee57e41cd1ee12cdf66e28cb24a985","observation_id":"d54a2bed-4601-40be-852d-3d6a8fecd470","resolution":{"observed_at":"2026-08-06T21:17:09.482217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T21:17:09.984740Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.984740Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:9427c1582a07137ef00c774cb889b27b08dfcb85409869a9fe6eff17dc221942","observation_id":"ffa1e9e9-f158-4635-8296-6e50ca07ab6e","resolution":{"observed_at":"2026-08-06T21:17:09.984740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-06T21:17:10.104743Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.104743Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:89a8da9fa97bfc905a6d6f64781ece87dc7ae984ef3b8a16883a8d2dece063c8","observation_id":"5d8588d1-12b7-4214-92d8-2a3c65addc25","resolution":{"observed_at":"2026-08-06T21:17:10.104743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09994","last_updated":"2020-06-17T16:54:43Z","snapshot_observed_at":"2026-07-06T09:30:08.595544Z","submitted_at":"2020-06-17T16:54:43Z","title":"Noise or Signal: The Role of Image Backgrounds in Object Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09994","snapshot_observed_at":"2026-08-06T21:17:08.554972Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.554972Z"},"links":{"cited_paper":"/paper/2006.09994","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:2d6782ba0d9e1ce56ca450ee1a7bbc14477f2da296afe20a2d1b7a7a66074bd9","observation_id":"3bb7e0bc-074e-4c44-b5fc-3728678743ab","resolution":{"observed_at":"2026-08-06T21:17:08.554972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T21:17:06.272206Z","title":"Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:06.272206Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:349608adb7a0292ca9fbd383b6d99aa3588cb293a14b1cd6966b3d856fa84336","observation_id":"e2a04bf1-b2b9-4a7c-9aef-03e91098f537","resolution":{"observed_at":"2026-08-06T21:17:06.272206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-06T21:17:07.479266Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:07.479266Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:24e840610fe6e9b62562034106b67b3f50a1f3f37550f12fc64267f5792e1015","observation_id":"ebad85fb-f08e-4e2c-83cd-bf4aabd2f59e","resolution":{"observed_at":"2026-08-06T21:17:07.479266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T21:17:06.519528Z","title":"Siglip 2: 10 Multilingual vision-language encoders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:06.519528Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:dd251bd6fcf6b9e5bcb929de8dd1c2b3ae8d947c9523c4c0cf5be3d8f67deebd","observation_id":"8976a14b-d71a-4b71-a24b-64905332c8cf","resolution":{"observed_at":"2026-08-06T21:17:06.519528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T21:17:07.660329Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:07.660329Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:083e604ac2fb97bd530b54b5bc0a8f877b0e7e36707be7875a00d6aabffecc89","observation_id":"9c1ae321-34d2-4f7c-8dfb-f4ce852f1aee","resolution":{"observed_at":"2026-08-06T21:17:07.660329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20680","last_updated":"2025-03-26T16:15:42Z","snapshot_observed_at":"2026-08-08T13:06:07.318088Z","submitted_at":"2025-03-26T16:15:42Z","title":"Vision as LoRA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20680","snapshot_observed_at":"2026-08-06T21:17:07.858228Z","title":"Vision as lora","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:07.858228Z"},"links":{"cited_paper":"/paper/2503.20680","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:c240d9ece0a954314571cdc4d748a6dcc636358635ab7249e53e26e50644ecb5","observation_id":"2f706a71-111d-4a0b-8e01-496b98b0c5c7","resolution":{"observed_at":"2026-08-06T21:17:07.858228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T21:17:06.711803Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:06.711803Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:a14749dc684e3e71fd776f99d01584211683a2e465332232bd63fdf31798f950","observation_id":"ccd954c7-0920-4a4d-97e2-fd6224cf7758","resolution":{"observed_at":"2026-08-06T21:17:06.711803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:18.118459Z","title":null,"venue":null,"work_id":"16924835-ddc7-489b-907b-6032d8fd9301","year":2024},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":4096,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.265854Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:8b7e121a847995d9437f23d1ccf9b4390d5c601ac260a434958c8e84665d6cbe","observation_id":"6d3a361d-a3ff-45e4-8a4f-53d1e34cc2da","resolution":{"observed_at":"2026-08-06T21:17:18.206814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2507.00754."}