{"as_of":"2026-08-14T21:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4956d43e57b3d81763f410f49ff2220f2c7e2a46624dbef42298be0f63e377ab","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:35:51.006465Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T15:05:31.609683Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T03:37:35.644847Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.06895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06895","snapshot_observed_at":"2026-07-03T03:37:35.644847Z","title":"arXiv preprint arXiv:2508.06895 , year=","venue":null,"work_id":"96223ccf-3c63-41e7-9410-ff7137080259","year":null},"citing_paper":{"arxiv_id":"2606.09966","last_updated":"2026-06-08T16:29:59Z","snapshot_observed_at":"2026-08-08T03:15:29.403995Z","submitted_at":"2026-06-08T16:29:59Z","title":"RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-27T15:05:31.609683Z"},"links":{"cited_paper":"/paper/2508.06895","citing_paper":"/paper/2606.09966"},"observation_digest":"sha256:df85a8600d90db74605d850e57cb89625fbbddd1131ec05d29c1a7f902f6c309","observation_id":"7f1da0d9-bb6c-42ec-8773-cebbd1aa81f4","resolution":{"observed_at":"2026-07-03T03:37:35.646354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06895/citation-record","integrity":"/paper/2508.06895/integrity","json":"/paper/2508.06895/citation-record.json","paper":"/paper/2508.06895"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T22:35:49.341044Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:49.341044Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:9148d6bb00453b2d8bc6e6d652d20bef83ff539cc706a81fe1691f6f01c1fe19","observation_id":"c70655ab-56a5-4c64-bcc4-f669907cb552","resolution":{"observed_at":"2026-08-05T22:35:49.341044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:49.464613Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:49.464613Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:c80431c34eee28b16d941debb8dd0ff7ced5e30eade38910402ca5326b5f0dc8","observation_id":"8547c9d4-2611-4401-8dae-29d19e8c4628","resolution":{"observed_at":"2026-08-05T22:35:49.464613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T22:35:49.581640Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:49.581640Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:4de34b402b62346de8baa05ff88c905684c57dd8fd629bd90a994b8248de963b","observation_id":"5f44d82c-5bda-47ac-a98c-b965b523c10e","resolution":{"observed_at":"2026-08-05T22:35:49.581640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-13T16:48:25.566954Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-05T22:35:49.678589Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:49.678589Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:64476f7d8302b35e280fc83098726a7696177f72b1fcda64c0d3ee35bf58c85b","observation_id":"a14b0dbd-b9c8-40c4-a722-e6160cca53aa","resolution":{"observed_at":"2026-08-05T22:35:49.678589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:49.769760Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:49.769760Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:a9cee3744c0b589844ab0ff0d38cd05dff1cea747d7ef42bdf64fac2ecc632fa","observation_id":"ea69dbda-7193-4816-a5a4-94047e0dd567","resolution":{"observed_at":"2026-08-05T22:35:49.769760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08112","last_updated":"2025-11-11T01:13:28Z","snapshot_observed_at":"2026-08-14T11:50:41.917778Z","submitted_at":"2023-03-14T17:47:09Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08112","snapshot_observed_at":"2026-08-05T22:35:49.861020Z","title":"Eliciting latent predictions from transformers with the tuned lens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:49.861020Z"},"links":{"cited_paper":"/paper/2303.08112","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:51f064ee334320700f6dd50a314834e1c3c6414d27338cc04d83734a3d099e0b","observation_id":"286fbd26-d5d9-43fe-83b7-8e642984c910","resolution":{"observed_at":"2026-08-05T22:35:49.861020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14082","last_updated":"2024-08-23T23:02:28Z","snapshot_observed_at":"2026-07-06T18:03:38.397804Z","submitted_at":"2024-04-22T11:01:51Z","title":"Mechanistic Interpretability for AI Safety -- A Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14082","snapshot_observed_at":"2026-08-05T22:35:50.042218Z","title":"Mechanistic interpretability for ai safety–a review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.042218Z"},"links":{"cited_paper":"/paper/2404.14082","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:b68f811782a29e5c36209e4baee519e81dd04becc92177dfc13bac71ec3bc013","observation_id":"f00a6e90-2e19-4a0b-84b4-e36a274994d6","resolution":{"observed_at":"2026-08-05T22:35:50.042218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.294019Z","title":"Towards monose- manticity: Decomposing language models with dictionary learning","venue":null,"work_id":"7bf35e8a-ab06-417a-bf97-5614729f1f69","year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.170493Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:46d3479d0b21f55fec858a175998c1e6b6f3792c12635d0e867310859cf173ec","observation_id":"a42d0d58-e3d1-4327-8e32-c83934d265ab","resolution":{"observed_at":"2026-08-05T22:35:52.299573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-05T22:35:50.328264Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.328264Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:9d51c24114d7f5fc776115cac0d2831939f51d1ecaab11a6477198183e738c99","observation_id":"9ba8def6-8af5-4b2a-b405-02d9322b37a7","resolution":{"observed_at":"2026-08-05T22:35:50.328264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.279224Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"a274aa65-a88c-4520-9e1d-005210724df4","year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.507851Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:41c1cf90fbbd0960da879571ca89c9479687f3b3956aa887464ea7322e3ae525","observation_id":"59c4c893-d02d-49c6-8c54-8133b029d34a","resolution":{"observed_at":"2026-08-05T22:35:52.283743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.263120Z","title":"Sssd: Self-supervised self distillation","venue":null,"work_id":"cb20df28-d048-4ec1-b75e-7dcb03ebb451","year":null},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.668050Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:04f44b651284759bc24c78edc75c2e812d0b614a665e0e2a07e782b55f182397","observation_id":"4b911440-bcf0-4973-b37a-3b6aef5f396f","resolution":{"observed_at":"2026-08-05T22:35:52.268603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T22:35:50.687551Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.687551Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:118e16501ae6569927087ef664402b8441eb376315023c98bc0f099ff35074b9","observation_id":"ee4f9e61-2f6d-45bf-bad7-0e323b25dc70","resolution":{"observed_at":"2026-08-05T22:35:50.687551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.248056Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"46faacb2-88cd-49b5-87c0-e92ec4b6ac62","year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.692423Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:47e5403ea613348e5a57f8acd889ddb9a99d19b8cd21d5952d5597a08e5f8685","observation_id":"0cd7704f-30a8-40e3-acfb-6aec47ff4019","resolution":{"observed_at":"2026-08-05T22:35:52.252412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:50.697046Z","title":"On the efficacy of knowledge distillation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.697046Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:3018aec11f0d5bad639c697e09e209c83b3c72b5a75203e3f2f97c8713d5371a","observation_id":"8f132459-ad6d-407d-87dd-30b3199e6164","resolution":{"observed_at":"2026-08-05T22:35:50.697046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.223085Z","title":"Towards automated circuit discovery for mechanistic interpretability","venue":null,"work_id":"3e5b8796-6ad2-4101-b93b-e1e011b56019","year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.701230Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:b6dcc3c91e70b7aba68c95835d1c3a178a255e869938ea3781021a412331c73a","observation_id":"2d332bd6-792d-455c-ba7a-7026b82eb613","resolution":{"observed_at":"2026-08-05T22:35:52.228061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-08-11T07:21:14.568175Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-05T22:35:50.705188Z","title":"Sparse autoencoders find highly interpretable features in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.705188Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:6746355ad4768be44974018bfc9cf82c249997050f368cc8dfc4abb3f735c870","observation_id":"017ca2ca-ff9b-4ced-a391-915a93fb7aec","resolution":{"observed_at":"2026-08-05T22:35:50.705188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.207013Z","title":null,"venue":null,"work_id":"0e407ef8-d0f8-49e2-a31e-9a709c6b267a","year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.711332Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:ca62dd3f4430bb395fe8c6894ab415f32a426a41ca3273aa3f3c497fb2cffcd3","observation_id":"875f8441-66d2-404c-8e1c-74d7c8e58839","resolution":{"observed_at":"2026-08-05T22:35:52.211942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T22:35:50.716976Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.716976Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:308f152bff00f9de38302b8f1f775ccbf7f9490a7f195042f4e6dbee7ae8873c","observation_id":"2b905e90-76bd-496b-8670-40fdc7d8fa8c","resolution":{"observed_at":"2026-08-05T22:35:50.716976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.192180Z","title":"Softmax linear units","venue":null,"work_id":"cf598e1c-5876-4ab2-a20a-b04a1a1328c2","year":2022},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.721385Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:94efaf55501e5092602699fc18b84f0c58aa45bc6298830d025f558105adb490","observation_id":"2c7af29b-8097-4160-b3e0-f1de8e5e0acc","resolution":{"observed_at":"2026-08-05T22:35:52.196697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-14T07:51:55.558110Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-05T22:35:50.726451Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.726451Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:0c5a79a1c7574a2738af47d851a5a13d142135cf993ae04450cfce119e45a2f0","observation_id":"0035c43f-fdc4-476a-b219-aceb791b2b21","resolution":{"observed_at":"2026-08-05T22:35:50.726451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.177613Z","title":"Knowledge distillation: A survey","venue":null,"work_id":"6dfcb1e3-249c-439e-9064-ef38ee5f4656","year":2021},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.730931Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:ff0326a82f2c2482d272c47dbfea3a5abb999879cf2731bd205357df80b79d25","observation_id":"8bf826e1-f8c1-471b-bedf-cc915a5c5e34","resolution":{"observed_at":"2026-08-05T22:35:52.182360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:50.735344Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.735344Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:a581795cc0ea8e9d7ec3322fbf83040d467518d759ad0942e1b9e9ccb9326561","observation_id":"54b1e966-2a24-4446-b3ca-c33e26b2df1d","resolution":{"observed_at":"2026-08-05T22:35:50.735344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:50.739470Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.739470Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:f3dd8ef360cd9eea5aabbab04f25951b4f169eb05279411386a78b9e67fbc36a","observation_id":"0fbdd0df-74fe-4181-9627-58bccb00fc42","resolution":{"observed_at":"2026-08-05T22:35:50.739470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.140992Z","title":"Learning lightweight lane detection cnns by self at- 9 tention distillation","venue":null,"work_id":"951ec64b-98bf-4f43-a959-d37dbcf25d9e","year":null},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.743887Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:715333e04357bfe76fa870f7c1f1227df2057962961695f0fb54bc9c3ded60b5","observation_id":"f680d928-24de-4382-9a90-8958094b680e","resolution":{"observed_at":"2026-08-05T22:35:52.145624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.125754Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"860f03b2-bf68-4665-8bad-30a4b8169acb","year":2019},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.748864Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:378d16c0b15ec9831e64161c004c5aa594173329e382b0467c0f8a78e80c7c10","observation_id":"dd47919c-da0c-4988-9233-8b8ceb393723","resolution":{"observed_at":"2026-08-05T22:35:52.130633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.110167Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":"39851158-4406-48f6-8a49-603ad3fd48fd","year":2021},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.753080Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:9a53ea9505b8f177667612b2c34710334a577f0258bf137a3d8c51593a55ffe5","observation_id":"1b1ba7eb-db2d-4bd7-a228-5d431c711bdc","resolution":{"observed_at":"2026-08-05T22:35:52.115075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T22:35:50.757110Z","title":"Mistral 7b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.757110Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:3c63803feedd423db48f4a8f45eb3e6d1dc8a36de11ad4a1b039457daec4ee21","observation_id":"2a8b29e0-8723-4413-a650-f7583765e77a","resolution":{"observed_at":"2026-08-05T22:35:50.757110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.095867Z","title":"Unified language-vision pretraining in LLM with dynamic discrete visual tokenization","venue":null,"work_id":"13a8c743-5751-415f-b2ea-40e69c8e011d","year":null},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.761770Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:a872fd01b3794ca989d55886cff6eac253450a97912833907d9f06d807fa8edc","observation_id":"ded257a3-9fba-4d08-a5ed-3f3158ee176e","resolution":{"observed_at":"2026-08-05T22:35:52.100675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:50.766968Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.766968Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:c31df4009761fe739c1503bd812963beccbe05e73248f863bb9a7766796aea78","observation_id":"a57f0a1f-f9b1-4ae3-9aac-685e8ee71b3b","resolution":{"observed_at":"2026-08-05T22:35:50.766968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:50.773397Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.773397Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:0b20c8289f4ffeae5b6acbcf42a11fe7d752e25d4129ee9442e0cf662489f978","observation_id":"4537c502-2c6d-4426-b379-d7e704f01182","resolution":{"observed_at":"2026-08-05T22:35:50.773397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.062921Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":"fe345313-368b-448f-bc5a-0f23309f9794","year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.777604Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:2469cdefee456f90d4c684a7f355ce96c040c02802c5b8efc01233d684c72ea9","observation_id":"498e08ac-b26a-4e81-ba0a-72b9ea507b74","resolution":{"observed_at":"2026-08-05T22:35:52.067409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.047886Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"a438ef07-9eb4-43b1-8681-fce7007564f7","year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.781945Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:79541067086237d1c554537c186eaa1a50e9cda3e79b2bf8a0161986b4404cf9","observation_id":"edc7b207-964e-4d94-a9a5-8430744b0757","resolution":{"observed_at":"2026-08-05T22:35:52.052441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.029895Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","venue":null,"work_id":"7563b97b-c8ed-43de-bf61-a12f762aef59","year":2022},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.786192Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:965d78cd76e8c5c22c42de1fc99e95e13b8e4aaa6fc84e3ba3fe1bc0333b127f","observation_id":"df31fd3d-5dac-45fa-b15f-679ae003b7a9","resolution":{"observed_at":"2026-08-05T22:35:52.035819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09458","last_updated":"2023-07-24T08:32:40Z","snapshot_observed_at":"2026-08-14T10:20:20.431937Z","submitted_at":"2023-07-18T17:39:04Z","title":"Does Circuit Analysis Interpretability Scale? Evidence from Multiple Choice Capabilities in Chinchilla","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09458","snapshot_observed_at":"2026-08-05T22:35:50.790592Z","title":"Does circuit analysis interpretability scale? evidence from mul- tiple choice capabilities in chinchilla","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.790592Z"},"links":{"cited_paper":"/paper/2307.09458","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:f22aeef51378a97f14d65b2725d2ef34e489d187a77236983100a89de6bc2d0e","observation_id":"a9605a61-c8ae-41e0-9f4d-3d396002e224","resolution":{"observed_at":"2026-08-05T22:35:50.790592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:52.014280Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"29856ada-335a-478b-8ce5-082976f91a55","year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.795017Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:210917d9c854b21d068b103d249a6df448359d91dd3ddf041646d9c1f4c8de25","observation_id":"dc813285-dfe7-4fd3-b6f9-afb74af56bdd","resolution":{"observed_at":"2026-08-05T22:35:52.018806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:50.799196Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.799196Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:9faffc0be187cd9364b97b3c396bedebd28d9ef1a329d58b8add9a9121b444cb","observation_id":"a7ecdcfe-9f6c-4459-bcf5-0db304b632f6","resolution":{"observed_at":"2026-08-05T22:35:50.799196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.988853Z","title":"Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233","venue":null,"work_id":"f36bd474-cde5-45cf-a607-1c58a99fa45e","year":2025},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.803584Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:f2742e3ad051d569bd4c3bc8b8fd96ac52b1b11193413eb753dc2eb88ee126ea","observation_id":"b83f99a5-dfb7-4b51-9a2e-7bcbb960c4fc","resolution":{"observed_at":"2026-08-05T22:35:51.993626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:50.808685Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.808685Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:bc397dc12cdfe4d85c64d14a413619a511bc8931f987796c41395ac733e7fa45","observation_id":"7ef00490-519f-4bce-84a9-5df723c612a7","resolution":{"observed_at":"2026-08-05T22:35:50.808685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.960115Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"4d250b02-64c1-4a38-92c5-2a6cf6d4ca52","year":2016},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.813553Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:9718c328920b7ddf0afadd5cadc363fd6e74fbade2357ad90d8a692f2f8d2e12","observation_id":"59f2ed0c-4b47-41f5-a632-ef2eab90590a","resolution":{"observed_at":"2026-08-05T22:35:51.965097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.943583Z","title":"Self-distillation amplifies regularization in hilbert space","venue":null,"work_id":"ed953f4d-1c59-402c-9592-d042ef7fc43e","year":2020},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.818570Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:da25d9d91d2ae1759e690a225c85934c9cc3e29c5dcd9b23b0ac45ed65cb2e54","observation_id":"a7f0785d-addd-4aad-a03f-f9616356999b","resolution":{"observed_at":"2026-08-05T22:35:51.948884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T22:35:50.823423Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.823423Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:de3e1cbe3e40ce1f386b5c3bad218a69f8a3c63963bad3aac3fa4997f0b6b2c2","observation_id":"39563cd3-562a-4d3a-9847-9331d19cfe9c","resolution":{"observed_at":"2026-08-05T22:35:50.823423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.925978Z","title":"Towards vision-language mechanistic interpretabil- ity: A causal tracing tool for blip","venue":null,"work_id":"d0f8a0d4-7fe5-493e-9b23-fbb0edd61c95","year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.829892Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:319996271dccbedcb6cae35e757f5e9187203f377ef92faea4e029e2752c3138","observation_id":"93ae3b32-05d0-4e7e-83d2-dc066eb27ba9","resolution":{"observed_at":"2026-08-05T22:35:51.931754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09632","last_updated":"2024-04-15T10:04:15Z","snapshot_observed_at":"2026-08-13T00:30:05.257180Z","submitted_at":"2024-04-15T10:04:15Z","title":"Bridging Vision and Language Spaces with Assignment Prediction","version":1},"cited_work":{"arxiv_id":"2404.09632","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09632","snapshot_observed_at":"2026-08-05T22:35:51.396502Z","title":"Bridging Vision and Language Spaces with Assignment Prediction","venue":"cs.CV","work_id":"e47a1c77-13cb-4036-b10d-d06b48ea6216","year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.839430Z"},"links":{"cited_paper":"/paper/2404.09632","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:1f4285c981cdc77ed646b457eade0007d24a03dfffca3549147f5e66da70cb0f","observation_id":"0c5dd1c1-844c-4056-9f6c-214e315a9eda","resolution":{"observed_at":"2026-08-05T22:35:51.403848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.909459Z","title":"Relational knowledge distillation","venue":null,"work_id":"328cbb3e-a01e-4f14-b725-6e88042e3af0","year":2019},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.844340Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:a5f12268cad3596cf0d5aa14422d179e1e66f3fd7dec418bd68305fdf0c68b31","observation_id":"c66dc27b-bfa2-4ccf-bf9d-768a8cde5a62","resolution":{"observed_at":"2026-08-05T22:35:51.913886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07720","last_updated":"2024-09-23T08:51:01Z","snapshot_observed_at":"2026-08-13T05:56:39.619077Z","submitted_at":"2024-03-12T14:58:52Z","title":"Multi-modal Auto-regressive Modeling via Visual Words","version":2},"cited_work":{"arxiv_id":"2403.07720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.07720","snapshot_observed_at":"2026-08-05T22:35:51.365744Z","title":"Multi-modal Auto-regressive Modeling via Visual Words","venue":"cs.CV","work_id":"ed5cc5c4-3ffa-45c0-83f0-a4e4cd7bd675","year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.849417Z"},"links":{"cited_paper":"/paper/2403.07720","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:dad5f1f99e40144f4176a35a8ed1e9dc83860d2d794a8088c6fbdeaa8e1f67c7","observation_id":"d40f46a3-2fcd-43af-843b-4ba4b19de5ea","resolution":{"observed_at":"2026-08-05T22:35:51.374658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06366","last_updated":"2022-10-03T11:47:10Z","snapshot_observed_at":"2026-08-13T14:45:57.387723Z","submitted_at":"2022-08-12T16:48:10Z","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06366","snapshot_observed_at":"2026-08-05T22:35:50.855107Z","title":"Beit v2: Masked image modeling with vector-quantized visual tokenizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.855107Z"},"links":{"cited_paper":"/paper/2208.06366","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:decb58a5b08ceb686a70ba8fa273708d05ed2612138b7c2ece20a7ee0531706a","observation_id":"1432a2b3-15ca-4824-b862-44626d0e0937","resolution":{"observed_at":"2026-08-05T22:35:50.855107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.892465Z","title":"Distillation-based training for multi-exit architectures","venue":null,"work_id":"1a14a6cc-bb0b-477b-9b58-5cd497b6d4f8","year":2019},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.859901Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:3615c5ce8708b0ddbdab84ec9d27fae7af2ed236a97928ebf1402a4bf94572b4","observation_id":"8b928c81-94b3-42c5-a975-cd0bc3f77287","resolution":{"observed_at":"2026-08-05T22:35:51.898383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.873480Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"c876d12a-a911-4514-85f7-13882e4e6844","year":2021},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.865842Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:64c3779c51dc410bf79ff4461544be79f09a549beb55684e2829445f8744513b","observation_id":"a6bff80d-3143-4c4f-b530-ad550e46d76f","resolution":{"observed_at":"2026-08-05T22:35:51.880916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.853907Z","title":"https://sharegpt.com/, 2023","venue":null,"work_id":"8e618a3e-d6c6-4a94-a797-2931c2438482","year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.875076Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:9069d5c3742a05cd0207c1b6e311826aa4b0743f57a46da8529ba2a3c5cfc412","observation_id":"68fa1b46-277f-42de-b208-af31d40615e4","resolution":{"observed_at":"2026-08-05T22:35:51.860116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.833890Z","title":"Self-distillation from the last mini-batch for consis- tency regularization","venue":null,"work_id":"151c9a07-2580-4a93-bc79-cd00173de62b","year":2022},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.880068Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:df40e32d4b52c98042e9877e3a831d16026b2d02ac006c1c463f7951dfab2cdd","observation_id":"ef80358d-b4f4-414a-8d08-98c36f3996a2","resolution":{"observed_at":"2026-08-05T22:35:51.839303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.817185Z","title":"Towards vqa models that can read","venue":null,"work_id":"2787b5b0-302c-4792-aa60-7cf7dd83cd04","year":2019},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.885518Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:76321dff03531dbc9c07342cb4d8859b76189a2acb4a47c4e204a8fb7149d26f","observation_id":"78e534de-7b7c-455d-b174-b2fa44b71fb9","resolution":{"observed_at":"2026-08-05T22:35:51.822872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.802872Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"49976712-e5a8-4d3d-bd91-ffe8d9b17247","year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.891633Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:f57428f4ccc13babd70b1c044f0086d2ae8dececf47b063e8688f4e7e4aa7457","observation_id":"28bec035-3033-42fb-9dc7-832a32c0e674","resolution":{"observed_at":"2026-08-05T22:35:51.807330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:50.897216Z","title":"Generative multimodal mod- els are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.897216Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:7500f051053c772fe3dedfc75380f65b1e1b47c1f4aab22041650b932611ca52","observation_id":"01e9b215-ee77-490e-acec-9ce79773feb5","resolution":{"observed_at":"2026-08-05T22:35:50.897216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T22:35:50.902847Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.902847Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:391682a8a16d774918ccd008dbfbdfcb60b6e851b9559f3c4893643d89da2bf7","observation_id":"e50e2f12-9afb-48f5-b7c9-d1becc473c62","resolution":{"observed_at":"2026-08-05T22:35:50.902847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T22:35:50.908617Z","title":"Gemma: Open models based on gemini research and tech- nology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.908617Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:a52555056bf8cc18c208fe05143b7860a78620449d217e1744280930e936e3e2","observation_id":"1af2ba3a-de28-4cb2-a1b8-c5f2b482cd38","resolution":{"observed_at":"2026-08-05T22:35:50.908617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:50.913808Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.913808Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:f1af7660280e8b76ca7193cfa157cd68394fe92d0403ee4602f1747bef73cfd9","observation_id":"881b7a09-e23e-4ea6-ba56-6da4a506c201","resolution":{"observed_at":"2026-08-05T22:35:50.913808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T22:35:50.918910Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.918910Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:9cd13d599d6a00f16675b25d245fef1157b5a5f7cf49209114dae51a303eb16a","observation_id":"fe509967-c08c-4440-95e7-08e51b647e00","resolution":{"observed_at":"2026-08-05T22:35:50.918910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T22:35:50.925833Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.925833Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:9eec2bc418f970a644215428ac8bc2b5cadcb0921ed65485da2b771523f5c6a4","observation_id":"b464dccf-82c5-415a-8e3b-7ee6c73ca14d","resolution":{"observed_at":"2026-08-05T22:35:50.925833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10588","last_updated":"2024-06-08T11:15:14Z","snapshot_observed_at":"2026-08-13T04:17:41.245742Z","submitted_at":"2024-02-16T11:21:28Z","title":"Do Llamas Work in English? On the Latent Language of Multilingual Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10588","snapshot_observed_at":"2026-08-05T22:35:50.930906Z","title":"Do llamas work in english? on the la- tent language of multilingual transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.930906Z"},"links":{"cited_paper":"/paper/2402.10588","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:94595a6593f78da158ac9b230c6a12b7a347ed10d55f5b581194237dbf131ead","observation_id":"0343fc5b-0a5b-4893-a932-bfd7ec1bca87","resolution":{"observed_at":"2026-08-05T22:35:50.930906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.763989Z","title":"Libra: Building decoupled vision system on large lan- guage models","venue":null,"work_id":"12165dd7-c10b-46e1-9ac5-8019676f9d4f","year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.936418Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:3db4659753b5f26afb7358c6010f8bb9aed59721d2d81c133f1794fb63642f83","observation_id":"389002d3-9840-4f99-8139-c041a069e964","resolution":{"observed_at":"2026-08-05T22:35:51.768776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T22:35:50.941886Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.941886Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:6b338e867f785c1091ba9937a878b5d914879bb3de6a45a0abefcfdac7f085bf","observation_id":"350f9945-f90c-4fb9-b5a8-fd72c96c38ec","resolution":{"observed_at":"2026-08-05T22:35:50.941886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.746073Z","title":"Snapshot distillation: Teacher-student optimization in one generation","venue":null,"work_id":"54b3194e-16de-4d4f-b3cc-9c32d0f3a930","year":2019},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.946569Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:93e0b2de6fa909614acf218a4a20e4b780add5b614e13154719d64a863c0c20e","observation_id":"d0d7727e-d383-4be2-8759-0418ec76d26a","resolution":{"observed_at":"2026-08-05T22:35:51.752840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-14T09:06:05.525723Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-05T22:35:50.952229Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.952229Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:45cf21f6a798d72c29746d747454068818b1ebd857b6745c10be1695f202308e","observation_id":"1c631496-3b3d-46f0-b4de-2b6e88a6785a","resolution":{"observed_at":"2026-08-05T22:35:50.952229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T22:35:50.958123Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.958123Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:422015c6ec5999a240652b1b229c101d4ba0436e28eb46efafcc92695c528405","observation_id":"ece70674-f426-4caa-8b23-94f5688ab990","resolution":{"observed_at":"2026-08-05T22:35:50.958123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-05T22:35:50.965046Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.965046Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:450f7c7f7b33dc0b586cbf72b88b512c164acd5ed10d1ac7ddf25f0485b8a397","observation_id":"dd89176a-4563-4a09-954b-2777084513bc","resolution":{"observed_at":"2026-08-05T22:35:50.965046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02872","last_updated":"2024-09-24T20:27:53Z","snapshot_observed_at":"2026-08-14T06:03:57.934672Z","submitted_at":"2024-02-05T10:39:32Z","title":"How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02872","snapshot_observed_at":"2026-08-05T22:35:50.970245Z","title":"How do large language models learn in-context? query and key matrices of in- context heads are two towers for metric learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.970245Z"},"links":{"cited_paper":"/paper/2402.02872","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:b2a101404ceafb8b855b09d70f551ec09425305fc8e680fa1464170a51b5a959","observation_id":"c98f7c46-dede-4b3b-8084-af4f288042b5","resolution":{"observed_at":"2026-08-05T22:35:50.970245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15949","last_updated":"2023-04-04T06:43:19Z","snapshot_observed_at":"2026-08-14T10:10:17.012207Z","submitted_at":"2021-03-29T20:51:33Z","title":"Transformer visualization via dictionary learning: contextualized embedding as a linear superposition of transformer factors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15949","snapshot_observed_at":"2026-08-05T22:35:50.975513Z","title":"Transformer visualization via dictionary learning: con- textualized embedding as a linear superposition of trans- former factors","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.975513Z"},"links":{"cited_paper":"/paper/2103.15949","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:6ad915c88eac82d9b2490c29408195637d443c12e81d23d906702fad4a6ca0c7","observation_id":"254817d3-8c29-450d-8cc0-6a1244a2b763","resolution":{"observed_at":"2026-08-05T22:35:50.975513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.728501Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"ade03849-de00-46fc-bc34-b524df31a0ae","year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.981398Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:cb262b099fedf1709af6552ca7d9c7219abecfdaae920f930df13ae1cc5e5560","observation_id":"4cfbed7d-5065-4f0b-a67d-82dba9e00ade","resolution":{"observed_at":"2026-08-05T22:35:51.733114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.712768Z","title":"Be your own teacher: Improve the performance of convolutional neural networks via self distillation","venue":null,"work_id":"c333309f-a9e2-4861-b5f1-3e81ceddf2d3","year":2019},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.988048Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:578c331c7bbac56ae1582d325b41a2872d2b196ee8994ed5dffa8f6e0768958d","observation_id":"107a0250-cf9a-4c02-9cad-a6a47b7d1a3f","resolution":{"observed_at":"2026-08-05T22:35:51.717295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.697018Z","title":"Self- distillation: Towards efficient and compact neural networks","venue":null,"work_id":"a5393f7c-4d2e-497a-80bc-a4ff53272feb","year":2021},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.995136Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:94d5039a9264e0848afe59c2345a38e595fcfd0055b4f6884a222b3e5ec4138c","observation_id":"5405491c-0ee7-4509-ac3e-1fe47aa53663","resolution":{"observed_at":"2026-08-05T22:35:51.702294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.681197Z","title":"Self-distillation as instance- specific label smoothing","venue":null,"work_id":"056d961a-4a28-4078-8627-f452de5e59e4","year":2020},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:51.001672Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:6e0d8807d38008f15246f42dbc6cc71ffc7b31c84897bb5a8285039c541049bc","observation_id":"16ed01c1-cdd9-4097-b31d-5e42bfcd5df1","resolution":{"observed_at":"2026-08-05T22:35:51.686436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:35:51.664278Z","title":"Decoupled knowledge distillation","venue":null,"work_id":"0bd0c387-33ca-4959-902d-3837fd6dba87","year":2022},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:51.006465Z"},"links":{"citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:0f3eaaf8f08c9802db9d3871931e1b776de1228a997f96e63f2ed33b18277f8c","observation_id":"fee9d293-fe43-469a-8139-a64fb92017f2","resolution":{"observed_at":"2026-08-05T22:35:51.669092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T16:47:37.700496Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 1 inbound Pith citation observation for arXiv:2508.06895."}