{"as_of":"2026-08-11T07:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fee59d4ac41e19a61e0c126d38a9632dae6fa407ea21a3a4b37576c1ef82831","coverage":[{"denominator":143,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:08:48.226962Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11515/citation-record","integrity":"/paper/2506.11515/integrity","json":"/paper/2506.11515/citation-record.json","paper":"/paper/2506.11515"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:33.096271Z","title":"ManagerTower: Aggregating the insights of uni-modal experts for vision-language representation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.096271Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:bce60c2fa67ac8b12b232f3ee1d2ede5de990fb42dd61bb469b6be42057d04fe","observation_id":"b787420d-6acc-4f61-a52a-79299a9128bc","resolution":{"observed_at":"2026-08-07T04:08:33.096271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:33.202223Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.202223Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b6101657ebebc55667c8e579591c370fb4b91b85b72d5260e67399110d0cfb46","observation_id":"55f9426a-ef5c-4aa8-b023-99165f154c40","resolution":{"observed_at":"2026-08-07T04:08:33.202223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.06706","last_updated":"2019-01-20T17:55:05Z","snapshot_observed_at":"2026-08-08T23:17:13.003005Z","submitted_at":"2019-01-20T17:55:05Z","title":"Visual Entailment: A Novel Task for Fine-Grained Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.06706","snapshot_observed_at":"2026-08-07T04:08:33.416327Z","title":"Visual entailment: A novel task for fine-grained image understanding,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.416327Z"},"links":{"cited_paper":"/paper/1901.06706","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:74b58b0f87c02f6417c170e1f61a09fb0c6d8797bbb2688845af9fabc566e295","observation_id":"ebc1cac8-cde5-463f-b1a8-406c2422b85d","resolution":{"observed_at":"2026-08-07T04:08:33.416327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:33.710099Z","title":"A corpus for reasoning about natural language grounded in photographs,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.710099Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:bb7616d34f4eaf8d12874ecfd65c22b6989b3a22bc42b8f58e850ccd5048d0a1","observation_id":"3a06e115-c7a9-4c85-ab83-083584a3d28c","resolution":{"observed_at":"2026-08-07T04:08:33.710099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:33.832464Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.832464Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:ba10dac2f722a107ee10c38341ac3a428a2f3ccf92d8cb7b3b3922ea39c161c0","observation_id":"62e00204-edb0-4c9f-8b1e-48ec10634540","resolution":{"observed_at":"2026-08-07T04:08:33.832464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:33.933376Z","title":"An empirical study of training end-to-end vision-and-language transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.933376Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:ae79f3802e6fd6e3da578b2482b053814a12511eea8d1b53f7eb43249880228c","observation_id":"4deea2d7-3081-4629-977c-7375b2fc0ce8","resolution":{"observed_at":"2026-08-07T04:08:33.933376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:34.047268Z","title":"Bridgetower: Building bridges between encoders in vision-language representation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.047268Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:c0b593d52679c715b8132808eeb927e2f3eb0bcc7d8b47599433088cbf710354","observation_id":"6b114773-63c4-4e72-bb35-62f12f64839e","resolution":{"observed_at":"2026-08-07T04:08:34.047268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:34.138970Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.138970Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:9e8285bb92277c3fe3583933216d44c84ec01395463cd37adeb0e3871d28e255","observation_id":"f1d71738-f08d-4cd5-9398-f9bf73b4f60b","resolution":{"observed_at":"2026-08-07T04:08:34.138970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T04:08:34.269423Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.269423Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:cdb55fda83f99a16476f63198bf6a42e863c672fa80a45a7a1ad8182bfbc6958","observation_id":"5a635d12-cd8e-4d0e-a1e3-a20123271c14","resolution":{"observed_at":"2026-08-07T04:08:34.269423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:34.396539Z","title":"Learning deep transformer models for machine translation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.396539Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:503ebde5032cc0cc6fa2f52c9b3d903d70bdf182c900f8ff386eb0cb4fc33249","observation_id":"1497da84-d879-4b24-a45b-d1310f0bc138","resolution":{"observed_at":"2026-08-07T04:08:34.396539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T04:08:34.510959Z","title":"Llava-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.510959Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:0b56d233b91b9052321bc82e92229e15a81cf30b6bc0963f12372d138a731e3e","observation_id":"3f8768f4-df16-48b4-ae99-fd24685256d8","resolution":{"observed_at":"2026-08-07T04:08:34.510959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:34.681245Z","title":"Llava- next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.681245Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:392482642f8e36447e9bc9e8872b0fa62cdde58ae4998c1dd2f5e5efe087dd0e","observation_id":"17f631e1-3a02-48f3-ad3c-0edf39ec72bb","resolution":{"observed_at":"2026-08-07T04:08:34.681245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:34.848451Z","title":"How much can CLIP benefit vision-and-language tasks?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.848451Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b8be9a552cff82f8da1acb823385536c394e4787084d10169ce3be62d0745d1d","observation_id":"2f78c9a6-e55e-4637-a4a3-8d5d209ae51f","resolution":{"observed_at":"2026-08-07T04:08:34.848451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.012205Z","title":"UNIMO-2: End-to-end unified vision-language grounded learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.012205Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:6e76f62f29cf88403a5ba22d2920778afb0bf14020eddc0850025ceee82ed9d2","observation_id":"fe89ca05-e8d3-472f-ae87-bf3686995f4a","resolution":{"observed_at":"2026-08-07T04:08:35.012205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.146927Z","title":"Neural machine translation of rare words with subword units,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.146927Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f758cfaff6cf5b561a969cdae945c7e9fb8b6ea81095a812a0565d08e3384520","observation_id":"83e54d8e-4a8a-4f7b-9af6-5cad87292bb6","resolution":{"observed_at":"2026-08-07T04:08:35.146927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.256696Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.256696Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:3f8eb8f26ad9704065139af9c372269f198c38a9de7c015c208fdcc1c09dff4f","observation_id":"c02c04b3-7ca1-4bca-b887-8375e818dd1f","resolution":{"observed_at":"2026-08-07T04:08:35.256696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.432776Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.432776Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:c95425afaf0df010242f2d4ca59226c62d6a152c233ada07171413ee1ea0beea","observation_id":"db02e517-fb23-4300-a9be-3426bf0d409d","resolution":{"observed_at":"2026-08-07T04:08:35.432776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.541595Z","title":"Vilbert: Pretraining task- agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.541595Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d56f4d4f94c3a0ce8e521d1eaa353f7b3c0643a57f4d766664257c637dd0dbae","observation_id":"2aa3a712-7ab3-44c4-a016-f21eb83b3039","resolution":{"observed_at":"2026-08-07T04:08:35.541595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.664720Z","title":"Multi-layer representation fusion for neural machine translation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.664720Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:8f01db6ca9b03625f8777c112ddadc80b27a7687f51d598067a3e4ecf6712f58","observation_id":"127b0b7e-b728-4454-9243-9d426aeea31c","resolution":{"observed_at":"2026-08-07T04:08:35.664720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.819400Z","title":"Multiscale collaborative deep models for neural machine translation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.819400Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:944bc9791966fb22940d68d05b30b5e1a934829afdd501278767163b0711a183","observation_id":"6e228351-5890-459e-a8cb-e664beffcaa7","resolution":{"observed_at":"2026-08-07T04:08:35.819400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T04:08:35.926027Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.926027Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:209a453a1b7bc84277fb61a6796610df785ab78ae8b5643f8cd51bc6c74f40c5","observation_id":"168de691-262c-4021-983a-4525d727306a","resolution":{"observed_at":"2026-08-07T04:08:35.926027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.069126Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.069126Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:fbcf720b272246f43a7e8815cc3e0b188cd611984c9cd60a4eb896506ac3254e","observation_id":"d3f72292-993e-42a2-8b69-78960073aa47","resolution":{"observed_at":"2026-08-07T04:08:36.069126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.245435Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.245435Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:ffc2f80d729f94ceebc8991febcc0828962dde045b68f157e5508d88bc018914","observation_id":"a6364764-2666-4314-a977-3c149ba81cd8","resolution":{"observed_at":"2026-08-07T04:08:36.245435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.380900Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.380900Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:852f553ca481187d0e6e4366a778b8771044b57f686ca4a44f1ec19b05b1ab17","observation_id":"13501472-651d-4356-b2bc-8d4511f2f927","resolution":{"observed_at":"2026-08-07T04:08:36.380900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.538152Z","title":"Uniter: Universal image-text representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.538152Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:fb33668c46f39cb384533a4dc1babd6f0814a441cd66f0f43b0bdea699555f27","observation_id":"a8d542ec-e519-46e3-a9d0-bbe5db76fa07","resolution":{"observed_at":"2026-08-07T04:08:36.538152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.679187Z","title":"UNIMO: Towards unified-modal understanding and generation via cross-modal contrastive learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.679187Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:eb37545024ee320c1e87a6284b6a51f87c7862642f51636b84384f2263234a0d","observation_id":"4559d4da-8f84-45c6-b95c-2d17fde19ed3","resolution":{"observed_at":"2026-08-07T04:08:36.679187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.787717Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.787717Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:dadac592cba409bc437d450f8d356876a8c81796b9d5637d7a1bf2fcdf6fc7c5","observation_id":"6aa74da3-3b4e-460c-bd91-263168634441","resolution":{"observed_at":"2026-08-07T04:08:36.787717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.927145Z","title":"Vlmo: Unified vision-language pre- training with mixture-of-modality-experts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.927145Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:09680ed3354b33c48a5fe25e2c7962c0ce6e0e191eb19cad8c00ebbe45767b29","observation_id":"40ec964d-4a3b-43ff-9eb0-ac8e6074e064","resolution":{"observed_at":"2026-08-07T04:08:36.927145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.043824Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.043824Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:609ad24c9a4cbfbda1b1433653cdb5b7b7353f1b5147b84f0189f049c17a22a4","observation_id":"0e1b9acf-fcc9-438f-9f15-94e42948a820","resolution":{"observed_at":"2026-08-07T04:08:37.043824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.184911Z","title":"BLIP: bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.184911Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:062e441380eb1493378ec4f13da549dfc96405541997dfb92366eabcdd77f370","observation_id":"9d31b259-9a5c-4d4e-97d5-8f750e5c074a","resolution":{"observed_at":"2026-08-07T04:08:37.184911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.280478Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.280478Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:6908613725765f9afaff3e37db8054bafdab1da57d6747626304277f2a0baf81","observation_id":"81f9cc6f-3c60-48a9-8c62-b536775451df","resolution":{"observed_at":"2026-08-07T04:08:37.280478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.369147Z","title":"Im2text: Describing images using 1 million captioned photographs,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.369147Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:019f6a64f8e2c2263e86c710c188adf1566d4a130abd9d4e83b46338b3285d01","observation_id":"ab0fd178-91fb-40f4-8f7b-13bfa4a7129b","resolution":{"observed_at":"2026-08-07T04:08:37.369147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T04:08:37.503386Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.503386Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:8dd88a357e23bfa9b88ae1c62d5b3b75e64022e229559f8c6666f1167599ec26","observation_id":"16c6ed4c-a231-4626-9caf-a5e85204bc85","resolution":{"observed_at":"2026-08-07T04:08:37.503386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.643209Z","title":"Visual genome: Connect- ing language and vision using crowdsourced dense image annotations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.643209Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:0ec9fb7381f8d674d5653044cdbe8ffcacdd6cfacdff5741642ffd7034a90e7e","observation_id":"43234c42-5705-49f9-bb51-c0a6d5b9edd7","resolution":{"observed_at":"2026-08-07T04:08:37.643209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.753062Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.753062Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:81cd7717b01c8cb9e48cfedb6f2cce86d73ac221ccccf0e8429b5a409b717ccd","observation_id":"2559ceb1-fa12-4997-bc03-069586b28428","resolution":{"observed_at":"2026-08-07T04:08:37.753062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.870902Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.870902Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:ffdbba86b5f7324a3009d405c43ab6f4f6d7aac11b76a6ff7eb28eb518b372b7","observation_id":"67f49981-e54c-4b78-a46e-cc375d64580f","resolution":{"observed_at":"2026-08-07T04:08:37.870902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.996940Z","title":"Docvqa: A dataset for vqa on document images,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.996940Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:8d5ab6ee84a09ababd72cedbce9eb6f61e94110ba784e004a701885956d0449b","observation_id":"54ecea55-9c8f-4520-b022-d83c20fe3c04","resolution":{"observed_at":"2026-08-07T04:08:37.996940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-07T04:08:38.138298Z","title":"Ocrbench: On the hidden mystery of ocr in large multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.138298Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:ebe743b0e812d401605979dc1e38fc88a2c842fac9de93e8c3f2b5631164319c","observation_id":"537332fd-f14c-4b01-bebc-63fb4571fe5e","resolution":{"observed_at":"2026-08-07T04:08:38.138298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:38.349219Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.349219Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:e100f0400f1cffc7a3f609cbbf28bf80b09972e55cd213f0296b1ad264b00afa","observation_id":"f0ed166f-4887-4415-ab39-a07af0c8721d","resolution":{"observed_at":"2026-08-07T04:08:38.349219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T04:08:38.535201Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.535201Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b304bc0bd30edb3dad2ddc8c596c3154c5fc80f6176377bf21afa42494c0ec37","observation_id":"44a4699c-f096-4e34-83f5-f5e54cef2ca5","resolution":{"observed_at":"2026-08-07T04:08:38.535201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16527","last_updated":"2022-06-10T16:57:51Z","snapshot_observed_at":"2026-07-06T12:54:54.273968Z","submitted_at":"2022-03-30T17:58:23Z","title":"Exploring Plain Vision Transformer Backbones for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16527","snapshot_observed_at":"2026-08-07T04:08:38.678581Z","title":"Exploring plain vision transformer backbones for object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.678581Z"},"links":{"cited_paper":"/paper/2203.16527","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f5263f9a54aa3fa4db5cbf1a62301c8dc42275e1c26a21667ed45293ac830988","observation_id":"9d5ec591-45c1-41cb-b6d8-244f741b30bb","resolution":{"observed_at":"2026-08-07T04:08:38.678581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T04:08:38.805151Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.805151Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:069daa28ae211efc4294f48a2bd78030962ac5ce1f470fd14e89e58e3c1a6aad","observation_id":"9c6490ac-a365-4e03-a021-585cda9746f2","resolution":{"observed_at":"2026-08-07T04:08:38.805151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:38.963496Z","title":"OK-VQA: A visual question answering benchmark requiring external knowledge,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.963496Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:90ae05f006e5a8055ef82a1f0472eff8ce940fd49aef71746ec31bd649df7e42","observation_id":"8158c46c-bef8-4e83-8312-21b3dc5bdd76","resolution":{"observed_at":"2026-08-07T04:08:38.963496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:39.071175Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.071175Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:0bd0e6904ecda250f9d92f3731a7dc669f016bf0cc3a64ed60131a2ac5d2d392","observation_id":"d4c7b5df-bf1e-4fdf-a001-c90e39924fb9","resolution":{"observed_at":"2026-08-07T04:08:39.071175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:39.186859Z","title":"MM-vet: Evaluating large multimodal models for integrated capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.186859Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b98e8ff49ee149eccadbd6c1b3c15054f5d2459c0ec5983b79044adb93af171b","observation_id":"be1fb631-5e0e-400e-b7d2-6f4ae267f566","resolution":{"observed_at":"2026-08-07T04:08:39.186859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T04:08:39.324730Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.324730Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d2f354c841cbd78cab961e9dccfacb8e512b875377300992b88e66b448b72a7d","observation_id":"0f6f0d9e-1324-4eec-b3ec-8182e7455207","resolution":{"observed_at":"2026-08-07T04:08:39.324730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:39.541834Z","title":"Grok-1.5 vision preview","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.541834Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:0dbdb6c6559dee92880f11e96cda4625009007de70d874faedbed7420d55516a","observation_id":"28546be3-8d16-4c27-8c88-47030076110e","resolution":{"observed_at":"2026-08-07T04:08:39.541834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:39.732658Z","title":"Towards VQA models that can read,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.732658Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:6ccd78dc2d9b15b10b3034aa3ffea86070d255a23a85dfb1ae12544ff94aa11e","observation_id":"db613073-00ff-4358-82df-5a1e2594cff4","resolution":{"observed_at":"2026-08-07T04:08:39.732658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:39.947386Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.947386Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:fcd2e993830d51079ab36407423bbf6e258838fb5ac0de031199bd9575ac530a","observation_id":"fd5ae75d-1c63-4d54-b5d4-335a3171eb90","resolution":{"observed_at":"2026-08-07T04:08:39.947386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.137978Z","title":"Infographicvqa,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.137978Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f08db8bdaf399f7d18bceaf135ff2d5c35193423616a1d19bee69da429967625","observation_id":"0d760691-3514-4c2a-896d-d4a8a8034796","resolution":{"observed_at":"2026-08-07T04:08:40.137978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.270291Z","title":"A diagram is worth a dozen images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.270291Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:fa869a0fe2ede9f6d7531423b4c264bb6e06b81eb6c4cbda291b3713a163cd4e","observation_id":"d1350f9c-11ba-457c-9adc-0a6cd3b1d957","resolution":{"observed_at":"2026-08-07T04:08:40.270291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.485663Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.485663Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:2df3e37ae13895b7c2930b5510cf9c16a9cb580481e410be876e22f272cc2155","observation_id":"c9896961-3bb1-4c9c-bdeb-be0b8c47cb4f","resolution":{"observed_at":"2026-08-07T04:08:40.485663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.621152Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.621152Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:592b78a0beca18e2b95d94fc8d2e9bf610dadad580bedde1c84aae632b72dade","observation_id":"86e7b22c-7d89-46c0-956b-294c214ac865","resolution":{"observed_at":"2026-08-07T04:08:40.621152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.791974Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.791974Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d6d65a6c5fee3d8b9555c59e4b5631abdd379fe2f459f261ac3160c56c9fb7c1","observation_id":"2f75a396-e90c-4cb4-90c5-f2a010df1e03","resolution":{"observed_at":"2026-08-07T04:08:40.791974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.922650Z","title":"Llava-next: What else influences visual instruction tuning beyond data?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.922650Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:1584a6bd1648a7ac594396040e301744aeefdd5a34a6ba7b110b2bd7942a44f9","observation_id":"791fa363-476e-4220-b480-1297520c747b","resolution":{"observed_at":"2026-08-07T04:08:40.922650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T04:08:41.016343Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.016343Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f1293f0f577c6e9dab97510330271674b8258d424439385afbf51d0a0c1597f5","observation_id":"1b0053e0-2ad7-40d6-9e37-341dea810c36","resolution":{"observed_at":"2026-08-07T04:08:41.016343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.133126Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.133126Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:7b5963d3aeda233901e50048fc39b2fc0f825bbe3789c7b0890a1ecf41cccf78","observation_id":"ccfd809d-005b-4e6b-9e68-8651e9771796","resolution":{"observed_at":"2026-08-07T04:08:41.133126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.228490Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.228490Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:c0eed383689525d5d69fc525c905e3b7e9372540ea041d05f667fe5b30f2a140","observation_id":"630611ec-21aa-4254-a63b-4364f039a30e","resolution":{"observed_at":"2026-08-07T04:08:41.228490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02034","last_updated":"2024-10-28T07:40:49Z","snapshot_observed_at":"2026-07-06T18:56:40.234434Z","submitted_at":"2024-08-04T13:55:58Z","title":"Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02034","snapshot_observed_at":"2026-08-07T04:08:41.334971Z","title":"Mini-monkey: Alleviating the semantic sawtooth effect for lightweight mllms via complementary image pyramid,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.334971Z"},"links":{"cited_paper":"/paper/2408.02034","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:a44e4e98f6469aaf96807d519f00b057018e1e56dd88a54b0426c6f3f99b6c90","observation_id":"7a46b53b-59b1-4e10-a856-f00b73567ab5","resolution":{"observed_at":"2026-08-07T04:08:41.334971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.454860Z","title":"Neural machine translation by jointly learning to align and translate,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.454860Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:3864a26636399918a0b0dbd889f3526e3c50112dad5974f7d9c1b7afb5bd2c0b","observation_id":"1a13bfda-229f-4e88-b2f1-ff9484da7785","resolution":{"observed_at":"2026-08-07T04:08:41.454860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.599170Z","title":"Revealing the dark secrets of masked image modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.599170Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:1c181c7e899d8b198b94561f360d9bb8be790b5d324105338c86448cda446692","observation_id":"78ea5f86-41b0-4a53-9cb8-04e90e66d748","resolution":{"observed_at":"2026-08-07T04:08:41.599170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.718447Z","title":"On information and sufficiency,","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.718447Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:bc82b5ae7c8d4ed88d1481f7e685c65c259c2bb8cf72ca3eabea8b5f3a8e8f9f","observation_id":"50e4abef-6a5a-42c5-a7d4-42205f4297a5","resolution":{"observed_at":"2026-08-07T04:08:41.718447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.750278Z","title":"VL-BERT: pre-training of generic visual-linguistic representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.750278Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:6ba44dc01bbb23a95fd2034844992b0480b5cae6e63601df9bc8f7d43e5e8868","observation_id":"11507107-d0ac-4d9d-be1d-a4aa00ff6b15","resolution":{"observed_at":"2026-08-07T04:08:41.750278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.831669Z","title":"Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.831669Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:caa5b660e1a60ee1cdfb303eb56bb021902e57821fef3a51b530c306164f4ae5","observation_id":"c21d2ddb-66ff-4d8d-a3b1-8f6fe4d4b2db","resolution":{"observed_at":"2026-08-07T04:08:41.831669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.945825Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.945825Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:09f6eafc98a597c7d7b09cd0da9a1e2ca9682d201c208f7fe73dc9824ee502ae","observation_id":"9185042d-2240-4ff6-bab4-27b2067d0c14","resolution":{"observed_at":"2026-08-07T04:08:41.945825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03052","last_updated":"2022-06-01T09:24:35Z","snapshot_observed_at":"2026-08-08T22:07:00.654212Z","submitted_at":"2022-02-07T10:38:21Z","title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03052","snapshot_observed_at":"2026-08-07T04:08:42.037290Z","title":"Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:42.037290Z"},"links":{"cited_paper":"/paper/2202.03052","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:fad222cdaf98205cc41abbc5f119f02d7a0062e728cdc672677f8e9242cf577a","observation_id":"b0e88f0c-1d92-4bd9-9257-708632af24b9","resolution":{"observed_at":"2026-08-07T04:08:42.037290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-11T00:20:29.155513Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-07T04:08:42.307549Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:42.307549Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b82c4faded8244a5c82e397d895576d10b4e66404e5e6fd5d5f651cc3644080b","observation_id":"4f4663b1-9867-4080-86a5-7bb1fd1cc08e","resolution":{"observed_at":"2026-08-07T04:08:42.307549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-07T04:08:43.340094Z","title":"Coca: Contrastive captioners are image-text foundation mod- els,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:43.340094Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b4d2a9c96f683f5887a661a68e636f3e6101c2ca0d7fceb70e9a4d9ed743892c","observation_id":"1b21a005-6ee6-4ecf-9f2e-dfa787d4f2f0","resolution":{"observed_at":"2026-08-07T04:08:43.340094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:43.896751Z","title":"Exploring vision-language foundation model for novel object captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:43.896751Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:fd808f5f57ea06998bcf888e2178d1e44266495e3e91cfbd9e69381e18dfaa8e","observation_id":"860a30ee-b50a-4881-90a6-4fac86b0df49","resolution":{"observed_at":"2026-08-07T04:08:43.896751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.003055Z","title":"Unsupervised domain adaption harnessing vision-language pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.003055Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:23e543f2c1e3bfbf54cf748d69980fdf1d0d88f7c2f33ce5093310847850d0fc","observation_id":"0d2e4955-30c7-4ba3-b795-3ef241e06712","resolution":{"observed_at":"2026-08-07T04:08:44.003055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.141844Z","title":"Do vision transformers see like convolutional neural networks?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.141844Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:e524dcab1cfc5003d7275660fa98e241f4be517330283abfb26e591d59b35ce7","observation_id":"9850c635-261e-4a42-996e-4a495732adf6","resolution":{"observed_at":"2026-08-07T04:08:44.141844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.267295Z","title":"Intriguing properties of vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.267295Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:58d97334cce74e27470b702077b093e75a9c1553459bfaf14919f3724629df80","observation_id":"4e491e1b-f238-4429-bc18-38adbcdc299f","resolution":{"observed_at":"2026-08-07T04:08:44.267295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.396287Z","title":"Dissecting contextual word embeddings: Architecture and representation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.396287Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:a6bb197798210ed6908fc320e9e54bcc6747a1303275016d98dd32f5e9b0ed61","observation_id":"20dc7104-e1f1-4a72-ade2-e2ddc88cbc52","resolution":{"observed_at":"2026-08-07T04:08:44.396287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.506110Z","title":"Linguistic knowledge and transferability of contextual representa- tions,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.506110Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:6cc697d20d77359cbcbcfda866b443670fc5b27ae5be38eb73a3f4ae7b8c2b5c","observation_id":"0937db5d-0aa4-47ad-872d-540f20f90442","resolution":{"observed_at":"2026-08-07T04:08:44.506110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.638326Z","title":"What does BERT learn about the structure of language?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.638326Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:88a192bc940ecbab6dcc355a02356bdfb29497cda10b00fca7920d66a9258386","observation_id":"0d159b50-7879-4346-a4b9-4b3d6b6049ed","resolution":{"observed_at":"2026-08-07T04:08:44.638326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.742392Z","title":"BERT: Pre- training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.742392Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:ec7e9d3789f37359833916914658ae4cc18b18e24cb0faa84fc36a8704a8e715","observation_id":"f7a40f94-b25b-4c85-be23-f6d1a752f0cd","resolution":{"observed_at":"2026-08-07T04:08:44.742392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.850613Z","title":"Feature pyramid networks for object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.850613Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:a70c9aa9d60facf98ee5f6d863efe47eaf394ed97c67d9d427c13b0605a43a13","observation_id":"82ead94a-b173-4027-b219-aa7e4f40108e","resolution":{"observed_at":"2026-08-07T04:08:44.850613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:45.304746Z","title":"Densely connected convolutional networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:45.304746Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:1ae3cdda295b6cb9302e19a8d492560fc49d6d0a0c28ac7089a2146252543bc0","observation_id":"5491a66c-cb13-49a4-befe-b504ac064462","resolution":{"observed_at":"2026-08-07T04:08:45.304746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:07.597114Z","title":"Deep layer aggregation,","venue":null,"work_id":"f05007ae-3067-42ef-91ce-26819fc6f528","year":2018},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:45.913961Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:90662b636c44e4f4f5b1f9c0990e5503cc95abccba6f6eb7282181c812eb2d4e","observation_id":"4ddf0667-663a-41c7-8681-a534e57566c2","resolution":{"observed_at":"2026-08-07T04:09:07.716660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:07.280142Z","title":"Segformer: Simple and efficient design for semantic segmentation with transformers,","venue":null,"work_id":"7f1487d0-8a07-438a-94e5-68fb8b197cb8","year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.004678Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f8b026540f9bf103ebfbc811d0d9cfaa040391c72b555015260a4aed6a296f50","observation_id":"81b656ed-2771-43e3-85fb-4b7858b5b7c5","resolution":{"observed_at":"2026-08-07T04:09:07.489616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:07.076120Z","title":"Clsr: Cross-layer interaction pyramid super-resolution network,","venue":null,"work_id":"35bedcb3-603a-4abd-9775-663a6b6bd4fa","year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.141424Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:6afda6e57a7d9ba2be589baa7af5c7b5ceb442d539c2a1dc31df020e20d33511","observation_id":"87038d9d-e3d1-497c-818f-f7eee285c3da","resolution":{"observed_at":"2026-08-07T04:09:07.169806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:06.811490Z","title":"Attention-based layer fusion and token masking for weakly supervised semantic segmentation,","venue":null,"work_id":"28b73589-3821-47a4-9a70-1e56ef16c775","year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.248925Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:18dae7a35d4e35fdf086606d0fdc8d61e68f5ae52f3f38933d8f7e477a8441d8","observation_id":"8239b6d0-30e7-47e8-acc0-fd8a21ec2a71","resolution":{"observed_at":"2026-08-07T04:09:06.932055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:06.527493Z","title":"Artificial- spiking hierarchical networks for vision-language representation learn- ing,","venue":null,"work_id":"1c0fbd57-e7cf-4ada-8ed8-8e2f944b3ea6","year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.355704Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d250c6f14d40266684aed38a87200840d9f1ae1ad7c62d35af4f47c9d53c4a77","observation_id":"f0638c7e-7665-4b3a-bd03-f89a1ae50506","resolution":{"observed_at":"2026-08-07T04:09:06.661838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:06.218455Z","title":"Deep contextualized word representations,","venue":null,"work_id":"ebc7f37d-84f3-4caa-916e-e2a7a38b3439","year":2018},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.461060Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:de06160df1afc92a7c57ff0fd1733aeb8370f6c4a4bd7e3479736308f748eb88","observation_id":"b1667396-7ca9-447c-87c5-2d97a56a6271","resolution":{"observed_at":"2026-08-07T04:09:06.341513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:05.882801Z","title":"Coarse-to-fine vision-language pre-training with fusion in the backbone,","venue":null,"work_id":"7b8c1312-efa0-4e88-adca-9ea4243b08af","year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.583941Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f7914edc4ab2a5a34ad78509d8c39cff10258b6dacad7ad75d016f0fff71539d","observation_id":"fc0fba08-fdf4-4305-a1d7-a34552aad9cd","resolution":{"observed_at":"2026-08-07T04:09:06.033250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13800","last_updated":"2024-11-14T23:53:05Z","snapshot_observed_at":"2026-08-10T12:32:54.282745Z","submitted_at":"2024-05-22T16:25:03Z","title":"Dense Connector for MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13800","snapshot_observed_at":"2026-08-07T04:08:46.709519Z","title":"Dense connector for mllms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.709519Z"},"links":{"cited_paper":"/paper/2405.13800","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:a6c27106c512abed1c01ea86b372abbdaa30ec90a45b9eba61094316fb651e84","observation_id":"9ea500f7-b2be-4f3c-a87b-5624dbf3905b","resolution":{"observed_at":"2026-08-07T04:08:46.709519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T04:08:46.824918Z","title":"Tokenpacker: Efficient visual projector for multimodal llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.824918Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:62a0c75f6a2f15e622472b3c4cc15136785d56463d75236de446aa5b28d5126c","observation_id":"c62664f3-9f31-4c76-a0de-2a28e1bfcca7","resolution":{"observed_at":"2026-08-07T04:08:46.824918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:05.629528Z","title":"Language models are few-shot learners,","venue":null,"work_id":"1c9f1c22-7d97-4dca-97cf-8461a60ff00a","year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.918627Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:91742a82332ea4a4a02cc55e38aa7f37bef22421e46311fba379bb6472ae8a17","observation_id":"2a35e3cd-6c1f-489a-9ae9-bbf020cf6cb9","resolution":{"observed_at":"2026-08-07T04:09:05.754466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T04:08:47.068817Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.068817Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:4ef81d59e210c447642376d4f498410dd050068babf0ebae910d78bb59a1f315","observation_id":"3e4e945f-0795-4c44-a2fd-3049636038b5","resolution":{"observed_at":"2026-08-07T04:08:47.068817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12819","last_updated":"2025-08-25T02:35:43Z","snapshot_observed_at":"2026-07-06T18:17:21.217971Z","submitted_at":"2024-05-21T14:24:01Z","title":"Large Language Models Meet NLP: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12819","snapshot_observed_at":"2026-08-07T04:08:47.189430Z","title":"Large language models meet nlp: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.189430Z"},"links":{"cited_paper":"/paper/2405.12819","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:75c44ea33b20581178c4a1a645ecec4b612c032d60eec64e6a83b42712f1c0ed","observation_id":"5b98f0a0-33cd-4afc-b40b-2d8e3fbbd78e","resolution":{"observed_at":"2026-08-07T04:08:47.189430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:05.424135Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"49ac3230-3116-4f27-8cd7-0e559a4becc3","year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.273636Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:6fe4990ebbb18fcf1980a0e1bd2867bb02a3c777a6933ebf77e7a7bd64262f2a","observation_id":"33ec15ab-e7f7-4152-8e89-546a98610b0d","resolution":{"observed_at":"2026-08-07T04:09:05.526388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:05.180865Z","title":"Introducing our multimodal models,","venue":null,"work_id":"3f0d1d73-ae46-4c90-8184-0a14df6c7b5b","year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.359818Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:28e6856c88bb21d4c37e254cb1d6e8bcf3592a91f9b9a03016442bb26ee205e7","observation_id":"f50a89ec-fb71-4975-87dd-9660679b2255","resolution":{"observed_at":"2026-08-07T04:09:05.298926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T04:08:47.490864Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.490864Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d0d04faa58c1ad3755d126a69fed4135784e76fd1658d36785a38e649663f634","observation_id":"ffe0c48d-d30c-467d-9802-8039d28c4610","resolution":{"observed_at":"2026-08-07T04:08:47.490864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T04:08:47.591621Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.591621Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:517f65a4e88b3e2c786bfa0b003353bb6a281f29e8ab8df22731498d8ff6d78d","observation_id":"0ed14fee-6450-4306-8821-431c65915b8a","resolution":{"observed_at":"2026-08-07T04:08:47.591621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-07T04:08:47.692121Z","title":"Oryx mllm: On- demand spatial-temporal understanding at arbitrary resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.692121Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:5b1ec5656e5c288227d3957011b0f8a57be5d9d2b1d3bad526b5040c18d0e4c8","observation_id":"f2c93c76-ca12-46eb-8d29-e800355ccd76","resolution":{"observed_at":"2026-08-07T04:08:47.692121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-07T04:08:47.795386Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.795386Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:8b130bfb04bee7e294d1fde3d43226bd5466873e0f9a52a7227a3156c8f22035","observation_id":"30c172e8-53e3-4dc4-9254-b71a08b7a65e","resolution":{"observed_at":"2026-08-07T04:08:47.795386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:04.947452Z","title":"When do we not need larger vision models?","venue":null,"work_id":"3f6f1b5a-a17b-435b-b819-a3493e26d520","year":2025},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.882134Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:e3050efd29fc1db2a814756ef8e187817a078a39e1515ec212a92f03ffea0131","observation_id":"fe259a9d-cf04-425f-93f8-ba3e61506701","resolution":{"observed_at":"2026-08-07T04:09:05.061995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-09T20:40:14.205704Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-07T04:08:48.010046Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:48.010046Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:89e14a3ba502ff606df6f7133efdcc7db58aa1f0761127914e3dae174143eb98","observation_id":"55ef876c-a123-4673-beb6-714e832d43db","resolution":{"observed_at":"2026-08-07T04:08:48.010046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:04.683879Z","title":"Honeybee: Locality-enhanced projector for multimodal llm,","venue":null,"work_id":"596a1d5b-56bc-4aac-9b5a-f7ac73f9dbca","year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:48.091130Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:838cd16d10efe36d56a9973809dbfa54c5a09e706509b2695caf1b74180c0a5d","observation_id":"3aac154c-821b-4d07-b583-e03cd288f6a1","resolution":{"observed_at":"2026-08-07T04:09:04.816456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:04.446262Z","title":"Unified language model pre-training for natural language understanding and generation,","venue":null,"work_id":"2e9a3434-addb-4c6b-9785-1a3fcef4e6c6","year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:48.226962Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:5f95e91798bc8571c095b31ba2ef07fc8846c02e7af664767bfe9ce8ae322bd7","observation_id":"0815b0f9-2125-4277-8e8e-d6211aecd15d","resolution":{"observed_at":"2026-08-07T04:09:04.564950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":87,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":143},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 143 outbound references and 0 inbound Pith citation observations for arXiv:2506.11515."}