{"as_of":"2026-08-18T17:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a8616bee5368064e0a978ca32f99ed9ba2c9ceef67f2164f47e921fe3f7f1b1","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:31:26.112925Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21741/citation-record","integrity":"/paper/2507.21741/integrity","json":"/paper/2507.21741/citation-record.json","paper":"/paper/2507.21741"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.446992Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"fc98369d-1c39-4283-b35a-dfd64f5386d6","year":2022},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.013359Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:d9d9f197a9b13ae2366a3b8c919323eb9df8f68f843f24d028a4b04b0d165143","observation_id":"9b290fad-7789-49b4-81c4-471ea9f4f717","resolution":{"observed_at":"2026-08-06T12:31:26.450246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.411157Z","title":"Uniter: Universal image-text representa- tion learning","venue":null,"work_id":"aa5fa57b-8b7c-492d-a436-6d393f74f43c","year":2020},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.029256Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:f4591014a8ce22086a033c03a7ed5926cfc656b5451ab6d784b750a5b0a91713","observation_id":"d6158cf1-a03d-4fa7-82d0-0b2f80fb5002","resolution":{"observed_at":"2026-08-06T12:31:26.414687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14517","last_updated":"2022-01-11T03:50:31Z","snapshot_observed_at":"2026-08-17T03:33:20.954386Z","submitted_at":"2021-05-30T12:34:17Z","title":"GeoQA: A Geometric Question Answering Benchmark Towards Multimodal Numerical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14517","snapshot_observed_at":"2026-08-06T12:31:26.032238Z","title":"Geoqa: A geometric question answering benchmark to- wards multimodal numerical reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.032238Z"},"links":{"cited_paper":"/paper/2105.14517","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:c8e586cd7a7b86c8c1e442cc1a97d9c553aee4682456f517c43399cb11e3ad0a","observation_id":"19b30b09-1918-4e97-9c92-8b68e719fc18","resolution":{"observed_at":"2026-08-06T12:31:26.032238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.038126Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.038126Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:5e1038ebef94a03ef67de312120fc88968cd4fb2395745d695f809273d2bbefb","observation_id":"f5cbb349-b375-4e07-979b-b13e43915fe4","resolution":{"observed_at":"2026-08-06T12:31:26.038126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.397083Z","title":"Instructblip: Towards general-purpose vision-language models with in- struction tuning,","venue":null,"work_id":"b81e9008-7b09-415f-bbfb-fc650da5abdb","year":2023},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.040867Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:da19d01e86a8c9bf6039bea804202436250b8db755d30aea4d9f4ffc79f9e18a","observation_id":"c1c8e38f-9a7a-46f5-88c9-4a4c482968e3","resolution":{"observed_at":"2026-08-06T12:31:26.399980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-18T03:47:41.144311Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-06T12:31:26.043505Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.043505Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:7209f7b52a01b8bda207495d1f94e4358f2532a60e410209b61cbecff6e49e6b","observation_id":"20f951cd-4963-4261-a512-14d0829a679b","resolution":{"observed_at":"2026-08-06T12:31:26.043505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.388493Z","title":"Mme: A comprehensive evaluation benchmark for multi- modal large language models,","venue":null,"work_id":"f53c3d74-cdd3-4d15-9bf2-5d2e7a97413c","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.046621Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:0afd98dfe6a868301a9efcb46265069985b103d600ce0a188bea3d0ad902c075","observation_id":"68acd8d9-cf1d-4eb4-b295-f68536314c2a","resolution":{"observed_at":"2026-08-06T12:31:26.391906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00352","last_updated":"2024-11-01T14:36:52Z","snapshot_observed_at":"2026-08-12T16:02:21.969968Z","submitted_at":"2023-08-01T07:49:10Z","title":"MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00352","snapshot_observed_at":"2026-08-06T12:31:26.049030Z","title":"Metagpt: Meta programming for multi-agent col- laborative framework","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.049030Z"},"links":{"cited_paper":"/paper/2308.00352","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:47628e961fac2ded0bbcd120e1e656d2000329851685a92e2993ec3bea966bba","observation_id":"a444735a-947f-4d70-b860-00624c37a323","resolution":{"observed_at":"2026-08-06T12:31:26.049030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T12:31:26.051888Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.051888Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:851718c7a46784fc1d81437d89ebff86ef0a34d1d48c07b853847f48ba5cfcca","observation_id":"8b4015ee-c20f-46d4-ab7a-afa9f0be0a91","resolution":{"observed_at":"2026-08-06T12:31:26.051888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.380266Z","title":"Dvqa: Understanding data visu- alizations via question answering","venue":null,"work_id":"5e9b1519-8e61-434d-af52-8584efe22f6a","year":2018},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.054721Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:e86fcfa4ccfc5d18d4eb598fd2f1247c8633af93b9d0876f48858b7fbe75d1c0","observation_id":"b2704b91-d00a-4a38-96a5-37ccec7f7ff1","resolution":{"observed_at":"2026-08-06T12:31:26.383131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04632","last_updated":"2021-08-18T21:55:27Z","snapshot_observed_at":"2026-08-16T18:18:37.695054Z","submitted_at":"2021-06-08T18:34:21Z","title":"VALUE: A Multi-Task Benchmark for Video-and-Language Understanding Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04632","snapshot_observed_at":"2026-08-06T12:31:26.059865Z","title":"Value: A multi-task benchmark for video-and-language understand- ing evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.059865Z"},"links":{"cited_paper":"/paper/2106.04632","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:d74bf1a25d0a93c381ea509fa84307a526482e2165f8ea36ee551ad96603f956","observation_id":"7ba075e9-3b99-40b1-8010-230270d6c175","resolution":{"observed_at":"2026-08-06T12:31:26.059865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.363319Z","title":"Blip: Bootstrapping language-image pre- training for unified vision-language understanding and generation","venue":null,"work_id":"2f552ed5-0867-4886-87cd-c8e20f4619af","year":2022},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.062802Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:9e12708f2cb099f80a00526b68b21a7a590a3b432e5eddb7672593590660dea3","observation_id":"1c167ae1-5c2a-43d5-825b-1f490f60785a","resolution":{"observed_at":"2026-08-06T12:31:26.366203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T12:31:26.065302Z","title":"Seed-bench: Benchmarking multimodal llms with generative compre- hension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.065302Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:482deb3561ab3a62b8d06af06587b5ba1513d24b28149efcc205e8508d78a083","observation_id":"1ba7ca47-eae9-479e-a316-ec72aeb044c8","resolution":{"observed_at":"2026-08-06T12:31:26.065302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T12:31:26.068491Z","title":"Evaluating ob- ject hallucination in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.068491Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:3eb9dfbb84245020321301707d5c5d7c55b1da5416a355b4d1ccac53e83b76da","observation_id":"76aa291a-bc34-46bf-a010-0976aa03728c","resolution":{"observed_at":"2026-08-06T12:31:26.068491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T12:31:26.071331Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.071331Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:9bc9f005845a65438ce38011e07724e32709f367c3d1e170396d18f7ff75b64c","observation_id":"ede1ea7f-a126-498b-8996-33326c899b63","resolution":{"observed_at":"2026-08-06T12:31:26.071331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-18T12:53:08.716441Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T12:31:26.074772Z","title":"Tokenpacker: Efficient visual projector for multi- modal llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.074772Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:5af9dfd7d701d745f8853cdf9ba6aeae9dcb544a4d0d7575e22bc2b8b76fecad","observation_id":"b04a3492-ffc0-4989-92c4-271b99e7bb8a","resolution":{"observed_at":"2026-08-06T12:31:26.074772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.353617Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"97f325f9-736a-4e13-bcba-ef6600a4992d","year":2021},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.080676Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:81f268513f1c9f4cffa6a963f5ab144fc5c769c836e75d8487cd721e562ea557","observation_id":"1dd6caea-b43d-4aef-9ce0-1164a14fa382","resolution":{"observed_at":"2026-08-06T12:31:26.356567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.345166Z","title":"Hello gpt-4o","venue":null,"work_id":"f81169c7-fea4-4e3a-9dd5-9179aad8f2fa","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.083312Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:009294501ff14dc8d7c1d574c5dfa454ccb3e1b92da06168d6544fab9033125e","observation_id":"0249a39e-5b92-43f2-8dc0-9867770aaaa5","resolution":{"observed_at":"2026-08-06T12:31:26.347968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.335231Z","title":"[Radford et al., 2021a] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al","venue":null,"work_id":"9ec348d4-4c74-4b26-a90d-12cbb40b3326","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.085780Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:5a79f1af45e88b05c40fe68ed5ddc3bcd9f6fb21e10e47f35255c47ee8af5d3d","observation_id":"d1136b45-0eb7-4423-b9cf-45ab13f36844","resolution":{"observed_at":"2026-08-06T12:31:26.338397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.326246Z","title":"Hug- ginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":"a9796681-f389-4f6e-978f-e893f547ce58","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.088243Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:66b0e9538f8e34df3ee7c470def4253b0f639e0915ac301a388759b95a3faefe","observation_id":"36f9e785-7302-4ec7-a97b-9e954a01647e","resolution":{"observed_at":"2026-08-06T12:31:26.329223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T12:31:26.091282Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.091282Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:3404288aa9953b4511324529090c4e19a9707fe63a86579f03b4ee4810a9e664","observation_id":"3fab29e7-4af2-4062-99ec-f3d863f35600","resolution":{"observed_at":"2026-08-06T12:31:26.091282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.317418Z","title":"Attention is all you need","venue":null,"work_id":"07eab816-1408-471d-b6ce-89611b59c4ff","year":2017},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.094018Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:81b630ef9381f47bd50490e0d7b9df1c38f22b0ea68dc994700f997bbf546a16","observation_id":"3a37acac-9ece-45ac-b4fd-db999bb3fd8b","resolution":{"observed_at":"2026-08-06T12:31:26.320574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.308901Z","title":"Introduction to convolutional neural networks","venue":null,"work_id":"05c97e05-3d4d-4138-99a4-8af5095a2b32","year":2017},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.099172Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:13ff3d3dfe5aa97a2e2bef523af24f508289f1866d7e298f32069fca07a9826b","observation_id":"af5e91bc-0260-4800-a078-d8b76e320927","resolution":{"observed_at":"2026-08-06T12:31:26.311833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T12:31:26.101813Z","title":"Deco: De- coupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.101813Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:de88c439954911a12d79e1d46bbf9a4a862df1a3d57dbfc244d9e43b353c1455","observation_id":"755eb3ef-c83d-46cc-b854-83e06da943dc","resolution":{"observed_at":"2026-08-06T12:31:26.101813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T12:31:26.104757Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.104757Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:36660e3a45187227d6887b5f128c7c8200e04b9ad3219f4a11ffcdd4cddcf7a6","observation_id":"601549d3-cebe-4ac9-940d-289cc83354ca","resolution":{"observed_at":"2026-08-06T12:31:26.104757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-06T12:31:26.107503Z","title":"Flo- rence: A new foundation model for computer vision.arXiv preprint arXiv:2111.11432,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.107503Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:f3c6217f3ecce87a689fd7c31360b0b4470a1badb14ac5a5fc874058d793382f","observation_id":"45b1656b-993a-4acb-a062-d5813e053d15","resolution":{"observed_at":"2026-08-06T12:31:26.107503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.300220Z","title":"Easygen: Easing multimodal generation with bidiffuser and llms","venue":null,"work_id":"3d626748-b71f-48ee-b20f-c2ef7447940d","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.110181Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:8da7423fecffd012da544818d27437d3118e5018b36d2d7a18840a5b8e04a831","observation_id":"41f0bfe4-120a-48ef-aa2e-b2bde586493c","resolution":{"observed_at":"2026-08-06T12:31:26.303148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.288702Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems , 36:46595– 46623, 2023","venue":null,"work_id":"fbc56544-374e-4628-9424-4429977d2e94","year":2023},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.112925Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:edf9ae256610edfc3e397905051c00e95c687318d977f8c08dca4ffad7f477c9","observation_id":"832fbd14-48b9-4ce9-a888-c694d51f440d","resolution":{"observed_at":"2026-08-06T12:31:26.293335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T12:31:26.096481Z","title":"Qwen2-vl: Enhanc- ing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.096481Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:fd1f165136685d872d12918b17d0acb3f75f843f3d0b6ccd46d8cd5a8656cc27","observation_id":"67244016-c8d3-4d9f-9475-48c2196fe6d2","resolution":{"observed_at":"2026-08-06T12:31:26.096481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.372151Z","title":"Ocr-free document understanding trans- former","venue":null,"work_id":"dd22663f-d85e-4809-8a7c-28c255ab277b","year":2022},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.057257Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:47d185f4beac3cb9d0f7b2cf0fd164118befe92797a57621f4b012c8f6ebb1b0","observation_id":"f39d8168-5047-4033-9f8d-a1275fdd40f3","resolution":{"observed_at":"2026-08-06T12:31:26.374882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.420658Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"0bf3a444-0c61-4ecd-ab58-57047fce57ae","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.026185Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:0ca4b16356bf63254354d69c225d9e1005625831c9fa1101f2589840e00eac78","observation_id":"e640e00d-ee1a-49ad-9e67-2782314a0c7c","resolution":{"observed_at":"2026-08-06T12:31:26.423521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T12:31:26.035221Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.035221Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:da7cce0f4698cb130ca98187ff3fcede9373b18bf8d8d94e1474e17398f10b23","observation_id":"bc5c1853-1c5a-4793-94e1-21bd4be5d566","resolution":{"observed_at":"2026-08-06T12:31:26.035221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.438286Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"ce242a1f-1ca4-455a-876c-bfc9b53d9dc3","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.016801Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:300e59a8db988b7fbb3bbe89dd6f241413de49769cfff630983f795abdd99b85","observation_id":"2a606dd0-01a3-457e-987e-de605d458991","resolution":{"observed_at":"2026-08-06T12:31:26.441144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.429083Z","title":"Language models are few-shot learners","venue":null,"work_id":"43571e60-3a19-4e94-afc4-23115545fd1e","year":2020},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.023150Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:5db240c5a51ffd878bad93b37349dcff817964407840d67d796905989518365c","observation_id":"9781c94c-d3a5-4783-b2cd-f10bc6e367d7","resolution":{"observed_at":"2026-08-06T12:31:26.432442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T12:31:26.019701Z","title":"[Bai et al., 2023] Jinze Bai, Shuai Bai, Shusheng Yang, Shi- jie Wang, Sinan Tan, Peng Wang, Junyang Lin, Chang Zhou, and Jingren Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.019701Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:79cb407973a2ed7e0a2d590c2ce28c74c89af6461836bd2fe4c1cbd1dc513cdb","observation_id":"fabbac7f-b0b7-49b4-a84c-845b2a2754cc","resolution":{"observed_at":"2026-08-06T12:31:26.019701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T12:31:26.077842Z","title":"Chartqa: A bench- mark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.077842Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:8ea2aff5132387e35b448666bab0f1c3cf291b6b83b557c6c464d3f2cccb6e24","observation_id":"a858a163-883c-4807-a054-80b7481666a0","resolution":{"observed_at":"2026-08-06T12:31:26.077842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.21741."}