{"as_of":"2026-08-11T10:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6dd0442a8dd67a3834c8643f7948a9a5e84f51bf89b8f0aff80b788433b49262","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:05:14.472756Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:36:56.248838Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:55:48.338931Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"cited_work":{"arxiv_id":"2502.01906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01906","snapshot_observed_at":"2026-07-01T14:55:48.338931Z","title":"Rethinking homogeneity of vision and text tokens in large vision-and-language models (D-Attn).arXiv preprint arXiv:2502.01906","venue":null,"work_id":"8403954b-0710-4439-a95a-d43f8989b89e","year":null},"citing_paper":{"arxiv_id":"2605.18359","last_updated":"2026-05-26T13:49:58Z","snapshot_observed_at":"2026-08-02T17:52:26.858372Z","submitted_at":"2026-05-18T13:12:50Z","title":"RAVE: Re-Allocating Visual Attention in Large Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T11:10:58.225078Z"},"links":{"cited_paper":"/paper/2502.01906","citing_paper":"/paper/2605.18359"},"observation_digest":"sha256:1800fc549af1a094b1ab84d4af0b6ddefba3957bac3dc61be7a1a3caf181e5f9","observation_id":"5edf4a9f-7223-4950-9f63-3642631244a3","resolution":{"observed_at":"2026-05-20T11:13:13.456501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"cited_work":{"arxiv_id":"2502.01906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01906","snapshot_observed_at":"2026-07-01T14:55:48.338931Z","title":"Rethinking homogeneity of vision and text tokens in large vision-and-language models (D-Attn).arXiv preprint arXiv:2502.01906","venue":null,"work_id":"8403954b-0710-4439-a95a-d43f8989b89e","year":null},"citing_paper":{"arxiv_id":"2605.18359","last_updated":"2026-05-26T13:49:58Z","snapshot_observed_at":"2026-08-02T17:52:26.858372Z","submitted_at":"2026-05-18T13:12:50Z","title":"RAVE: Re-Allocating Visual Attention in Large Multimodal Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:36:56.248838Z"},"links":{"cited_paper":"/paper/2502.01906","citing_paper":"/paper/2605.18359"},"observation_digest":"sha256:e5510df7e5c87df261e13df5517d5a3b1f5e92df6df148c2eb7e344a456e72c9","observation_id":"6161ec78-0fa6-4416-991c-7ef33d749c76","resolution":{"observed_at":"2026-07-01T14:55:48.340671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01906/citation-record","integrity":"/paper/2502.01906/integrity","json":"/paper/2502.01906/citation-record.json","paper":"/paper/2502.01906"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-09T14:05:14.290681Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.290681Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:70449fe015b061359b79ad7e9c3638404486b57adf457b60b7a70feb1ef30f0a","observation_id":"3b031cd4-e97c-437e-8af5-2f2722b14244","resolution":{"observed_at":"2026-08-09T14:05:14.290681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:14.295768Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.295768Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:439d8be4d172042d522b7ade97a54f2a7f85e78383e45bf5f669d8c9cf88701a","observation_id":"adceb6f2-2f75-4290-bab9-57dc011072c9","resolution":{"observed_at":"2026-08-09T14:05:14.295768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-09T14:05:14.300189Z","title":"Openflamingo: An open- source framework for training large autoregressive vision- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.300189Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:e62352ee9b68f26a0b537c88acd5b0c549a1301361cc4126685aebe51d0f81e7","observation_id":"80e6294c-3685-4764-ba54-1a13bfcc929e","resolution":{"observed_at":"2026-08-09T14:05:14.300189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-09T14:05:14.304523Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.304523Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:a5dabe60730a662a6ba4903b06d5787a77161ab0916c71eb05e993450712d00f","observation_id":"88d3230d-c0d5-4073-8b1f-2d8c5e271075","resolution":{"observed_at":"2026-08-09T14:05:14.304523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-09T14:05:14.308714Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.308714Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:c647b0052a9a37ec6c299b8d6577a659e31938e870ab722621c58b303c5dc398","observation_id":"e7e7d843-7f38-41b1-83b1-2eb4595de604","resolution":{"observed_at":"2026-08-09T14:05:14.308714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-09T14:05:14.312984Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.312984Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:6e63acde5851c7dd532a275906e5a182a7d3a26a90f9b3591edb2696e970160b","observation_id":"fa9ddf79-68dd-418a-90bc-41a8155328d9","resolution":{"observed_at":"2026-08-09T14:05:14.312984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.207527Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"12552056-eb5f-48d6-9420-b0883e8945d3","year":2023},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.317620Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:2df64caab5f9c37753bf8771313f22d2623be5dfaaab9cdbc341fc9ca93b004c","observation_id":"d3ff51b0-5a65-494f-881f-e2d71c255733","resolution":{"observed_at":"2026-08-09T14:05:15.211198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:14.321948Z","title":"Flashattention: Fast and memory-efficient exact at- tention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.321948Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:9e34a8073f507825aa8ab2968f352fd566b4dcf4ed84c4faf97a565ea1e086ea","observation_id":"192e3792-14de-446e-9c37-4b189678d361","resolution":{"observed_at":"2026-08-09T14:05:14.321948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-09T14:05:14.326040Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.326040Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:f3deb3bb1659f7eeabed82c95882309e34e012c05c0eb0582dfb4cbbef8d0738","observation_id":"c9cd7b00-ac84-40cc-88ef-97ac92ff8c1d","resolution":{"observed_at":"2026-08-09T14:05:14.326040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T14:05:14.330494Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.330494Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:53edb6fc820d97db5aea27b0a69e6d7a70afc45f7bacf5070ee1bae8607e24a7","observation_id":"17e4642b-7869-4e3d-8473-003ef59eb356","resolution":{"observed_at":"2026-08-09T14:05:14.330494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.188107Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":"6526ec44-dbc7-4aa9-9e91-651d871b03d4","year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.334854Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:c93a4cabbad30513e313da8ce14bf2cfd80aa9cbb1660553be904379b42694f7","observation_id":"c8464cba-c180-44c0-9735-26aad1a99455","resolution":{"observed_at":"2026-08-09T14:05:15.191778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.176047Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"8d0be68f-e736-4e0f-a3ea-525901df3fb1","year":2017},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.338911Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:d65ce093ec1e786183aa51492217923336a8dca0f61093d69422702f6125d2ee","observation_id":"ea370fc4-6ddb-4a39-9fae-a7d71f1b706e","resolution":{"observed_at":"2026-08-09T14:05:15.180349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.164535Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"26876a8d-197e-42c6-ba74-4671ff346a49","year":2019},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.343679Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:c2d69d6612d19df8ff1ded66524b19a841f0dfab5206a28f549af3ebd57ba316","observation_id":"f001ea89-c505-4f05-8e3e-aa88ff44479f","resolution":{"observed_at":"2026-08-09T14:05:15.168505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-09T14:05:14.347857Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.347857Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:d2be4c724773bf7c897c59b065a7ccfa98f3a0f74e2716c54168975187e7700e","observation_id":"09fd5c60-7e62-45a1-a745-39ff9e9c0b50","resolution":{"observed_at":"2026-08-09T14:05:14.347857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.153150Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":"c14088a3-a84e-4a9a-96fd-31d29e2fe6ca","year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.352337Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:e4bc6875a9e04461e87445019a4b4e12e1ae0f1a2ffa5ad223d548132e208aa4","observation_id":"a6589d66-e0a2-47d8-8bc5-26891dcdeee7","resolution":{"observed_at":"2026-08-09T14:05:15.157328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-09T14:05:14.356190Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.356190Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:e6d4f63cba83a091abc2ddcbb71a2ca4f5e04a87c38977335e13a6474e2bd341","observation_id":"e9b0923e-e273-4b18-816d-c3bf85ffb1f5","resolution":{"observed_at":"2026-08-09T14:05:14.356190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-09T14:05:14.359838Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.359838Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:10e258927fe4e5a001a72d071d1725302ac640997b10976a19ac56af1334b1ad","observation_id":"173997d1-1f41-4af4-a811-6f1d730820b3","resolution":{"observed_at":"2026-08-09T14:05:14.359838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T14:05:14.363667Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.363667Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:705177a56dbd13295c54480cf3b9bb0c169741c7b4c1acdf1780cd758ef9c1f1","observation_id":"9e54a25f-f822-42c6-aa14-b949d6a8f2cb","resolution":{"observed_at":"2026-08-09T14:05:14.363667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05949","last_updated":"2024-05-09T17:37:20Z","snapshot_observed_at":"2026-08-06T05:12:24.245722Z","submitted_at":"2024-05-09T17:37:20Z","title":"CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05949","snapshot_observed_at":"2026-08-09T14:05:14.367567Z","title":"Cumo: Scaling multimodal llm with co-upcycled mixture- of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.367567Z"},"links":{"cited_paper":"/paper/2405.05949","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:892e3e0775848f4331ee8507d9fbc32e512966375b04333cb941d37021c97efe","observation_id":"08265120-3b95-49cb-970a-de14a62c02b2","resolution":{"observed_at":"2026-08-09T14:05:14.367567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-09T14:05:14.371060Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.371060Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:3d2c617464290f9a1cae7309a6cf5cbc51a61c787d3faab45cb933c1b844d6b5","observation_id":"223e6291-37bf-4480-abcf-566f856630a3","resolution":{"observed_at":"2026-08-09T14:05:14.371060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.141587Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"aadd5195-0b81-48b0-a0a1-e6e7bae78853","year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.375645Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:67f971236ce67eeceed7be4637d9451a62c625425e25fb0503fd6e5965aad18b","observation_id":"417357ba-842f-48af-a660-a44b75d72d6d","resolution":{"observed_at":"2026-08-09T14:05:15.145461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.130191Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"3ec2ae03-d6a8-435f-bb4e-185b20fdf4b9","year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.379082Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:41d33a96c9c1529cf2f1b651054497a212fe3fdc2e51e4abdc2c50f5c3b5ec06","observation_id":"d4add187-c6aa-4103-beff-e29fcc2406c8","resolution":{"observed_at":"2026-08-09T14:05:15.134058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.118888Z","title":"Visual instruction tuning","venue":null,"work_id":"190fbcd4-7318-4f91-8881-29af10618818","year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.382727Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:bc14254f7247e0fbfe0debc32de90ce5ddca6a0998a5bc8f2dffe35c5cf65b88","observation_id":"433b69d9-cffa-421c-946e-a6b537f2c9ed","resolution":{"observed_at":"2026-08-09T14:05:15.122663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-09T14:05:14.386562Z","title":"Mmbench: Is your multi-modal model an 9 all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.386562Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:004dbee1dab7700598bed9b677c7b6bb203837fb1a91ada5fc65092a85497b00","observation_id":"159aa463-374d-4d50-bf25-dc282f902de0","resolution":{"observed_at":"2026-08-09T14:05:14.386562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:14.390358Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.390358Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:63c4d1798e2770a84e71f869b745ab1cccece2cf0c14a8bcc9cdc80406eb61b6","observation_id":"454579ff-d616-4d8e-a4ae-2d84fc731b64","resolution":{"observed_at":"2026-08-09T14:05:14.390358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.099570Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"5e329104-11b9-4729-866d-13b6652c36fb","year":2016},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.394583Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:f569bf207d115bbc2fce3cd242e3255749409b14535b35e5d435fa25449c00e9","observation_id":"2087160c-c19c-4a68-b326-69fbe4f4b50f","resolution":{"observed_at":"2026-08-09T14:05:15.103440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.086413Z","title":"Im2text: Describing images using 1 million captioned pho- tographs","venue":null,"work_id":"ee910171-eee9-479c-bae5-da4f6afafb05","year":2011},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.398367Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:96eaf6e9b8775ab0f1b0ec7aed2f95efab38d578693fca8a097f2b19fe53df61","observation_id":"0a838e0a-a8ac-4e61-a576-cb261aadd4cf","resolution":{"observed_at":"2026-08-09T14:05:15.091372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:14.401848Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.401848Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:c3f0e16aa04b616c7aecaa3c33f9036292a14c19457d6372b14120f740401591","observation_id":"298d547f-edea-4791-9c8a-c3972b2f4acd","resolution":{"observed_at":"2026-08-09T14:05:14.401848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.068666Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"b83c9484-e58f-4717-a01a-3e61895509c0","year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.405503Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:1c2ff79fe48bd5e37cb4516dbab375991055df820475f670ddcfe733af9a9f63","observation_id":"4f977e5a-79b0-4a48-ba80-7f0ccac233ef","resolution":{"observed_at":"2026-08-09T14:05:15.072188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.056613Z","title":"Deepspeed: System optimizations enable train- ing deep learning models with over 100 billion parame- ters","venue":null,"work_id":"7d5a2dae-4bdf-4f83-a2aa-b7e0b2f53127","year":2020},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.408785Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:6223820b09501fd3218c261ab67e9b799edfc5f978654fb5efb07668b24a3843","observation_id":"02a2530b-e778-49ae-a070-33c3f99b6b96","resolution":{"observed_at":"2026-08-09T14:05:15.060526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:14.412579Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.412579Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:a64f9c5351c939a0bdedafffb278954ab124a82cd3e33a27b93c31d9575adf29","observation_id":"ee7fec9c-38a3-423e-bd96-273086dfc69c","resolution":{"observed_at":"2026-08-09T14:05:14.412579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.038311Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"85dfc8af-2ce5-4479-abc0-d4755c5837da","year":2018},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.416558Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:f0d52177dbce8926c7361273899a607b38bcce1101da4f90afe67ec290c4f4ae","observation_id":"de7d92c9-5105-4721-ad2a-f8374590bd50","resolution":{"observed_at":"2026-08-09T14:05:15.042113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-09T14:05:14.420713Z","title":"Megatron- lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.420713Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:9b52454ec8e1809554040f9b2ae6d0e36a1f4c2777e970857db2bde5cae03625","observation_id":"9960457e-7d6a-4517-b50a-bbd2e35a012f","resolution":{"observed_at":"2026-08-09T14:05:14.420713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-09T14:05:14.424620Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.424620Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:1f15db58f67e02b34342b9dd8eac4efdc18ce5c63d61db9fc38c396da52e2a84","observation_id":"b44540fb-c5fc-4b17-b7b3-8a751062a856","resolution":{"observed_at":"2026-08-09T14:05:14.424620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-09T14:05:14.429018Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.429018Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:48a00cc6aa2b5c49d8a7d04f9b095bb7393ee6bea770b583860f1361ff8f70ff","observation_id":"ba9cbdde-fc6f-4357-a5c5-a4c2309de7d8","resolution":{"observed_at":"2026-08-09T14:05:14.429018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-09T14:05:14.433108Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.433108Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:6ccd3e70365ea43a025c475b44d80a552d91101e2081a37b5368cc67e4722843","observation_id":"89f04384-5289-4c8e-bff2-5b4a4ec89be1","resolution":{"observed_at":"2026-08-09T14:05:14.433108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.027422Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"ab15b515-c6ea-4872-818c-f39bed56bdef","year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.437779Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:e4957e98b847e30802eea749cea828422bf55d6fda7d2ab102fc77d5cecaf8c0","observation_id":"03869c0e-baec-44e3-8b76-a4125807fb12","resolution":{"observed_at":"2026-08-09T14:05:15.030824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T14:05:14.441568Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.441568Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:7d2b01884a74b8f3b51054cfc188a356411b043d8ddcfdd2806f3ed9199e2a74","observation_id":"ca2618b5-70a5-477b-9beb-1d596975b5e7","resolution":{"observed_at":"2026-08-09T14:05:14.441568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:14.445639Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.445639Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:50cf81511141dc4a27181a432cc4027b6739400fd4d3bb66588da9d17f4f2572","observation_id":"3841db45-5b6e-4a84-b4cb-5a59cc3f7c75","resolution":{"observed_at":"2026-08-09T14:05:14.445639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-09T14:05:14.450118Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.450118Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:8c0e945aa38eafa0ced935a2a04963de6e3c819de1a2564a6e6082abd2424c1c","observation_id":"9376278d-7200-45de-a595-6f5db885139e","resolution":{"observed_at":"2026-08-09T14:05:14.450118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:14.454269Z","title":"xgen-mm (blip-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.454269Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:807b4fafbb87d59950b724cc95082538492f70916607b316d6885b29939323b4","observation_id":"f1abfd77-5bdb-42aa-813c-93b7497d5419","resolution":{"observed_at":"2026-08-09T14:05:14.454269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:14.458648Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.458648Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:42e15d3e4e2ac738d2a846ee636f2cdc19f7c5aea36d41724e7a8833db3095aa","observation_id":"3fd189c9-7df5-44e4-9779-fc85c463905f","resolution":{"observed_at":"2026-08-09T14:05:14.458648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:15.000391Z","title":"Root mean square layer nor- malization","venue":null,"work_id":"debe9c39-892d-4f9c-b49f-ee6742f9dedd","year":2019},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.463392Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:030cc9ae13d822ac0fe48f50c13cb0ba442f12c69a3e38922b273d144ac05798","observation_id":"5354be34-96a8-4711-963a-93cfce087c8d","resolution":{"observed_at":"2026-08-09T14:05:15.004175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-09T14:05:14.467898Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual in- put and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.467898Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:6a689156a1dd6f15a808197efbd67460cc8b6483c4ee0b6b22bed04532f8a9a2","observation_id":"a6dbfcef-af61-40a4-b18e-79bfe137ddfb","resolution":{"observed_at":"2026-08-09T14:05:14.467898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:05:14.986966Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":"f3164dac-f56c-4b28-97e8-606f3860870d","year":2023},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.472756Z"},"links":{"citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:89e2fd403312c13ab740c8ee0934f57a4c57ef051f9c57a57d7d10c461ae86cf","observation_id":"9a114ea8-42d5-4c90-a50d-934f99259a63","resolution":{"observed_at":"2026-08-09T14:05:14.992477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2502.01906."}