{"as_of":"2026-08-10T10:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:786595fc54be877c02fd194e4eb72c08e50ed1d89e1d851fecdb9935b2eb0f94","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T12:23:40.585910Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.02406/citation-record","integrity":"/paper/2502.02406/integrity","json":"/paper/2502.02406/citation-record.json","paper":"/paper/2502.02406"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.403541Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.403541Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:18231c459d540b47efdde9d00eeeb33b32b6e2c0d8cb6f22a50d3e91c8f9ff2f","observation_id":"23cbddc7-6441-4224-8f25-fc14a084dbc9","resolution":{"observed_at":"2026-08-09T12:23:40.403541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.290601Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"d493d72c-4d42-4c81-ac2a-2472cb74f049","year":2022},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.409366Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:de349e6c57ded95113855895eadbf01c2c609ed84b00015649a1eca0e2d1cc3b","observation_id":"e68b4704-9172-4ff5-a8f0-b34c1ac43dd8","resolution":{"observed_at":"2026-08-09T12:23:41.294271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-09T12:23:40.414321Z","title":"W., Ilharco, G., Wortsman, M., and Schmidt, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.414321Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:9cfe36c18a9ea0f7f909460baba7cacaaf8be222f9c5726de23339eb421e4bfc","observation_id":"b4c60257-454e-4756-866d-3a71467c3e66","resolution":{"observed_at":"2026-08-09T12:23:40.414321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-09T12:23:40.420888Z","title":"E., and Cohan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.420888Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:d8d53eb72c58f1c7855ed67dedcc38add2b09d485972950ca6355a3a8a5cb8f7","observation_id":"aebbd7d9-714b-4fd8-9d13-9663f9ba0898","resolution":{"observed_at":"2026-08-09T12:23:40.420888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.279732Z","title":null,"venue":null,"work_id":"b4e3db25-4367-4261-8248-e21d0b483a64","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.425814Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:a6ca47db9b6150be01c78f2e0f4840e67c05eaf8af567c71f3c8e5f9d6805b0c","observation_id":"5318c903-e261-442d-ae39-3add2963c798","resolution":{"observed_at":"2026-08-09T12:23:41.283500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-10T09:51:12.852909Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-09T12:23:40.430129Z","title":"Striped attention: Faster ring attention for causal transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.430129Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:4f303fe14a53c937519d22c859662b15815296f66785af7fdfc945efde1559cb","observation_id":"441df307-bd25-4c85-acb1-14b589bc797c","resolution":{"observed_at":"2026-08-09T12:23:40.430129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.434769Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.434769Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:784c26273bf3f2f2371deb6dbb4e9bce711ac6687e3b9ea6f5aa2004d79f71c2","observation_id":"2e4acc3f-d938-4512-af51-bd0dea97e9e4","resolution":{"observed_at":"2026-08-09T12:23:40.434769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.261827Z","title":"Adapting language models to compress contexts","venue":null,"work_id":"cee1ab2e-8e15-47cd-8348-b299e45514ab","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.439586Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:0de3dded7149defe768f22644ff44abf9516dc17d6513e771fee1024c0c9493c","observation_id":"9df26055-1cd8-4052-94ac-2ce8b2a4c3f7","resolution":{"observed_at":"2026-08-09T12:23:41.266075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.443931Z","title":"M., Likhosherstov, V., Dohan, D., Song, X., Gane, A., Sarlos, T., Hawkins, P., Davis, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.443931Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:8bba12ad7e3e6e7d04b85f3f3810c13ea7bdeca2961cadb913bd85821173821f","observation_id":"7c55aa77-e64d-4ed6-afcb-cd2196b2a9dd","resolution":{"observed_at":"2026-08-09T12:23:40.443931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.244331Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":"f5aabe07-d663-4b4b-bccf-d1879c4fb603","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.448162Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:73c02bf3212d4e31dd16f4ebfadfce72ed1e535ca1b2d3ea0d858bc2a0f0b06a","observation_id":"be44c55a-50ac-41c7-b535-6ee346f5d340","resolution":{"observed_at":"2026-08-09T12:23:41.248285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.452814Z","title":"Flash A ttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.452814Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:d633c526e795ce2e64bc187b0473898d88dcf107a82a64702e0b947c7d32c0d9","observation_id":"55554418-4064-4083-ad50-9ffaf6b3814e","resolution":{"observed_at":"2026-08-09T12:23:40.452814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.456933Z","title":"Y., Ermon, S., Rudra, A., and R \\'e , C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.456933Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:4f5afacc9ff57eecb69d578f9a77ea34f7188d3e465190df4001dc6cd3a57904","observation_id":"cb45b3b9-ddf3-4fa4-8e70-4bd743cb4629","resolution":{"observed_at":"2026-08-09T12:23:40.456933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.220839Z","title":"S., Monga, R., Chen, K., Devin, M., Le, Q","venue":null,"work_id":"129243df-d21b-4200-9593-ee9de0b60a4a","year":2012},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.460640Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:09e6633c2936fe34b5d3414e4556d0c19c323d767f08f8e2845d2ef1ff03d978","observation_id":"94261df9-98b0-48d8-bc7a-1e5e3ce7da21","resolution":{"observed_at":"2026-08-09T12:23:41.224522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-09T12:23:40.464868Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.464868Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:e0f30135bc931b1da658a45deebdc54fa36e32a51ab1feb651b30b6928ef4cde","observation_id":"aedfadff-b42b-4e90-9a3d-fa558079e64d","resolution":{"observed_at":"2026-08-09T12:23:40.464868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.210149Z","title":"The design and operation of CloudLab","venue":null,"work_id":"db558bf5-8431-4120-b1c9-de3641f2c3a9","year":2019},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.469166Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:beeda30135930a60ea8c9a2c655876eda4fcba8948eb686cae0b58aaed262f16","observation_id":"d60cc123-5f52-4e57-800f-b4b14048891c","resolution":{"observed_at":"2026-08-09T12:23:41.213838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-09T12:23:40.472983Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.472983Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:3e0007955553c9c5eeaf15ba93334e77c42267507ac9858b6d572e0b0c20bfb8","observation_id":"3224933a-38ff-426d-b9eb-2025c44d3273","resolution":{"observed_at":"2026-08-09T12:23:40.472983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T12:23:40.477312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.477312Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:7c418e28d04a19fd1cbf9860ba9845cb07f5f831bbeab85757ca89b6b7208a48","observation_id":"c7b5788d-0ecb-4cae-808c-301145995424","resolution":{"observed_at":"2026-08-09T12:23:40.477312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73010-8_23","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Llava-uhd: An lmm perceiving any aspect ratio and high-resolution images","venue":"Lecture notes in computer science","work_id":"e707fd01-bc1e-42f3-a986-4ccd98532e22","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.481945Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:75961ae7db9432e9b2646fc0f27af4120757fee149655058612f6f79b7de4cc8","observation_id":"eeeeecb0-6ee5-478b-bb91-1eac35ee2559","resolution":{"observed_at":"2026-08-09T12:23:40.634688Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.199567Z","title":"K., Jia, M., Cao, X., Shah, A., Shrivastava, A., and Lim, S.-N","venue":null,"work_id":"e60d841e-0805-4e61-9aad-c4b2ed897312","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.485838Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:30c382c7038f4946ebb4a26fb01c867c6c08c960253c3b418497d68888ab25c3","observation_id":"1d2b86f3-3ce3-49ee-bac1-a38a8925cbb3","resolution":{"observed_at":"2026-08-09T12:23:41.203438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13250","last_updated":"2024-05-16T12:23:05Z","snapshot_observed_at":"2026-07-06T17:33:00.716054Z","submitted_at":"2024-02-20T18:58:54Z","title":"Video ReCap: Recursive Captioning of Hour-Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13250","snapshot_observed_at":"2026-08-09T12:23:40.491200Z","title":"M., Ho, N., Yang, X., Nagarajan, T., Torresani, L., and Bertasius, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.491200Z"},"links":{"cited_paper":"/paper/2402.13250","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:98d1f1f34cb146ea4b1fc523377e0bc6fae19f678382ee2e4da7cc8d9bab8694","observation_id":"e1ddd6bc-bfa5-4fc8-9098-56725910e111","resolution":{"observed_at":"2026-08-09T12:23:40.491200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.495082Z","title":"A., Tanaka, M., Zhang, C., Zhang, M., Aminadabi, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.495082Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:74a13e5e85c8e24853eed4684a685180f532526668606b6f9606b3d41a0ec35b","observation_id":"63d306a6-146e-47f2-b971-f1a38d53bb57","resolution":{"observed_at":"2026-08-09T12:23:40.495082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.498688Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.498688Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:815aa2e56e837a5a7910a26e3456233b5823ae352cd3001acc504ae659ec2bd3","observation_id":"9ee31d37-2d85-4086-9cd2-7a58eb10fbae","resolution":{"observed_at":"2026-08-09T12:23:40.498688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.182269Z","title":"A., Casper, J., Lym, S., McAfee, L., Andersch, M., Shoeybi, M., and Catanzaro, B","venue":null,"work_id":"d85247da-9835-434b-a00f-f4bac6944dbf","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.502235Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:da8f388df1d88bbd0c933067860dbbba4ef4d6c468468d96ae8b2600a3cb1470","observation_id":"dd60d2e3-059a-452a-a70d-ae25d0daed60","resolution":{"observed_at":"2026-08-09T12:23:41.186213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.171445Z","title":"A., Casper, J., Lym, S., McAfee, L., Andersch, M., Shoeybi, M., and Catanzaro, B","venue":null,"work_id":"7e28e92b-9df9-42f9-96a2-dff5a0c2b944","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.505912Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:679293cd434e01f2762ebcfece2a55ca5872d162dd8cb01abd7a11bf36f45450","observation_id":"7f6189eb-792e-44ad-a149-da35816a6ff4","resolution":{"observed_at":"2026-08-09T12:23:41.175383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.160690Z","title":"M., Kiela, D., Cord, M., and Sanh, V","venue":null,"work_id":"769c6134-6d7f-4acf-911a-8cf1ad0bf51e","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.509643Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:2b4c2ad429bab23675ef6d998fd545f7f45df7b13e4c0bf9b4bbe8d617d8946b","observation_id":"83f57cc7-d32f-477a-9dda-d00ed98de030","resolution":{"observed_at":"2026-08-09T12:23:41.164568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-09T12:23:40.513418Z","title":"Mimic-it: Multi-modal in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.513418Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:1d2f9335ba852af01d4db7d9db098da93a428e0fd630f79458dfe22991788976","observation_id":"2460e5a7-2fbb-46b3-a919-30a1280278e6","resolution":{"observed_at":"2026-08-09T12:23:40.513418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.149992Z","title":"P., Ma, X., Stoica, I., Gonzalez, J","venue":null,"work_id":"005cad87-7dd9-4839-a6a7-d7713e880706","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.517456Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:cd9efb56e0ef294c084908b0f0855442a8222692ca3ef5490d0a8563e57118f5","observation_id":"d60026c8-84b5-428f-9b58-d1c9ec52e47d","resolution":{"observed_at":"2026-08-09T12:23:41.153717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.139241Z","title":"Blip-2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"0f91c659-4000-43a9-8e59-b5c1f228b6be","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.521288Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:cd68ff0da95040e62b9af938389c8ad263dd935102e768366cb288d101991b4c","observation_id":"be1f82a0-b4b0-4d61-bfd9-1e27e0cb9e6d","resolution":{"observed_at":"2026-08-09T12:23:41.142932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.128198Z","title":null,"venue":null,"work_id":"9197c195-804c-4278-88de-edf77403c965","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.525030Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:c01ea191aca348ff9600c60bf633027e514b6518a41de19f47030f9e5b1c9c9f","observation_id":"fd1e80ac-e63a-4310-a9a9-39bf3e74e556","resolution":{"observed_at":"2026-08-09T12:23:41.132089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.117315Z","title":"Ringattention with blockwise transformers for near-infinite context","venue":null,"work_id":"7cfd635a-8d05-46b5-b99a-182e95c7d711","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.528809Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:ea7a5cf01f22b1081850c6142b26ed33f1562fae14597233902653bee5a52e83","observation_id":"d7881f19-2f4d-4c98-a88c-a836db4bedd2","resolution":{"observed_at":"2026-08-09T12:23:41.121090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-09T12:23:40.532423Z","title":"Nvila: Efficient frontier visual language models, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.532423Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:e4db9bf56cb8e3f354c05e02c6c481c3f1a1c7ccf7e3abd455413885f291b1ae","observation_id":"e6297378-2b6d-428a-b06c-488d05e77eee","resolution":{"observed_at":"2026-08-09T12:23:40.532423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-09T12:23:40.536435Z","title":"Leave no context behind: Efficient infinite context transformers with infini-attention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.536435Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:6b67763882c51731376c188e6d7d87001407b02ef79be2c53c5dfa3d8c95363f","observation_id":"a8989cd5-06b8-40c3-b946-9947e56522ca","resolution":{"observed_at":"2026-08-09T12:23:40.536435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.540566Z","title":"R., Ganger, G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.540566Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:a3c49fd404af976570cf06e50cbe704e60a2b8c519d6aeb28071a7cc0b9e3560","observation_id":"b5554898-8713-4103-9a92-9742951063dc","resolution":{"observed_at":"2026-08-09T12:23:40.540566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.106066Z","title":"Momentor: advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"9f40871b-d87d-43c8-a302-6a02761f09d6","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.544509Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:f7cf48e271b81bb4807379e70b05ed42181b6e9b0f890903b5104d6f371dc4f7","observation_id":"74ddb37f-4cc6-4e0e-9864-635d472ea920","resolution":{"observed_at":"2026-08-09T12:23:41.110012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.548348Z","title":"ModServe : Scalable and resource-efficient large multimodal model serving, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.548348Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:cac55d092ed2add654b9f0bc47390cfd6a707e50da6864121c530084a793f0b6","observation_id":"db78e0b2-276a-4709-99f1-bd534e6608c5","resolution":{"observed_at":"2026-08-09T12:23:40.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.094881Z","title":"Zero: memory optimizations toward training trillion parameter models","venue":null,"work_id":"5d11c534-60b5-475d-a102-45fed3dbcc90","year":2020},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.552540Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:32cc90788af37910e0e1a1798e105a7439004a4401340eb3bc8c357baa19f885","observation_id":"06db48e3-66b4-4590-8a0d-9129585b9bbc","resolution":{"observed_at":"2026-08-09T12:23:41.098690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-09T12:23:40.556139Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.556139Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:a5466f87ff9de0b1e3557d60ec76bfda337a880eb4426d5b80569119641cbb0a","observation_id":"379d8cdf-8b39-4175-8596-df4581f53c59","resolution":{"observed_at":"2026-08-09T12:23:40.556139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.083490Z","title":"Repository-level prompt generation for large language models of code","venue":null,"work_id":"be74fffb-35e5-4d1d-bdbb-9f13aacb7735","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.560141Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:dd0568e21011d0186cbc1cae9c1922bcfe1b4f80b99fc14faaa61a2d72de5058","observation_id":"ba04c592-e6b8-4068-9537-dc810042bf83","resolution":{"observed_at":"2026-08-09T12:23:41.087584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.070864Z","title":"PEARL : Prompting large language models to plan and execute actions over long documents","venue":null,"work_id":"66b5ed76-a2dc-45a3-bbaa-9672e7d54872","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.563745Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:7e25eb025cbed64ae9e42e5490bfef0754181083490b36fdf1d58ab495cb0e05","observation_id":"6895e989-0ca5-4de7-a58c-b953c8279411","resolution":{"observed_at":"2026-08-09T12:23:41.075061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.567345Z","title":"T., and Cox, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.567345Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:4f936a5bf0624d438a5ddc190db932ab0ff55d1c01d2ae89d7316663fa92c8a6","observation_id":"a06ddf6a-335b-4569-b1f9-33d6e3a8227d","resolution":{"observed_at":"2026-08-09T12:23:40.567345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.570913Z","title":"N., Kaiser, L., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.570913Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:84d2f17afd122d6e3c7eae8eb716ba03e38490bbc1e8653082d3b5cf38b8aeef","observation_id":"835f1694-a240-4085-bdad-6310f2cb8dbf","resolution":{"observed_at":"2026-08-09T12:23:40.570913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-09T12:23:40.574541Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.574541Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:74f063b882848979bebf2332b954d7134f0035c063cfe8ecd38ebb056bcc30c6","observation_id":"c1dc54ac-ab78-4c1f-acee-58b39e7581c2","resolution":{"observed_at":"2026-08-09T12:23:40.574541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.054192Z","title":"Big bird: transformers for longer sequences","venue":null,"work_id":"e07a67e6-35f7-4b56-acab-17566e7a6526","year":2020},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.578333Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:ac96950950953f924ae856764ca731c34915a53ee12c8c8b28e12f680fe7a6c0","observation_id":"5c79bfde-886f-459b-bfcf-e69046163793","resolution":{"observed_at":"2026-08-09T12:23:41.057941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.582047Z","title":"R epo C oder: Repository-level code completion through iterative retrieval and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.582047Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:7d57184c42d691975f60fb063649ad1a8f515657a501b9558dd98bda21e8fccf","observation_id":"5bd7e58e-7aff-40c9-ac3c-fb150b07ea85","resolution":{"observed_at":"2026-08-09T12:23:40.582047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.585910Z","title":"Mini GPT -4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.585910Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:72e20d007bc07523bc756ce6e7a7d92e117669bd2a9bf19a8865b92596782f93","observation_id":"da7a0ffc-6d1b-4c9c-9f65-a080c283e80c","resolution":{"observed_at":"2026-08-09T12:23:40.585910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2502.02406."}