{"as_of":"2026-08-10T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:686218aae9ec4d6c4d32ae49dc61074361a808b03865da26ff28215f7cceb0c4","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:38:32.385290Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:46:51.573559Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T23:04:01.690792Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02279","snapshot_observed_at":"2026-08-02T20:14:05.183330Z","title":"Laco: Efficient layer-wise com- pression of visual tokens for multimodal large lan- guage models.arXiv preprint arXiv:2507.02279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00198","last_updated":"2026-07-01T00:40:56Z","snapshot_observed_at":"2026-08-08T00:25:26.077628Z","submitted_at":"2026-02-27T08:11:06Z","title":"Stateful Token Reduction for Long-Video Hybrid VLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:05.183330Z"},"links":{"cited_paper":"/paper/2507.02279","citing_paper":"/paper/2603.00198"},"observation_digest":"sha256:a5164e5cc18f9cc62423fc50ee63e4a1720db8a8d1d9f78194a0566f2ec3359e","observation_id":"de24ad38-9c42-4984-a9d0-dc8f4eec8aa1","resolution":{"observed_at":"2026-08-02T20:14:05.183330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.02279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02279","snapshot_observed_at":"2026-06-29T23:04:01.690792Z","title":"LaCo: Efficient layer-wise compression of visual tokens for multimodal large language models.arXiv preprint arXiv:2507.02279, 2025","venue":null,"work_id":"b4d83a8d-3ad0-4b23-bef3-915d3f3127ce","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":207,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2507.02279","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:68b26360e332e0ece2b0c6604f1cbb3951ccf6a575795f1bd9f4ebc63ab9fe9a","observation_id":"181c232c-4435-47c8-bb9d-5b6f28653334","resolution":{"observed_at":"2026-06-29T23:04:01.692379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02279","snapshot_observed_at":"2026-08-04T23:46:51.573559Z","title":"arXiv preprint arXiv:2507.02279 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.573559Z"},"links":{"cited_paper":"/paper/2507.02279","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:820e43f825109be3c2bb077f93642ba9dfdf7f8a230ba7d7a52738bcad7d6730","observation_id":"a3c4e44a-af0c-4238-9ed0-9d3ae8b95f91","resolution":{"observed_at":"2026-08-04T23:46:51.573559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02279/citation-record","integrity":"/paper/2507.02279/integrity","json":"/paper/2507.02279/citation-record.json","paper":"/paper/2507.02279"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T20:38:27.564674Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.564674Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:c5443d794074c54b9a61bf6f7ae760aa0ae4c34de47fb943354754043de55e46","observation_id":"45eb87ab-6ff5-493e-a973-cf7ec64bea59","resolution":{"observed_at":"2026-08-06T20:38:27.564674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.745863Z","title":null,"venue":null,"work_id":"91873c39-f082-4fcd-ba64-34ffff7dea98","year":2021},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.608723Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:c99e55a017be37d1f728c03d6a4eb9231c0935f1d207e9a7e0dbd3062a41127c","observation_id":"96eb1822-64cc-4d7c-84a2-ac44ece64baf","resolution":{"observed_at":"2026-08-06T20:38:36.847545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T20:38:27.710290Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.710290Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:e2470f3bfb2f93076dc40ce111e2cf92cf84caf8ae681f3609be9c8897d58ba9","observation_id":"7d6fbd43-f331-4876-80a2-74e42192b808","resolution":{"observed_at":"2026-08-06T20:38:27.710290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.571370Z","title":"Lang, Sourabh Vora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yuxin Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"f8125af1-b66b-4eeb-815e-c32c16e88e75","year":2019},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.786377Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:2e19aa3a05d27ab4bce5c46937449d4b28b0e3e5dc8799108fa1bd3e8ca80eba","observation_id":"56be8d51-f16c-42ba-8ff6-0a3146a356c9","resolution":{"observed_at":"2026-08-06T20:38:36.660592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.369944Z","title":null,"venue":null,"work_id":"c3abaf50-d97a-4bea-8eed-1f85dba7982f","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.867184Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:19ffcd269d051ccc00dd5da5678734c3f228688c6c50d892fab551a740a4d1cd","observation_id":"77b8ae74-2198-4544-ae4a-36cf17682180","resolution":{"observed_at":"2026-08-06T20:38:36.463665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-08-08T21:24:29.917572Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-06T20:38:27.955343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.955343Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:8e64b995af1f3ceb1fe4d13c05c65ed8c474f552e4715a49aed091245dcecbc8","observation_id":"4bd692fd-34dc-4c9c-b8cf-9769beced048","resolution":{"observed_at":"2026-08-06T20:38:27.955343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.186684Z","title":null,"venue":null,"work_id":"b52f3885-0232-47d4-939a-718b90a01cb1","year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.050513Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:dfc4db231914cce24695ecd022b2bde907ff777432cdeffdc8d7735e22d91284","observation_id":"6613ff63-f640-43a2-9ede-d4c90e2959af","resolution":{"observed_at":"2026-08-06T20:38:36.279083Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.026641Z","title":null,"venue":null,"work_id":"90cf60fd-ff0f-4fd6-bb0b-71e5ba0dbe13","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.116856Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:0aedf16c4d3e60cb0e1e6770f01e559567604b16559acf34fc75da328c8b273a","observation_id":"75d88921-2c27-4bab-85c8-9e2c495c3aa1","resolution":{"observed_at":"2026-08-06T20:38:36.099822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T20:38:28.170493Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.170493Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:9bdfdd85e3603fc8de0c5babdc5351a11a2d92d37531494829fd241df087ebf3","observation_id":"caede71e-f96d-48ed-a41c-f6beb86262e0","resolution":{"observed_at":"2026-08-06T20:38:28.170493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T20:38:28.234804Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.234804Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:db855773a2bf10b1307bbf6478e60c8465cec74fbe85ed297ee3755ad01cdb8a","observation_id":"e1e7c77a-1365-4953-b547-1bc2f226a3bb","resolution":{"observed_at":"2026-08-06T20:38:28.234804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-06T20:38:28.279660Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.279660Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:0087cac33ed60e5e9b576c3d57a8ac9b4ae434bb097de5f3ad6df982e3bf48d8","observation_id":"cd48b81d-8482-4fdd-a5c7-a0573699a3de","resolution":{"observed_at":"2026-08-06T20:38:28.279660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13315","last_updated":"2024-08-17T11:56:08Z","snapshot_observed_at":"2026-07-06T17:47:30.518562Z","submitted_at":"2024-03-20T05:37:24Z","title":"PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13315","snapshot_observed_at":"2026-08-06T20:38:28.365050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.365050Z"},"links":{"cited_paper":"/paper/2403.13315","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:6a020c5ac8b571e77e251f5030829f4f218178bad6564266cf4251ac99bd85a5","observation_id":"bd4da050-87f3-4fbe-a149-ff457942a408","resolution":{"observed_at":"2026-08-06T20:38:28.365050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-06T20:38:28.429443Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.429443Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:86502de960ff184e63c3cd223527ef6e4b399ae931110202674cb547a72f942b","observation_id":"6f6ae646-e0b0-4d41-84a5-e53dd7dd9545","resolution":{"observed_at":"2026-08-06T20:38:28.429443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T20:38:28.510632Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.510632Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:9efeb999af0a972a6da97fd45061d04ccb2ad811254d96bbc18f682e27fc6b6e","observation_id":"bc6868f7-3f3d-4eb3-beb1-bd800e08d314","resolution":{"observed_at":"2026-08-06T20:38:28.510632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T20:38:28.573025Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.573025Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:e0ffacbb65aa7f067de4f5764ed1255542a616ee86292d608fb984a57eb9aeb4","observation_id":"c3e5d3dd-996c-4798-870b-8f3b917fb0bc","resolution":{"observed_at":"2026-08-06T20:38:28.573025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-06T20:38:28.632831Z","title":"Susskind, and Alaaeldin El-Nouby","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.632831Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:0223ba90fef617236b20093fc32081fe88ee609639a47c21b5bb3a2ea78e64ac","observation_id":"a26c49c9-2976-4085-b180-0cb9d3af72cb","resolution":{"observed_at":"2026-08-06T20:38:28.632831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T20:38:28.675201Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.675201Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:55ba09d4f831170211cfc4700af4fc6f244213d99771b8764871b68c7ab056f1","observation_id":"d9b2e771-522f-4535-b467-592bbc13bcc1","resolution":{"observed_at":"2026-08-06T20:38:28.675201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-06T20:38:28.730737Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.730737Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:de1820e15f58f073751341c927e3a18e30a4ed7aa04ba383a1975376fbbfab29","observation_id":"e1a4f98a-1838-4266-8391-2cfa32afdb38","resolution":{"observed_at":"2026-08-06T20:38:28.730737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12981","last_updated":"2023-07-24T17:59:02Z","snapshot_observed_at":"2026-08-03T03:13:48.042761Z","submitted_at":"2023-07-24T17:59:02Z","title":"3D-LLM: Injecting the 3D World into Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12981","snapshot_observed_at":"2026-08-06T20:38:28.791020Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.791020Z"},"links":{"cited_paper":"/paper/2307.12981","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:9b0497078632ccf6fabca24c111c563ea9a4ce7921765db6d9d54dc425f6ffa2","observation_id":"f6c081ea-a824-4099-9d7e-dffb9f08d1b4","resolution":{"observed_at":"2026-08-06T20:38:28.791020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10584","last_updated":"2018-08-31T03:15:28Z","snapshot_observed_at":"2026-07-06T06:58:27.332918Z","submitted_at":"2018-08-31T03:15:28Z","title":"Learning to Describe Differences Between Pairs of Similar Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10584","snapshot_observed_at":"2026-08-06T20:38:28.839944Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.839944Z"},"links":{"cited_paper":"/paper/1808.10584","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:d0027427ae9c6b067b6574a4aa83d03f6a3a94802b2ff9058ca561c6513310b5","observation_id":"684a27d0-e59a-4b31-838d-91b7f8f1041e","resolution":{"observed_at":"2026-08-06T20:38:28.839944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T20:38:28.915132Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.915132Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:2010c4af25037125ab29db9c13acf641f2ceb451d81c0198084bd4ec038981aa","observation_id":"96fb4c26-88ca-4001-acb5-51d0716555fa","resolution":{"observed_at":"2026-08-06T20:38:28.915132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.07396","last_updated":"2016-03-24T00:02:58Z","snapshot_observed_at":"2026-08-07T19:22:55.853637Z","submitted_at":"2016-03-24T00:02:58Z","title":"A Diagram Is Worth A Dozen Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.07396","snapshot_observed_at":"2026-08-06T20:38:28.998815Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.998815Z"},"links":{"cited_paper":"/paper/1603.07396","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:5228e99007fa85b9e462bd94d06d10c23caed18ea9706c1d417ec5ebd2f008da","observation_id":"18b1bc50-ac44-491b-acfc-06a6ae011c74","resolution":{"observed_at":"2026-08-06T20:38:28.998815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02745","last_updated":"2025-08-06T07:03:19Z","snapshot_observed_at":"2026-08-10T00:01:03.669691Z","submitted_at":"2024-09-20T10:50:21Z","title":"AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02745","snapshot_observed_at":"2026-08-06T20:38:29.091565Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.091565Z"},"links":{"cited_paper":"/paper/2410.02745","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:4277c5df8a58a3f0038ddb0ee5e206a270d2e6fb6a1be95489c978f6ccd1b287","observation_id":"ea5fccea-bfb3-473f-a75a-2b4aa61e554d","resolution":{"observed_at":"2026-08-06T20:38:29.091565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:29.185593Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.185593Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:cfc2cb05190625f9680520cc9562abc4ee3152f05a345387d95c5673c5b78870","observation_id":"a9809df1-5b6a-4630-8349-c8edef12dc28","resolution":{"observed_at":"2026-08-06T20:38:29.185593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T20:38:29.262223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.262223Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:3e59289c4b1c0172c16c35db874d4c05c0ae39efa236aecbeb96467f4ead0c61","observation_id":"01d5f8f4-2618-49d7-8e6d-ff9664f1b977","resolution":{"observed_at":"2026-08-06T20:38:29.262223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T20:38:29.356941Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.356941Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:8d29c4a41ce20b0716fe246767779e1bfafd16abf9031ef7af846f5f3709bb16","observation_id":"f51bc516-a37c-4429-bd80-b08dcedba05f","resolution":{"observed_at":"2026-08-06T20:38:29.356941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T20:38:29.433115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.433115Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:df9e4a32414400eb2fcf543b0167da2f31428d60ddd7e05bc25f401e5a5f8b51","observation_id":"34958276-5601-46d2-a9fe-fc054773bdba","resolution":{"observed_at":"2026-08-06T20:38:29.433115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.926453Z","title":null,"venue":null,"work_id":"e82db2b7-0cbf-44d8-8446-cb593775e557","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.493720Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:094054e5352a2691d7ffec269d6134623063492056d71853012256a0ce3375b0","observation_id":"ff1baa90-96ec-421e-b2f2-4d87c4cdd1f2","resolution":{"observed_at":"2026-08-06T20:38:35.974131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T20:38:29.543299Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.543299Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:8a5be9b16c5c4687f8029bddd75f8fda1a63b200ceff8d246bf663cbe5768de5","observation_id":"c934db64-3e50-42a6-b795-2596f8f744e4","resolution":{"observed_at":"2026-08-06T20:38:29.543299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.766090Z","title":null,"venue":null,"work_id":"28d67c8f-bf75-420a-90ad-798767510fd6","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.601889Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:6ae8f6253fc9957c60fabd47537147ec6f14cfaa3e8cdc2f88fbe6ba2013da06","observation_id":"3402898e-e1b4-46ec-bee6-7ef9ab791b52","resolution":{"observed_at":"2026-08-06T20:38:35.857868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.560684Z","title":null,"venue":null,"work_id":"0d633d8b-cb27-428f-840d-b9c656776131","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.707324Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:e1024abd3b1c565f320372c3c846cca23dfd540201369b8e99ba1868af335cbf","observation_id":"f2a2ffec-66df-4cda-a57d-fab3e0840b24","resolution":{"observed_at":"2026-08-06T20:38:35.670119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:29.802220Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.802220Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:71d85b45388c50fe1aa530c79931805ce4bfd3d40f94c426b8ca5fe6c77a7895","observation_id":"e87ff870-e169-4340-b05f-d5365e1ee444","resolution":{"observed_at":"2026-08-06T20:38:29.802220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T20:38:29.866140Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.866140Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:59b473b73a6dedbd0378ecc0fbaf9514237d0268e072710b42e84ff2ce328e52","observation_id":"9ce3b2bb-fc0d-4ffc-9dd8-2b404bf4b475","resolution":{"observed_at":"2026-08-06T20:38:29.866140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07306","last_updated":"2023-11-13T12:52:29Z","snapshot_observed_at":"2026-08-03T21:40:55.534458Z","submitted_at":"2023-11-13T12:52:29Z","title":"What Large Language Models Bring to Text-rich VQA?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07306","snapshot_observed_at":"2026-08-06T20:38:29.985659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.985659Z"},"links":{"cited_paper":"/paper/2311.07306","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:82737818bfab3dfab11607fb113cc8b1e24a4c91d73a0000f10f7e80623413b8","observation_id":"6e178c9b-eb14-4504-aba2-7da9adfe3b1b","resolution":{"observed_at":"2026-08-06T20:38:29.985659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.292864Z","title":null,"venue":null,"work_id":"8b73116a-0d5a-4da7-ac33-0ba1ea83ee4c","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.023977Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:bf2f4528bc3a5b89d9f7d3f44e443fcf6835950280f6309267a470bc6b1dc58d","observation_id":"8b7a0d1f-f32b-45fc-bde1-3cc079cb8293","resolution":{"observed_at":"2026-08-06T20:38:35.424039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21307","last_updated":"2025-03-27T09:31:35Z","snapshot_observed_at":"2026-08-07T16:33:24.689717Z","submitted_at":"2025-03-27T09:31:35Z","title":"InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21307","snapshot_observed_at":"2026-08-06T20:38:30.064975Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.064975Z"},"links":{"cited_paper":"/paper/2503.21307","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:2d66315229f0cf8340ca01116a06428ec9675d5866a2d00049af89895c742097","observation_id":"48ae9154-6455-4740-9750-a32c2ad19818","resolution":{"observed_at":"2026-08-06T20:38:30.064975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-07-06T16:07:21.951225Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-06T20:38:30.134630Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.134630Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:dbe5dd419f3744c514d65c406a036223351516a3847a566a5c7c727cae260586","observation_id":"468d22ad-8ab8-4b9f-b59b-9d312cb0db29","resolution":{"observed_at":"2026-08-06T20:38:30.134630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T20:38:30.194895Z","title":"Joty, and Enamul Hoque","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.194895Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:7aed80f7a7b106fb43a8becd433829c0103835567df6876b17ee06f02292e985","observation_id":"b1200b95-bdb6-409e-ab62-b0f44ef5bc3e","resolution":{"observed_at":"2026-08-06T20:38:30.194895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.044066Z","title":null,"venue":null,"work_id":"805ae31c-9d93-436a-af8d-c9d83f4ee2f6","year":2021},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.266880Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:7f4031bb17af23dbe15f825bb7c76f2b8f83a1e302b5a5ef910ee8bf9a607a48","observation_id":"23e8eb76-4365-4923-9169-307a01d86f3e","resolution":{"observed_at":"2026-08-06T20:38:35.163832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:34.824349Z","title":"Manmatha, and C","venue":null,"work_id":"89b329a1-699f-47fd-bce3-fe65ab49575c","year":2020},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.391497Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:2858c7060e42cdbb3db3892aea2b0dec8cecfe1f430f091c12b26caa5f5f3cea","observation_id":"430a8010-0505-408a-a53b-b1ddfc928d89","resolution":{"observed_at":"2026-08-06T20:38:34.905992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13786","last_updated":"2023-10-30T18:35:48Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:54:37Z","title":"Perception Test: A Diagnostic Benchmark for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13786","snapshot_observed_at":"2026-08-06T20:38:30.481104Z","title":"Koster, Junlin Zhang, Stephanie Winkler, and 5 others","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.481104Z"},"links":{"cited_paper":"/paper/2305.13786","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:65ad436f90a07586a2032a3fea3c1378e0122bfcbd29a5b54814fb79b535f086","observation_id":"bdd09533-6b82-46f0-921e-33d77498e756","resolution":{"observed_at":"2026-08-06T20:38:30.481104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13706","last_updated":"2022-02-06T10:20:16Z","snapshot_observed_at":"2026-07-06T12:22:43.206246Z","submitted_at":"2021-12-27T14:28:04Z","title":"Multi-Image Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13706","snapshot_observed_at":"2026-08-06T20:38:30.602789Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.602789Z"},"links":{"cited_paper":"/paper/2112.13706","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:c77430392a43a1dabadb927944aaf3f1401aafce4981f062011a69469b577ebc","observation_id":"f0c5378c-1977-4616-9ceb-5d27526d1c01","resolution":{"observed_at":"2026-08-06T20:38:30.602789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:34.603086Z","title":null,"venue":null,"work_id":"c4d6bf40-e8c5-4725-9bd6-096b952e75b9","year":2022},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.689621Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:77fd563045c2ad480f5fdabb95f63dc259093e0fb8a8a1d5aab1bd630dc4ab5a","observation_id":"f07f6cfb-786e-498d-83da-39dd7c4785f2","resolution":{"observed_at":"2026-08-06T20:38:34.718389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:30.765419Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.765419Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:785cef958436e134f611d0f9a15b20bc422b613cb6358c88e6b71364c3376657","observation_id":"067556ee-575c-437a-be1d-9ef6674c6a55","resolution":{"observed_at":"2026-08-06T20:38:30.765419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:34.380941Z","title":"Aitken, Rob Bishop, Daniel Rueckert, and Zehan Wang","venue":null,"work_id":"237d03a9-bb53-421d-919e-c338607cbfbc","year":2016},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.808494Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:c51516c743187c4218e35f67c180772f2df6199c35afbd57a9d4d790f1098458","observation_id":"7e27a2d7-5a94-40e4-92bb-6e9d5a6a233a","resolution":{"observed_at":"2026-08-06T20:38:34.482370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:34.149054Z","title":null,"venue":null,"work_id":"9ca68383-b8d4-41a2-8f95-2b945d277550","year":2019},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.870943Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:ab7c816c92314591d16bc1678a50717c9af1394b3e44d4fe6cd1364dd2fd44e2","observation_id":"d92d97ae-7ffb-4016-9bdb-12e8a7830f2e","resolution":{"observed_at":"2026-08-06T20:38:34.257481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10411","last_updated":"2019-09-23T15:10:41Z","snapshot_observed_at":"2026-07-06T08:23:53.657345Z","submitted_at":"2019-09-23T15:10:41Z","title":"NLVR2 Visual Bias Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10411","snapshot_observed_at":"2026-08-06T20:38:30.958476Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.958476Z"},"links":{"cited_paper":"/paper/1909.10411","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:6fcd7309f0967678bf56924e2bbb9e8efad75cbf58d54ddcc94cffd034a5fa84","observation_id":"7482c423-93bf-4643-bbc4-1e277a0f76ca","resolution":{"observed_at":"2026-08-06T20:38:30.958476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.03968","last_updated":"2016-04-13T20:27:43Z","snapshot_observed_at":"2026-08-05T23:43:02.349652Z","submitted_at":"2016-04-13T20:27:43Z","title":"Visual Storytelling","version":1},"cited_work":{"arxiv_id":"1604.03968","doi":null,"metadata_source":"pith","pith_arxiv_id":"1604.03968","snapshot_observed_at":"2026-08-06T20:38:32.542046Z","title":"Visual Storytelling","venue":"cs.CL","work_id":"6d37914b-f659-4970-9d74-117ec20d3bb3","year":2016},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.090662Z"},"links":{"cited_paper":"/paper/1604.03968","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:57289765f5e4c93b605868e59f3cf0c4e52643d336cf1498bd6d7e0ec5963382","observation_id":"b850ff87-f508-44f5-92d4-3fc5b3d01f4d","resolution":{"observed_at":"2026-08-06T20:38:32.685743Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-09T15:18:46.301127Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-06T20:38:31.214733Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.214733Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:b30215e87b609f188de9ee8a8d0c96b766a2e66c29fae2286438f51e1d5d836a","observation_id":"7c35b610-cf1d-493e-9a50-fdb95330df3d","resolution":{"observed_at":"2026-08-06T20:38:31.214733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T20:38:31.337702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.337702Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:1e73279f41dcfdc3af877d9dc6258d9146f6b098141d5b176b94efeab413749a","observation_id":"e360d848-1f3e-45bf-bdc2-152f0015cf5e","resolution":{"observed_at":"2026-08-06T20:38:31.337702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T20:38:31.429497Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.429497Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:ba249d9d6d14765eeea1e779cc8c6976220fee8eae4c80cbf382ed0a86ddef54","observation_id":"a47cc575-87af-4819-83cc-515df417841f","resolution":{"observed_at":"2026-08-06T20:38:31.429497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-08-09T09:24:00.370216Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-06T20:38:31.498256Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.498256Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:6c093969fdf7bc66067fdb9fcb6f416c43d698991a903f578cbc5d1168e423a5","observation_id":"a3c78e87-7777-4fb2-900b-a218944e0aef","resolution":{"observed_at":"2026-08-06T20:38:31.498256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:33.916301Z","title":null,"venue":null,"work_id":"a9851adf-dd2d-48e2-a653-8e482e387c04","year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.606539Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:9c5cfaf8e312ca235131fce676e22c7493298325f42d878d583ee64fe6c0d378","observation_id":"2f4c5067-3c3c-4df1-a3a6-4bfeb82af34f","resolution":{"observed_at":"2026-08-06T20:38:34.028934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:33.678076Z","title":null,"venue":null,"work_id":"3b3413a2-7fe6-4a09-a68a-4a733656faea","year":2021},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.676473Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:fc0fb4bd2f8fc40e66248619e5466d2bc7bb320db5a1ecd4c663cd7ee2860cce","observation_id":"add12b7a-b9fe-45c0-9bb7-5b3f252d9128","resolution":{"observed_at":"2026-08-06T20:38:33.776607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10197","last_updated":"2024-12-25T04:30:16Z","snapshot_observed_at":"2026-07-06T19:16:01.172484Z","submitted_at":"2024-09-16T11:43:19Z","title":"Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10197","snapshot_observed_at":"2026-08-06T20:38:31.752838Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.752838Z"},"links":{"cited_paper":"/paper/2409.10197","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:3881851a1154748b4c0f93c0637631e000557c1375d5c96e27c361619fd59582","observation_id":"35d14d73-0835-4788-9491-3e49152ba743","resolution":{"observed_at":"2026-08-06T20:38:31.752838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-06T20:38:31.911548Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.911548Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:60c15cafcbd66a72f2a1c071480f6dd4552894006d551557798d707f6f2a016a","observation_id":"dc5ccaf7-9a03-4a84-91d1-53fc6ca88fb7","resolution":{"observed_at":"2026-08-06T20:38:31.911548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:33.457568Z","title":null,"venue":null,"work_id":"07ce893d-678f-4068-948f-98b298a5922d","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.007214Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:01a75a12cc8380f57220db05b869b6417ff4083dd8cd3a86c5d8af52be14a570","observation_id":"b038f03d-4685-4341-9e43-c500f903b73c","resolution":{"observed_at":"2026-08-06T20:38:33.582663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:33.253720Z","title":null,"venue":null,"work_id":"4869be9a-5d0e-4801-a94c-1129d70f0f34","year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.115722Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:645cefebd1f77448f371425bf68609385a03d0ae3db9f2682bbab4c10144c7f9","observation_id":"2329d619-41dc-479a-beb6-cceeeb518c2e","resolution":{"observed_at":"2026-08-06T20:38:33.337407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T20:38:32.171118Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.171118Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:a65c4ca5bd433e370f57d1ca7f323790cc0634f572875bc5dec6b6d6a0e4253e","observation_id":"2041be15-4664-41e7-ab12-8b3cc899a4d5","resolution":{"observed_at":"2026-08-06T20:38:32.171118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.267160Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.267160Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:0dae2c1e8790f87a9d5c1eee8b97da70aa58b85100f82614a8e9e2d78a98cf4b","observation_id":"7fb6840f-d5aa-4419-bcfa-772a6a478385","resolution":{"observed_at":"2026-08-06T20:38:32.267160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.385290Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.385290Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:000af9764ab6166d996d683e3cd83fef4288f23700c98fc9b3ca476fb415a36e","observation_id":"0d020b1b-b650-46dd-942d-733f1c32d85c","resolution":{"observed_at":"2026-08-06T20:38:32.385290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 3 inbound Pith citation observations for arXiv:2507.02279."}