{"as_of":"2026-08-17T09:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:132589074bc3c2ed2b5ccc992bdd79c2d26340d6f7b7f9bb225995a9e9f3a736","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:55:03.218092Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T12:55:40.367899Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-12T12:25:00.386323Z","title":"V oco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-15T21:31:19.542120Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.386323Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:27eb320b41dfb7242f1d545d8b611bd6a3eccf5237a3bb9625c2db87e74cb000","observation_id":"49af9acd-90f2-4ab2-8674-a7dcf84265aa","resolution":{"observed_at":"2026-08-12T12:25:00.386323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-12T05:21:10.954733Z","title":"V oCo-LLaMA: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00556","last_updated":"2024-12-08T04:41:32Z","snapshot_observed_at":"2026-08-15T14:21:56.324890Z","submitted_at":"2024-11-30T18:54:32Z","title":"Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T05:21:10.954733Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2412.00556"},"observation_digest":"sha256:fbc67b41f58c10256cb966984de162f12a5b77bef78c00fcdcdb185b330ad1b4","observation_id":"809edccb-1c91-4a68-be7a-c59c4b8baf20","resolution":{"observed_at":"2026-08-12T05:21:10.954733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-12T05:01:00.359007Z","title":"V oco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00876","last_updated":"2025-03-21T13:30:33Z","snapshot_observed_at":"2026-08-15T10:20:00.553225Z","submitted_at":"2024-12-01T16:32:31Z","title":"Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:00.359007Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2412.00876"},"observation_digest":"sha256:4ceae7e215ac0c591c8216e037bae2f70e101284ed184d7e6e8c853ccdb729d3","observation_id":"f352bcc1-23e7-4d6a-ade1-4a0ad0759621","resolution":{"observed_at":"2026-08-12T05:01:00.359007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-12T04:35:29.638163Z","title":"V oco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01268","last_updated":"2024-12-02T08:35:31Z","snapshot_observed_at":"2026-08-13T16:29:43.780042Z","submitted_at":"2024-12-02T08:35:31Z","title":"Ponder & Press: Advancing Visual GUI Agent towards General Computer Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:29.638163Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2412.01268"},"observation_digest":"sha256:38486888270bb24a05e971e60100fbd6b9aad7c99e6c6c899aee01fa8253e177","observation_id":"9307404b-c882-4586-aeef-3fab82364977","resolution":{"observed_at":"2026-08-12T04:35:29.638163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-11T22:35:24.370458Z","title":"V oco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.370458Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:145f8fdb180e521c51fb11152ee406af9f97a791b021637ac4478ef2fada931a","observation_id":"94e33742-a456-418b-8ce9-4b18cac4efd5","resolution":{"observed_at":"2026-08-11T22:35:24.370458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-11T20:23:18.713337Z","title":"V oco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-14T23:05:28.608576Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T20:23:18.713337Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2412.05819"},"observation_digest":"sha256:88312c43e28d726652faedc5d66a48ef9cc198817ac9818c20d95c643bb2af8e","observation_id":"6bcebf37-bfbd-47d8-be5d-00105a08efd5","resolution":{"observed_at":"2026-08-11T20:23:18.713337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-10T23:39:18.195610Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20105","last_updated":"2024-12-28T10:17:29Z","snapshot_observed_at":"2026-08-17T05:06:38.097481Z","submitted_at":"2024-12-28T10:17:29Z","title":"ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T23:39:18.195610Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2412.20105"},"observation_digest":"sha256:30f33ff486d26cbfbe20fdfde1c7e433949350344a0218aebb8636f6de8f37f0","observation_id":"bbb1f662-c167-462f-b560-654daa488e16","resolution":{"observed_at":"2026-08-10T23:39:18.195610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-16T10:55:03.218092Z","title":"V oco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17040","last_updated":"2025-05-10T22:42:28Z","snapshot_observed_at":"2026-08-16T10:48:53.230230Z","submitted_at":"2025-04-23T18:38:18Z","title":"DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:55:03.218092Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2504.17040"},"observation_digest":"sha256:c57030d00af938c45202263a4e6a0b4091c52b5b33e511c32dc28c1a2b2b8259","observation_id":"08ff8a72-db80-4fa8-8245-9c42b0332b51","resolution":{"observed_at":"2026-08-16T10:55:03.218092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-07T15:42:56.264830Z","title":"V oco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-12T14:22:37.782293Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.264830Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2505.14231"},"observation_digest":"sha256:bd19162b1ea208673b7be952af3d5ea48fe418ea19123b86a2383975f92c5de8","observation_id":"0d1d4fab-a1c0-4627-895a-05d81901127d","resolution":{"observed_at":"2026-08-07T15:42:56.264830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-07T14:46:44.748456Z","title":"V oco-llama: Towards vision compression with large language models.arXiv preprint arXiv:2406.12275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-13T16:17:34.753862Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.748456Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:beb196e1301e9c8839233b8e1edefdba3aba79073009bf28c62834cb1fabbf99","observation_id":"03a1e32b-abe3-466e-a411-0abe0a4039db","resolution":{"observed_at":"2026-08-07T14:46:44.748456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.12275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2406.12275 (2024) 1","venue":null,"work_id":"155a8d96-720e-4bca-a9ff-17138f39f883","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-08-14T01:02:35.686274Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:e066beb19a4566e31b7650e9a7bededf803203f4dbb12a420d429596f3dbc2ed","observation_id":"949cbecf-4b31-44f1-933a-4ae41c6f8d5f","resolution":{"observed_at":"2026-05-16T12:55:40.369819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-07T14:26:17.253571Z","title":"V oco-llama: Towards vision compression with large lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19235","last_updated":"2025-05-25T17:16:34Z","snapshot_observed_at":"2026-08-15T10:20:44.721421Z","submitted_at":"2025-05-25T17:16:34Z","title":"CoreMatching: A Co-adaptive Sparse Inference Framework with Token and Neuron Pruning for Comprehensive Acceleration of Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:17.253571Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2505.19235"},"observation_digest":"sha256:32f3c92c787ce570626b9236f9635141846df2ff1fe7868561b3828134bcfcba","observation_id":"085c94df-aa16-4d8f-926b-7d6a5fec40e2","resolution":{"observed_at":"2026-08-07T14:26:17.253571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-07T10:50:50.940626Z","title":"Voco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04344","last_updated":"2025-06-04T18:02:07Z","snapshot_observed_at":"2026-08-15T22:24:29.920738Z","submitted_at":"2025-06-04T18:02:07Z","title":"GEM: Empowering LLM for both Embedding Generation and Language Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:50:50.940626Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2506.04344"},"observation_digest":"sha256:ce6d845e4d6569e566badc544661a714ce55f792755959c2e6ecea04b7e28e2e","observation_id":"fa0c8107-91a4-4810-9bac-fc901fbcce76","resolution":{"observed_at":"2026-08-07T10:50:50.940626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T22:36:39.267392Z","title":"V oco-llama: Towards vision compression with large language models.arXiv preprint arXiv:2406.12275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-15T05:43:52.433858Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.267392Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:baf1d32e6036c78b5e580c47b67a3610fb8c14957c1a7783e8782efc76491a4f","observation_id":"68ed76ec-112b-4f43-92a6-a1c7b91af129","resolution":{"observed_at":"2026-08-06T22:36:39.267392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T22:24:35.303741Z","title":"V oCo-LLaMA: Towards Vision Compression with Large Language Models.arXiv preprint arXiv:2406.12275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-13T09:08:08.645501Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:35.303741Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:27f1b12eab6cf6de09661adc399d87ecfd246dd8212d79dd0801fd2281971613","observation_id":"a52528c2-d11a-43dd-a239-7af0352ca0dd","resolution":{"observed_at":"2026-08-06T22:24:35.303741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T18:39:07.070965Z","title":"arXiv preprint arXiv:2406.12275 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08064","last_updated":"2026-06-06T18:51:46Z","snapshot_observed_at":"2026-08-16T10:13:30.458348Z","submitted_at":"2025-07-10T16:47:25Z","title":"PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:07.070965Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2507.08064"},"observation_digest":"sha256:e3f5b00e0b3ca96cacea679e80ce5677111a4d987fb7631a6632c8948aae4789","observation_id":"451ae934-c65c-42c8-9c5d-bad3c4c82881","resolution":{"observed_at":"2026-08-06T18:39:07.070965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T18:03:03.529576Z","title":"arXiv preprint arXiv:2406.12275 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-15T18:44:58.192236Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.529576Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:81d1a4f8c1e4e0471785fd08236836eb536b2e39a983b5a2c6cddce564f55cc0","observation_id":"84c13542-3f1b-49c4-b010-e4b1694cf24c","resolution":{"observed_at":"2026-08-06T18:03:03.529576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-03T20:57:34.402360Z","title":"V oco-llama: Towards vision compression with large language models.arXiv preprint arXiv:2406.12275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.17731","last_updated":"2026-06-30T21:37:31Z","snapshot_observed_at":"2026-08-14T07:35:41.065056Z","submitted_at":"2025-11-21T19:30:24Z","title":"VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T20:57:34.402360Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2511.17731"},"observation_digest":"sha256:a4a2b387f74e84615a3fee63730a34793b5ee8aa9b348698ed51c513a1312e75","observation_id":"876f6bfa-4589-495d-878e-6a2f0db7cf72","resolution":{"observed_at":"2026-08-03T20:57:34.402360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2406.12275 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":201,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:44eb2f818ad8849b7996705cf7023b261c578110fc2cf091647d201f78d58474","observation_id":"d3e064d2-1d8b-4cfb-8768-b50960fa318b","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.12275/citation-record","integrity":"/paper/2406.12275/integrity","json":"/paper/2406.12275/citation-record.json","paper":"/paper/2406.12275"},"outbound":[],"paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2406.12275."}