{"as_of":"2026-08-22T00:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0af9a6ce56a3454923ddeef4a7e4a3f5202e2b86be913d334f7ec58159fedfcd","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:38:56.881537Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:46:40.721391Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T11:46:41.710016Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"cited_work":{"arxiv_id":"2412.08771","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08771","snapshot_observed_at":"2026-08-16T11:46:41.710016Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","venue":"cs.CV","work_id":"b06a849f-a4d6-4469-9b79-ffc366d7008e","year":2024},"citing_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-18T02:26:00.733954Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-08-16T11:46:40.721391Z"},"links":{"cited_paper":"/paper/2412.08771","citing_paper":"/paper/2504.14693"},"observation_digest":"sha256:2adfab32642d1b20116550fd1b676f662fe3ce55b3d69e60086ee0f2015e8cf5","observation_id":"433e4106-7cdb-4697-b00a-5c9339fc6fde","resolution":{"observed_at":"2026-08-16T11:46:41.713731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08771/citation-record","integrity":"/paper/2412.08771/integrity","json":"/paper/2412.08771/citation-record.json","paper":"/paper/2412.08771"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T17:38:56.716772Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.716772Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:9546a6c06ddfef58392a3ccee2e9617668b0f3fa3c2823c9022be21aba24ad9b","observation_id":"3da70c1f-c91b-4a78-ac6f-1045cbf86f16","resolution":{"observed_at":"2026-08-11T17:38:56.716772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.724332Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.724332Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:a2dc98eb088f0e698ebc00dbdfe80139d69dfdb544494a2c9b54a299fa5cfe30","observation_id":"a876d2af-f907-4e5f-9bd7-fb52c28479a1","resolution":{"observed_at":"2026-08-11T17:38:56.724332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.730122Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.730122Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:f0b0117f18db6389411d6a7a8c3a622ee725891d6e7d788a96420a8dc5e43e78","observation_id":"b2f2f848-a4e1-4498-ae03-80ec1bd017a6","resolution":{"observed_at":"2026-08-11T17:38:56.730122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:57.306233Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"7b0ff706-15ed-4604-8424-51d3e3092874","year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.735300Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:bb0aeffde363e81751eca62f2e4182c0d38995880d32f13d1890e872431f7d10","observation_id":"af58c3fd-2e36-494f-9fd3-029e451b498c","resolution":{"observed_at":"2026-08-11T17:38:57.311285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10994","last_updated":"2024-12-17T02:05:27Z","snapshot_observed_at":"2026-08-20T07:48:23.750527Z","submitted_at":"2024-09-17T08:56:27Z","title":"Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10994","snapshot_observed_at":"2026-08-11T17:38:56.742024Z","title":"Less is more: A simple yet effective token reduction method for efficient multi-modal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.742024Z"},"links":{"cited_paper":"/paper/2409.10994","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:b9731149030ca9374ee3efa885cf4fc96e9073cb66c4e8301c9e57c31df9cd6f","observation_id":"20390628-8090-428a-907a-0c1a15a05ccd","resolution":{"observed_at":"2026-08-11T17:38:56.742024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-16T13:43:37.776811Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-11T17:38:56.747030Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.747030Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:334a61f544c9420eebeec9dfcc1ecab4641a9f8c37374fba8728cca151eb6195","observation_id":"b17128a6-cf98-48ea-bcac-7682aca48906","resolution":{"observed_at":"2026-08-11T17:38:56.747030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10945","last_updated":"2024-12-25T01:27:01Z","snapshot_observed_at":"2026-08-18T12:31:50.537514Z","submitted_at":"2024-08-20T15:34:27Z","title":"HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10945","snapshot_observed_at":"2026-08-11T17:38:56.755180Z","title":"Hired: Attention-guided token dropping for efficient inference of high-resolution vision-language models in resource-constrained environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.755180Z"},"links":{"cited_paper":"/paper/2408.10945","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:de89f82937132f8673b0391a8dbb162f1c29a74ed6320187dec6aba4e98b705a","observation_id":"082004d0-bfd8-4a5a-a00f-5ae86d088b6f","resolution":{"observed_at":"2026-08-11T17:38:56.755180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17430","last_updated":"2024-07-29T17:59:28Z","snapshot_observed_at":"2026-08-19T14:46:37.218640Z","submitted_at":"2024-05-27T17:59:56Z","title":"Matryoshka Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17430","snapshot_observed_at":"2026-08-11T17:38:56.762019Z","title":"Matryoshka multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.762019Z"},"links":{"cited_paper":"/paper/2405.17430","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:48b54309fd60f3c03f23a1a29f3bca539226a6976e2b296b268c09fca3cdbab3","observation_id":"eefffb81-b279-4120-ada8-0c530d5cf11d","resolution":{"observed_at":"2026-08-11T17:38:56.762019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.767350Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.767350Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:6b20cca8e0d71d6718affce96fb42692471f6034a6f5368f75338763f9784f1b","observation_id":"6b22601a-7576-4731-bf58-c7d046f3fc20","resolution":{"observed_at":"2026-08-11T17:38:56.767350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14228","last_updated":"2024-11-21T15:37:52Z","snapshot_observed_at":"2026-08-21T00:00:43.891067Z","submitted_at":"2024-11-21T15:37:52Z","title":"FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14228","snapshot_observed_at":"2026-08-11T17:38:56.772419Z","title":"Focusllava: A coarse-to-fine approach for efficient and effective visual token compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.772419Z"},"links":{"cited_paper":"/paper/2411.14228","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:f151c1aeddae2c51dd5d07aaaa4fd3f55e5447b9be1760cf86193e28bfd3cab3","observation_id":"81522011-0c70-4c50-b4e6-f46a7adcdf3e","resolution":{"observed_at":"2026-08-11T17:38:56.772419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T17:38:56.776843Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.776843Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:fd27281d62687cd263ea77cd26ee6f3d83b3b2c26cc93b10024ff5d24bb376ab","observation_id":"66b5eed6-4f90-499c-9ac5-849f2171c11c","resolution":{"observed_at":"2026-08-11T17:38:56.776843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.781775Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.781775Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:722d2375847008e0f39fbf4beb51f3e654ee95c0bbe808c40a58aa20929d0636","observation_id":"51d5bba8-1fb1-493c-b520-d423a3a07391","resolution":{"observed_at":"2026-08-11T17:38:56.781775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.787378Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.787378Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:4c59f8746d2b0b4c47cd2a306e9ed48490dbf9c0f78ccf856b35ae639b0c8f1f","observation_id":"886b59ed-d335-4c77-9271-7b21ec3dfb4a","resolution":{"observed_at":"2026-08-11T17:38:56.787378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:57.256152Z","title":"Lmms-eval: Accelerating the development of large multimoal models, March 2024","venue":null,"work_id":"e2551ab5-6367-4702-8483-c17313789b6b","year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.792098Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:a37f07170cccdd9115fb53ce7a41d1b851344090c526eeeec0029b7ad31f1cc0","observation_id":"0462a536-8991-45ab-a93b-062bd723a3a9","resolution":{"observed_at":"2026-08-11T17:38:57.263040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:57.240567Z","title":"Gqa: A new dataset for real-world visual reasoning and com- positional question answering","venue":null,"work_id":"95ace0b0-9031-4752-a1cc-0a7161718171","year":2019},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.796485Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:363cc935cffdb2081fc23e244aa04ea395b7c7a5e5c67167dde06f6dfd918da6","observation_id":"ff118de8-15c3-40fb-b0f8-34609c1c92f9","resolution":{"observed_at":"2026-08-11T17:38:57.245227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.806224Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.806224Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:4f08cd0e68bd4dd3708034e7352c88f1a43c6ab2c7cdadd6c8fcdfa377d6eb9b","observation_id":"1574031e-206e-434c-86c5-f0d001fa7d8b","resolution":{"observed_at":"2026-08-11T17:38:56.806224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.811310Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.811310Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:2004f688d78190e853ad3fac16b62feb02bbab5d72a56df3cdab4cb03e96857f","observation_id":"522ece48-3d03-42b5-834c-122ee1b67971","resolution":{"observed_at":"2026-08-11T17:38:56.811310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-11T17:38:56.816229Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.816229Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:f2e1974bbcdfe4a27275fac5a3757a716cfd36192a432e159ce495ef636a59be","observation_id":"21ed474f-098d-4ec1-aa90-6b8977507d4d","resolution":{"observed_at":"2026-08-11T17:38:56.816229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-21T04:07:07.949331Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T17:38:56.821977Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.821977Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:8dff67465efeece35b3d13dfb8849bfa00929901495c2ef386f42cfa4f94e66a","observation_id":"e9f6b0d1-199e-4e39-9103-f02365561dc9","resolution":{"observed_at":"2026-08-11T17:38:56.821977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T17:38:56.826692Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.826692Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:0b75ff4b7a7b09e8b5514438231eb6e273f1affc7db923bda8702b0f05ca8aed","observation_id":"7136a7d0-242b-432d-bf2d-ed56bf59d1e0","resolution":{"observed_at":"2026-08-11T17:38:56.826692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T17:38:56.832530Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.832530Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:5692570c843947b141fc5bd2a2b4d639217f9ac888b044a77b9911a7e7d6413a","observation_id":"9ba0145d-d6af-4293-9300-b83a1639c68b","resolution":{"observed_at":"2026-08-11T17:38:56.832530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.837330Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.837330Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:ed33d28b53d318b6d7914bdb9a793051ecf1a6d309f503df023603f819e8a910","observation_id":"deac9b71-a821-4eb7-8923-97a186334a82","resolution":{"observed_at":"2026-08-11T17:38:56.837330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-11T17:38:56.844734Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.844734Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:cdc743c2291588a50ce4aa2c032ad2cef477346effe56df43394c51a846016e4","observation_id":"63e0699d-71d1-4c86-a7f4-0503c5dbf140","resolution":{"observed_at":"2026-08-11T17:38:56.844734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:57.196943Z","title":"Ray: A distributed framework for emerging {AI} applications","venue":null,"work_id":"5b672273-0f57-4a22-a04c-7fb2159f7ad7","year":2018},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.851157Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:882a95e82a12377c3c7a31eff996ace2555dbcabb077da98f7606a4032dbee0c","observation_id":"32b3dd32-1c17-48d5-b54e-60ce82f730ef","resolution":{"observed_at":"2026-08-11T17:38:57.201146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:57.176246Z","title":"Ffcv: Accelerating training by removing data bottlenecks","venue":null,"work_id":"9ab916de-d921-466f-9faa-9c74db0b16ca","year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.861083Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:5e3127a9ffc6888501f1a96a9e672bffe5105df4f59aa0dfe9829100210dd835","observation_id":"d516df20-98d7-4ee1-b139-f49f5193a639","resolution":{"observed_at":"2026-08-11T17:38:57.182475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T17:38:56.867338Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.867338Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:18dc48b77b4c3366fdd3d03c29d4359ed28c462fd1ac1be16ed619378fd9ec29","observation_id":"6e4c7e81-8d2f-4afb-a905-1232853e6952","resolution":{"observed_at":"2026-08-11T17:38:56.867338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T17:38:56.881537Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.881537Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:32110f1e6f25ccd40208901c10ca3335c530a4e3e0ca4ed574b0c9914d88d26a","observation_id":"885f5b81-3a33-4fd7-9e6d-36c80160fe4d","resolution":{"observed_at":"2026-08-11T17:38:56.881537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2412.08771."}