{"as_of":"2026-08-18T04:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7f955a94b3086c5b600ace19f2c384dcdd779557cede9fa99dbf03f8b851a0a","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:18:49.356798Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:03:53.318565Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-09T18:03:53.492309Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2501.10318","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.10318","snapshot_observed_at":"2026-08-09T18:03:53.492309Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","venue":"cs.CV","work_id":"7f335fdb-61d5-4876-a98a-6e90154b1d98","year":2025},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-16T18:14:37.371139Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.318565Z"},"links":{"cited_paper":"/paper/2501.10318","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:148eb72bdd2f7204ab932e94cbe064b1ea5dbdac8eb74b152a609e9d7971639c","observation_id":"8a1837d5-e9a4-484d-a90b-0c32bec08abb","resolution":{"observed_at":"2026-08-09T18:03:53.497001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10318","snapshot_observed_at":"2026-08-02T06:33:14.960504Z","title":"InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-08-10T03:28:48Z","snapshot_observed_at":"2026-08-16T19:39:17.245010Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.960504Z"},"links":{"cited_paper":"/paper/2501.10318","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:aaa9e9bdbbc99a5ff5d1d9b1ad1da0e2f53984450e464a3a7801dabf2bdffc1d","observation_id":"e8af6555-174f-49e8-9fb3-4932eeb61e6d","resolution":{"observed_at":"2026-08-02T06:33:14.960504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.10318/citation-record","integrity":"/paper/2501.10318/integrity","json":"/paper/2501.10318/citation-record.json","paper":"/paper/2501.10318"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T19:18:49.186743Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.186743Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:de709fe5f7b9599798f8d3202c6281223bf616e102f09fccb9e17fb630a62468","observation_id":"4893557c-b3cf-4b9c-ba44-78d3b3d48105","resolution":{"observed_at":"2026-08-10T19:18:49.186743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.191873Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.191873Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:a4f8db831dfa20af57b7bc0783236bb1b1e2f398421bbc309a1ef7d2ef0dc695","observation_id":"3a7fa20c-a563-4222-b8b0-0bff5bec1197","resolution":{"observed_at":"2026-08-10T19:18:49.191873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-10T19:18:49.196788Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.196788Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:bdc26bd06aa5f2753520a5f101ec340db2123ae8a953d912b012dc735bd23b1c","observation_id":"05ba65c0-b72c-4a44-ae2b-4c89cbf7cb93","resolution":{"observed_at":"2026-08-10T19:18:49.196788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T19:18:49.201979Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.201979Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:737522c27e537573f6aa9e1017d7adb12a77ad5c6aed7c4c14b738e8f80b3d3c","observation_id":"151e497f-0dc5-44b6-88e5-e4d8d25dda27","resolution":{"observed_at":"2026-08-10T19:18:49.201979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T19:18:49.207169Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.207169Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:ce0eeae9cecc797d1f85f49108ae80013a9c76c1d336214701e322252bbbebaf","observation_id":"2e44bf7a-98fb-44d8-85db-97d940774865","resolution":{"observed_at":"2026-08-10T19:18:49.207169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.912236Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":"63132bc9-c6b8-4708-876c-4f3f7ac95a4d","year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.212170Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:5bde42b3686013ce6b265d3c7789b36d81422a3e75b8b717a958e7bf45f1b771","observation_id":"c625dd2c-4282-4b21-88f6-1bdc088c653c","resolution":{"observed_at":"2026-08-10T19:18:49.916017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17430","last_updated":"2024-07-29T17:59:28Z","snapshot_observed_at":"2026-08-16T13:48:55.738545Z","submitted_at":"2024-05-27T17:59:56Z","title":"Matryoshka Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17430","snapshot_observed_at":"2026-08-10T19:18:49.216883Z","title":"Matryoshka multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.216883Z"},"links":{"cited_paper":"/paper/2405.17430","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:a43281846ceb1c1124aa92bc44f632a1806dc0dc6c12dc0e1532475c06331a53","observation_id":"f8c1d574-848a-46c5-a34f-a75bcf6a1649","resolution":{"observed_at":"2026-08-10T19:18:49.216883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-10T19:18:49.221964Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.221964Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:3542876e08434b0ccf98bbf0e47e8a87184beda933680c71399ce3361fcd4ac5","observation_id":"c6168ff7-5972-4cd9-a44e-b15707bbdf69","resolution":{"observed_at":"2026-08-10T19:18:49.221964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.899226Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024","venue":null,"work_id":"bc4f39c4-2047-4f4e-a05d-5129a639cd3a","year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.227504Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:105223f98bf12873840c4faf0fee7b7d1db1b50755af4a7f45d3b2e8233a2bc9","observation_id":"b0ba5e46-5fff-4451-8d9c-21aac81f372e","resolution":{"observed_at":"2026-08-10T19:18:49.904284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.885167Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"70c652d7-848e-4be2-a3ab-9554014e4143","year":2025},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.231606Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:b79b5fc3ebc3f782b5f492758be6d2ad2d57efdceced91963f332a71f1ea2353","observation_id":"1bd42b4f-011a-49ca-b2d3-365fceb83c3a","resolution":{"observed_at":"2026-08-10T19:18:49.890233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.871166Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"bc5a968d-7a31-4e3a-81c3-b1796dfa8e1f","year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.236375Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:d42eec1d8fb4060740779aeff621b7855be3f2b1ad51d4089abb54819b3ce23b","observation_id":"84081bb7-d1bd-4704-91ac-1f31a5d53b5a","resolution":{"observed_at":"2026-08-10T19:18:49.875849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.241843Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.241843Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:91025cee5ad93a9a1e8df5be57fb4f37316f03e02c20fff79367347cdd108b29","observation_id":"580a9ceb-4d1a-46af-92a1-af0e7d9536d1","resolution":{"observed_at":"2026-08-10T19:18:49.241843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-10T19:18:49.247104Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.247104Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:19dcda630a93954ab78c25420fae8dac7800b28fb66736793abb8c5523f12c3c","observation_id":"ce90f7d8-daa3-4337-84c4-5846203e3238","resolution":{"observed_at":"2026-08-10T19:18:49.247104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T19:18:49.251989Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.251989Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:a14637dc00edba32a3c28c52a26412948726d05470b94d325b731cae94b5a4ec","observation_id":"7c8ea428-d2c8-4e8e-81bd-b020fff53a28","resolution":{"observed_at":"2026-08-10T19:18:49.251989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T19:18:49.257101Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.257101Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:2cb91a1053e0bb893830029f6382296679ce65559383e48e68e069bb76f17f24","observation_id":"4c52b67d-40ed-4e67-a665-13d683f6c0ca","resolution":{"observed_at":"2026-08-10T19:18:49.257101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-08-16T15:34:45.261111Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-10T19:18:49.261166Z","title":"Multimodal-gpt: A vi- sion and language model for dialogue with humans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.261166Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:7e04a2db018622a557f5233af179e21dc8faef336d31309b5f3b11a2205509a7","observation_id":"ff4523bc-06f8-4b7f-b16f-39d5ad5a2678","resolution":{"observed_at":"2026-08-10T19:18:49.261166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.850133Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"1872ad9a-8b39-4b89-ae1f-f27630f19fa3","year":2017},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.264913Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:336dcbc7c9c3bd480cf7547a4229fd343a693abf65b4e831a4aff2c52882c988","observation_id":"5e552329-6299-4b6d-811b-5025bad163b5","resolution":{"observed_at":"2026-08-10T19:18:49.854688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.837039Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"9e631853-4d16-4e4e-80da-42921ac9a4d1","year":2019},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.268880Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:687222a88ddbcd0008522cefeab526f1bf20f9416b98b669876f31abce8e2d57","observation_id":"58f2dfe0-49c7-4246-9b9e-b23a70f6a75a","resolution":{"observed_at":"2026-08-10T19:18:49.841639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T19:18:49.272790Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.272790Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:3cd73976811522639837d2940dd77476a7906d74d65ecf8d95522ebb6bb5b926","observation_id":"7b034409-e9db-4e28-9444-bbfdec447f22","resolution":{"observed_at":"2026-08-10T19:18:49.272790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.276437Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.276437Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:f830a1130a545170c7e40267668c4ecc8feece6bd27a6bc3bafa1cb03455123b","observation_id":"4f38d5e1-2401-44d9-84b7-7033e945acb1","resolution":{"observed_at":"2026-08-10T19:18:49.276437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.280566Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.280566Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:bb5fbd8615c7bd8e95ad187ec264f7ba030acaf5f0dc57c4e0841b777730ede9","observation_id":"3bb438ae-dc3d-4ee8-a6e4-7b56ba76931b","resolution":{"observed_at":"2026-08-10T19:18:49.280566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-10T19:18:49.284557Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.284557Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:6e1f3ff0482efa6af5aaeae164c1abb753412c4c1765f5aa6cb88059111132b3","observation_id":"8bb9e5f6-930c-48f3-9795-fc1b81ad1dd9","resolution":{"observed_at":"2026-08-10T19:18:49.284557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05803","last_updated":"2025-01-25T15:59:57Z","snapshot_observed_at":"2026-08-16T13:54:01.813914Z","submitted_at":"2024-05-09T14:38:53Z","title":"Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05803","snapshot_observed_at":"2026-08-10T19:18:49.288803Z","title":"Boosting multimodal large language models with visual tokens withdrawal for rapid inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.288803Z"},"links":{"cited_paper":"/paper/2405.05803","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:98475d0c9d43c3d101f81ef7c5e75a9f7a35b185acb621c1b0471c7fbedadfbb","observation_id":"533e2edb-6634-435f-a09b-2c7f9bc28248","resolution":{"observed_at":"2026-08-10T19:18:49.288803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.809345Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"76a55671-bee2-4c2c-a496-e44630d3a8fe","year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.292788Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:2f0f1d045e2e37261a0bc35804e933642e2d1a3b1295291496e207a8449c86a5","observation_id":"b3eb2d70-b7de-4446-bbe6-dacc3b43adf4","resolution":{"observed_at":"2026-08-10T19:18:49.814340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.794594Z","title":"Visual instruction tuning","venue":null,"work_id":"1abd0e33-6020-4056-919b-f344c81343b1","year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.296683Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:9817d1c9d717257f831d40937da2827de806939c3b72e1ea4031519a54c9566c","observation_id":"5a72f689-464c-4052-8ac2-c6e3fff0326f","resolution":{"observed_at":"2026-08-10T19:18:49.800208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.300541Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.300541Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:c302c3e897b41517db3b4a5915b7a0b3b7c72812c6862ceec2afffd416b63bf8","observation_id":"72a9111b-b727-49c9-bfa7-510299d39dab","resolution":{"observed_at":"2026-08-10T19:18:49.300541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.781234Z","title":"Towards vqa models that can read","venue":null,"work_id":"0f4caaaa-a0e9-4528-b519-40e33b3e5230","year":2019},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.304951Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:8bac264338832571c8ca9b263f6706056f273fe8884ff046e513c0300548933f","observation_id":"8c33ae2a-4435-4a3e-94e8-f0d685e0597c","resolution":{"observed_at":"2026-08-10T19:18:49.785866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T19:18:49.308877Z","title":"Gemma: Open models based on gemini research and tech- nology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.308877Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:7dd0d383899fe2f64cc6d893f285bda9077497b34e57a0d7e34dabeb8fb3a592","observation_id":"5cb256b6-a32a-4743-9e5f-0f4d058ad732","resolution":{"observed_at":"2026-08-10T19:18:49.308877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T19:18:49.313513Z","title":"Llama: open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.313513Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:13fe3a5ff57e9a6e11d70891cca0e6babc5649b40b2d37db2737c1c3c815b7ab","observation_id":"bf04df61-7787-48d4-98ed-2e439ed84300","resolution":{"observed_at":"2026-08-10T19:18:49.313513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.768829Z","title":"Tinyclip: Clip dis- tillation via affinity mimicking and weight inheritance","venue":null,"work_id":"b125d6a5-43ec-46ea-a6ac-52e36aa1ca1b","year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.317781Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:9a8eaf3176ad7f52c0940baeb38b93788a89e07407444c035c276b5f5c49ec4c","observation_id":"c93814c1-7c05-4f13-a946-d2dc4e07d377","resolution":{"observed_at":"2026-08-10T19:18:49.773159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.755960Z","title":"calflops: a flops and params calculate tool for neural networks in pytorch framework, 2023","venue":null,"work_id":"aaaa3095-b958-4707-b367-94d1494b8dea","year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.321883Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:285fe1fc0a56f3a90cecb939226422ff677f8861a6186eb7c2397ed0108b4784","observation_id":"b06da072-b8d1-4d28-b129-5ebd99ff7f3c","resolution":{"observed_at":"2026-08-10T19:18:49.760761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T19:18:49.326439Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.326439Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:f0b758686f4cf59f8926cfdfa87f7a0281851365d9dab9553af99083f7319658","observation_id":"117951dc-7cd1-49e9-9289-b655767bf5a6","resolution":{"observed_at":"2026-08-10T19:18:49.326439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-10T19:18:49.330995Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.330995Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:9d123c52ba11e838fc3caf7a3a5513ae135388c01c17654d9c7ce3f1400bd6fb","observation_id":"dfb0970e-b584-44be-8b15-b4885abeafbf","resolution":{"observed_at":"2026-08-10T19:18:49.330995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.742660Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"70890a2b-14c8-4555-9500-d9d56a12ef2e","year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.335557Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:8a12c0fe00bd39e292501d1ab6f009cb348a2ac5bd19e2980e1aeb0885226d67","observation_id":"dbbe59b8-c29e-4934-893c-205a33ddf6c7","resolution":{"observed_at":"2026-08-10T19:18:49.748418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02414","last_updated":"2023-10-25T05:22:43Z","snapshot_observed_at":"2026-08-17T15:43:31.970425Z","submitted_at":"2022-10-05T17:34:44Z","title":"GLM-130B: An Open Bilingual Pre-trained Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02414","snapshot_observed_at":"2026-08-10T19:18:49.339691Z","title":"Glm-130b: An open bilingual pre-trained model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.339691Z"},"links":{"cited_paper":"/paper/2210.02414","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:bcf9cf76bbda81c325e7e0d9f9dab2d82fa38ca74c6b00626c4a0a7ab3e500de","observation_id":"15ec2280-2c26-46c3-96ab-623a1531fe47","resolution":{"observed_at":"2026-08-10T19:18:49.339691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:18:49.344164Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.344164Z"},"links":{"citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:adbc50b52d58bb139998a84f79ac1ee76a9df44a1537bfb204555789b2c3856f","observation_id":"c05e6d4d-d2d8-44e7-b630-6a91045b1c73","resolution":{"observed_at":"2026-08-10T19:18:49.344164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-10T19:18:49.348315Z","title":"Tinyllama: An open-source small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.348315Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:7ad70ab920373f147b904dc6c966da15df6594e1392d6d62fefde148cc7d0b95","observation_id":"0f430555-2d21-4757-b227-c0aedde912da","resolution":{"observed_at":"2026-08-10T19:18:49.348315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-16T20:05:44.296509Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-10T19:18:49.352599Z","title":"Tinyllava: A frame- work of small-scale large multimodal models.arXiv preprint arXiv:2402.14289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.352599Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:787e3360ab675fcce5e76db372d3932e7e416abdb947e5d0fa376537b8da9d97","observation_id":"8081ebb7-4195-4af3-8b03-f4a8d42845ee","resolution":{"observed_at":"2026-08-10T19:18:49.352599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T19:18:49.356798Z","title":"kress\"? TextOCR Questions Llama3-1B: YesHiMix: Yes Question: Is the word in the logo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.356798Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:43f85f3c65c9519a5a22e9345a1a26703d13d0ea9e14bab9f254697b380636d9","observation_id":"703216a1-543f-4bc5-9901-d188a215f31b","resolution":{"observed_at":"2026-08-10T19:18:49.356798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T10:59:44.777053Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 2 inbound Pith citation observations for arXiv:2501.10318."}