{"as_of":"2026-08-10T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:410ea00611af14b961ee6756fad4f2c41209490c88bf2e8c2e4c122fb4734642","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:00:10.950717Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03812/citation-record","integrity":"/paper/2608.03812/integrity","json":"/paper/2608.03812/citation-record.json","paper":"/paper/2608.03812"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T12:00:10.728615Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.728615Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:4a1a1451e4bd48d1b5cabfd36235663239bacd5d1d4a08a97a8d25c061b0f80b","observation_id":"c4ff1c81-251e-4035-8a6d-98e3d0f22594","resolution":{"observed_at":"2026-08-05T12:00:10.728615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-05T12:00:10.733972Z","title":"To- ken merging: Your vit but faster.arXiv preprint arXiv:2210.09461, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.733972Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:b8909b21b5e69b3b50c5ecca55cac928e14f834629c22d83b2dc1b78c54d4c7c","observation_id":"f2a2490a-d605-4a04-b8aa-288cb3f7a3f2","resolution":{"observed_at":"2026-08-05T12:00:10.733972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.221401Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"55b64317-3259-429a-9021-2ec9bfef800c","year":2024},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.739333Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:5cc910228625b4f2f3cd178d779bd5cd67ec1c2d4ed9ae30ac93aa0bc0e3432e","observation_id":"85a71cfc-c61f-427f-bb6c-9328324d3d24","resolution":{"observed_at":"2026-08-05T12:00:14.225663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.744559Z","title":"Avocado: An audiovisual video cap- tioner driven by temporal orchestration.arXiv preprint arXiv:2510.10395, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.744559Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:94aedeb3c252d9eabf2df47215480b469cbfcf3e768cae94530875de299cd301","observation_id":"6b8993aa-07a6-4baf-91de-9cc073e2eb77","resolution":{"observed_at":"2026-08-05T12:00:10.744559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27393","last_updated":"2026-04-30T04:05:43Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T04:05:43Z","title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27393","snapshot_observed_at":"2026-08-05T12:00:10.749076Z","title":"Minicpm-o 4.5: Towards real- time full-duplex omni-modal interaction.arXiv preprint arXiv:2604.27393, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.749076Z"},"links":{"cited_paper":"/paper/2604.27393","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:515841ac0abd676a4e468f193f259233ebd04966eda920e54877cb1ad825b4bb","observation_id":"fc11dee5-e447-40a7-bf99-f86c01531b48","resolution":{"observed_at":"2026-08-05T12:00:10.749076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2605.12056","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12056","snapshot_observed_at":"2026-08-05T12:00:12.231244Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","venue":"cs.AI","work_id":"3d62e986-68fb-4ae1-bdd7-d1617b3c0f0f","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.753980Z"},"links":{"cited_paper":"/paper/2605.12056","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:e4d01a642afdabdc7a5c982fdcffda319fa4895958ce41638aaa928288229550","observation_id":"adf782b0-604e-4e06-ac09-592868da529c","resolution":{"observed_at":"2026-08-05T12:00:12.324177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04804","last_updated":"2026-05-13T17:11:48Z","snapshot_observed_at":"2026-08-09T15:22:21.165722Z","submitted_at":"2026-02-04T17:51:05Z","title":"OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04804","snapshot_observed_at":"2026-08-05T12:00:10.759361Z","title":"Omnisift: Modality-asymmetric token compression for efficient omni-modal large language models.arXiv preprint arXiv:2602.04804, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.759361Z"},"links":{"cited_paper":"/paper/2602.04804","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:aeb14d4ebf623885284453c70d3f855f3ec9f67ce43e9bc51904fc5de525578b","observation_id":"d4c6e423-058f-4fc6-a23b-65cb6784fea9","resolution":{"observed_at":"2026-08-05T12:00:10.759361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.208570Z","title":"Unified spatiotemporal token compression for video-llms at ultra-low retention","venue":null,"work_id":"24e03f1f-6bad-4dde-81bd-c0eaa4a1253c","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.763940Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:934b36ca0f70e433526531539b8005249d64ab8f0e3e27373f494f4da7e55086","observation_id":"b6767fe0-689d-4823-a9eb-22133b8c728e","resolution":{"observed_at":"2026-08-05T12:00:14.212702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.195388Z","title":"Study on density peaks clustering based on k-nearest neighbors and principal component analysis.Knowledge-Based Systems, 2016","venue":null,"work_id":"66432058-e119-4fdb-9271-225ef3ef464b","year":2016},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.768085Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:cf00f038846bb0200f61d306a0cb30bde6a07fc5031bef00e053653fe813bee1","observation_id":"0aa1385b-96f6-4d00-897b-e93558c66bde","resolution":{"observed_at":"2026-08-05T12:00:14.199415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.772364Z","title":"Flashvid: Efficient video large lan- guage models via training-free tree-based spatiotemporal to- ken merging.arXiv preprint arXiv:2602.08024, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.772364Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:e635f419c9b9d0f98277429bf3c9aaad4c44383e63850a5d2cf1a6abec492c06","observation_id":"c7229e11-888c-461e-bb5b-e131dff37ef1","resolution":{"observed_at":"2026-08-05T12:00:10.772364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-07-06T18:58:56.504337Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T12:00:10.776575Z","title":"Vita: Towards open- source interactive omni multimodal llm.arXiv preprint arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.776575Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:fe9404f3e9de1530c863b9ae030820149cb6e3b6657bb0ea285362220eb7e9bb","observation_id":"1563059e-d21b-4e68-84a5-fffc1a5b873d","resolution":{"observed_at":"2026-08-05T12:00:10.776575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.182496Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"a48d4026-db76-4727-913a-20ac3e6d0809","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.781252Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:ecb95ccbf2cd738f9a9948ea2cea54bfdfb70b7ea6b7fb89e9325367275c460c","observation_id":"85f39ece-efb9-47a9-8589-866d897e697f","resolution":{"observed_at":"2026-08-05T12:00:14.187016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-08-05T12:00:10.785575Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts.arXiv preprint arXiv:2507.20939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.785575Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:0d7a74b6591d66a929fc35645f3e778c4c819373277f2073e3412234ce90fdc5","observation_id":"df338285-baa2-473b-a284-b677b5a98a8e","resolution":{"observed_at":"2026-08-05T12:00:10.785575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.10324","snapshot_observed_at":"2026-08-05T12:00:10.790061Z","title":"Echoingpixels: Cross-modal adap- tive token reduction for efficient audio-visual llms.arXiv preprint arXiv:2512.10324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.790061Z"},"links":{"cited_paper":"/paper/2512.10324","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:76b29c4d072da247af816ff0216755f5d43d18dfb0e885236973a03bc4648ec6","observation_id":"8724ec8e-e5ea-457b-b42d-53d63a4e1e83","resolution":{"observed_at":"2026-08-05T12:00:10.790061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.169577Z","title":"Echoingpixels: Aliasing-resistant joint token reduction for audio-visual llms","venue":null,"work_id":"ee90610a-277a-4053-aeef-fa544f7d1ae2","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.794328Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:49c63ec1df69733b23b2c48e23592e824271b95c0f306fc686527f7fd373f51b","observation_id":"e80f3558-050b-468e-920d-7cfe665d1e4b","resolution":{"observed_at":"2026-08-05T12:00:14.173519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.156843Z","title":"Gemini 3.1 pro model card.https: / / deepmind","venue":null,"work_id":"0b087ef3-078b-4d98-a8f4-a51f3d4f4823","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.798302Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:0f45daa97dac3a3018e1e391546e4c98f5ca197b2951623181e458754f8494cb","observation_id":"9e4c7575-aca0-494a-8d10-8be0b01266c7","resolution":{"observed_at":"2026-08-05T12:00:14.160700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-05T12:00:10.802417Z","title":"Worldsense: Evaluating real-world omni- modal understanding for multimodal llms.arXiv preprint arXiv:2502.04326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.802417Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:7cda40cf8a05cd87cc833bd71f65d8c537da8f26cc591d3a777908e29a511432","observation_id":"f691b94f-fdd3-45d0-82b7-fb384736a7ad","resolution":{"observed_at":"2026-08-05T12:00:10.802417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T12:00:10.806834Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.806834Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:13525fe679dd6ef7012264d0910d1e0164e7fd340a4331052d177da23ac80024","observation_id":"85fb0f3a-968e-4add-bd8b-17f03ba460b7","resolution":{"observed_at":"2026-08-05T12:00:10.806834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26827","last_updated":"2026-05-26T10:45:24Z","snapshot_observed_at":"2026-08-08T09:46:22.872693Z","submitted_at":"2026-05-26T10:45:24Z","title":"ContextGuard: Structured Self-Auditing for Context Learning in Language Models","version":1},"cited_work":{"arxiv_id":"2605.26827","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.26827","snapshot_observed_at":"2026-08-05T12:00:11.913353Z","title":"ContextGuard: Structured Self-Auditing for Context Learning in Language Models","venue":"cs.CL","work_id":"b9fe8c19-05ab-4ea3-b9a9-65c557dceab0","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.811574Z"},"links":{"cited_paper":"/paper/2605.26827","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:d0616c2aff0a41bdf5d899796f1b3b064fa9f12cde1f059ffbb9557dbbeb41d5","observation_id":"669715a8-0864-4eda-a1c1-70f44e032344","resolution":{"observed_at":"2026-08-05T12:00:11.978204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.815853Z","title":"Token pruning in audio trans- formers: Optimizing performance and decoding patch im- portance.arXiv preprint arXiv:2504.01690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.815853Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:ed48c103a872577e70a388a7e84ee212bb19c15298c35f12cfc61bc3d088f5ff","observation_id":"bb040714-fcd5-48b0-a191-969f1ff2c6ce","resolution":{"observed_at":"2026-08-05T12:00:10.815853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.820110Z","title":"Omnivideobench: Towards audio-visual understanding evaluation for omni mllms.arXiv preprint arXiv:2510.10689, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.820110Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:b3ee9103f311383d1d18a221a694043994fdd23869ad81ae84f8f523dd7f5ca7","observation_id":"969fe028-3840-4a74-9ff4-ab0d84dfadbc","resolution":{"observed_at":"2026-08-05T12:00:10.820110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22897","last_updated":"2026-07-02T15:39:17Z","snapshot_observed_at":"2026-08-09T05:38:40.857007Z","submitted_at":"2026-02-26T11:35:04Z","title":"OmniGAIA: Towards Native Omni-Modal AI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22897","snapshot_observed_at":"2026-08-05T12:00:10.824327Z","title":"Omnigaia: Towards native omni-modal ai agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.824327Z"},"links":{"cited_paper":"/paper/2602.22897","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:f776d6075354033253e3ff781cb78ab70c71b28846db6a053355687cc68b8d81","observation_id":"2a535e23-31cd-43b0-b60a-cd5745492821","resolution":{"observed_at":"2026-08-05T12:00:10.824327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.143232Z","title":"Speech- prune: Context-aware token pruning for speech information retrieval","venue":null,"work_id":"a625f873-29b8-4140-9a23-9e8592a7164f","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.829073Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:049c68b9811609b13618572240f2aae3a666d676a5fddb97fe36beffcb44c284","observation_id":"02549923-0200-415b-82f1-2e61ecf47e87","resolution":{"observed_at":"2026-08-05T12:00:14.147517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.130367Z","title":"Video compression commander: Plug-and-play inference ac- celeration for video large language models","venue":null,"work_id":"272ef83f-81f7-458e-adb1-f02419fea1af","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.833105Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:da1ff65665b2aca7c42258806ac9667b3be7122e0a81907cad11671b36f6bf64","observation_id":"ec615e69-17b1-4750-9904-d44b2db9a144","resolution":{"observed_at":"2026-08-05T12:00:14.134724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.116981Z","title":"Gpt-5.5 system card.https://openai.com/ index/gpt- 5- 5- system- card/, 2026","venue":null,"work_id":"e6ca8e50-4688-40b6-9e05-6e3beaf75688","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.837170Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:51d6d383aee6397a9740d66b1335c5c7c44601ceed9e4b4041c8ee819bef20dd","observation_id":"1e67b4fa-d291-4650-8def-ea6526ef4f2d","resolution":{"observed_at":"2026-08-05T12:00:14.121235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.14458","last_updated":"2026-05-14T06:54:37Z","snapshot_observed_at":"2026-08-03T14:35:51.351999Z","submitted_at":"2026-05-14T06:54:37Z","title":"OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance","version":1},"cited_work":{"arxiv_id":"2605.14458","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.14458","snapshot_observed_at":"2026-08-05T12:00:11.592182Z","title":"OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance","venue":"cs.AI","work_id":"0e5faf0a-cf09-4d78-9ad9-c2769fb2d898","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.841260Z"},"links":{"cited_paper":"/paper/2605.14458","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:49d3b6eaa7a99a835b1e3488f0409ba166e44aef1d4d610cdaf07d24eaf54e1f","observation_id":"c0be0490-6173-4d6f-bfd8-bde6e8008139","resolution":{"observed_at":"2026-08-05T12:00:11.658798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.103880Z","title":"Clustering by fast search-and-find of density peaks.science, 2014","venue":null,"work_id":"98aa514a-81bd-42fb-b7f4-72284133f42e","year":2014},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.845601Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:9c37177397b469de67c3249155096abf255aef189a0cc6fa3806d67ca9a9b01d","observation_id":"01735dad-625d-4a25-ba0b-57e432753fd7","resolution":{"observed_at":"2026-08-05T12:00:14.108069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.055529Z","title":"Fastvid: Dynamic den- sity pruning for fast video large language models.Advances in Neural Information Processing Systems, 2026","venue":null,"work_id":"782b8898-c98f-46d2-8122-2312299a8d02","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.849604Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:238e92971c69cc5776c1a5b9770a2fad6c12929dd18bab49f114d26335c3d9b4","observation_id":"c7e7f61a-fc50-4892-8ba9-396f3c1eacd7","resolution":{"observed_at":"2026-08-05T12:00:14.095057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.911125Z","title":"Mavors: Multi-granularity video representation for multimodal large language model","venue":null,"work_id":"0ec9bef2-8320-441c-8d40-2b028ab9eecc","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.853895Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:6e97eb083ce048dcdd70954cf4fa747ac3dbc4753ac43f66987b480a89d18c1d","observation_id":"a797368c-461c-4461-b661-4f748b721c06","resolution":{"observed_at":"2026-08-05T12:00:13.988394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.774659Z","title":"Audio- visual llm for video understanding","venue":null,"work_id":"6a760a4a-26ec-4e52-a3f5-b23c0d564c19","year":null},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.857877Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:feebaaf535dd46c7b9a0b38d401d97d342d264ea8a97706d420b5808c31e934b","observation_id":"1dad8e06-66ef-42ec-b8ef-8d8146649fb1","resolution":{"observed_at":"2026-08-05T12:00:13.846338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10501","last_updated":"2025-03-13T16:04:31Z","snapshot_observed_at":"2026-08-07T17:06:38.892486Z","submitted_at":"2025-03-13T16:04:31Z","title":"TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10501","snapshot_observed_at":"2026-08-05T12:00:10.862282Z","title":"To- kencarve: Information-preserving visual token compres- sion in multimodal large language models.arXiv preprint arXiv:2503.10501, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.862282Z"},"links":{"cited_paper":"/paper/2503.10501","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:8e72b9227d9c774288cec9500ee687263a60a3f3e2a02001d05c77f76c866465","observation_id":"98885e3e-5829-4942-9e14-7b991be14341","resolution":{"observed_at":"2026-08-05T12:00:10.862282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.866665Z","title":"video- salmonn 2: Caption-enhanced audio-visual large language models.arXiv preprint arXiv:2506.15220, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.866665Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:4bc0d3cdbdb79257fc3148d9849dc57fd2933c2c9d61ad3b56e5debd0a25360a","observation_id":"5ca6b901-294a-4feb-ad39-e4f4a9168434","resolution":{"observed_at":"2026-08-05T12:00:10.866665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.580374Z","title":"Dycoke: Dynamic compression of tokens for fast 9 video large language models","venue":null,"work_id":"20fdc289-8ea1-4813-92a7-a2b307f6fe2c","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.871020Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:54314540c414fcd70555e7b138002ca4913bca47806f2a96a550e95f8edeb535","observation_id":"58d07e37-2acf-49f2-b954-dc6c6718216e","resolution":{"observed_at":"2026-08-05T12:00:13.663031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.456790Z","title":"Omnizip: Audio-guided dynamic token compression for fast omnimodal large language models","venue":null,"work_id":"d070ae54-29e5-4c9d-9eff-e2dbf9cc2a5e","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.875168Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:89a80a0bb576464a5434c80f5c1ed22873759258e6dafc354ad2d54c978a94c3","observation_id":"e7911a0d-46d9-46a3-a5ed-b0260e4b4a63","resolution":{"observed_at":"2026-08-05T12:00:13.509379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.879590Z","title":"Lvomnibench: Pioneering long audio-video un- derstanding evaluation for omnimodal llms.arXiv preprint arXiv:2603.19217, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.879590Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:c310bebe329d565eee4a84d097e156377de498325ba0cde06cb6ac3647eb4f46","observation_id":"f599502c-6604-45db-8365-c1e444359355","resolution":{"observed_at":"2026-08-05T12:00:10.879590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-10T14:43:33.791354Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T12:00:10.883844Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.883844Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:ee328d693dc7577ff7cb235c5b3e150a0f48d055e63cd086ea21496d18364be5","observation_id":"4f9388e2-8b93-4c69-b335-62a917ab6e8f","resolution":{"observed_at":"2026-08-05T12:00:10.883844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.888273Z","title":"Monet: Reasoning in latent visual space beyond images and language.arXiv preprint arXiv:2511.21395, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.888273Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:eeaec1be6d371a05a5a4f73d0c69104b65f8c28afb5428334e9717c12aae27b6","observation_id":"4b29d5af-d0d7-4469-8ab1-0f1a0e14ed1c","resolution":{"observed_at":"2026-08-05T12:00:10.888273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.348040Z","title":"Beacon: Knowing when and how to perform agentic visual reasoning, 2026","venue":null,"work_id":"9b3e9601-adcd-4e2b-a85b-faf2e9793c15","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.892377Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:58eea5b77f5866aeee2866f029e88d61dc765d5f3fa7ea73e90b01a0e1aea533","observation_id":"6ac6f9ca-05d6-47f1-8765-54db3d9cdeb0","resolution":{"observed_at":"2026-08-05T12:00:13.395159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T12:00:10.896454Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.896454Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:4fa47d473bc7651ccb4c388330bf13032f2f4660607e6d5c988fdaad9e84e8ed","observation_id":"8282b130-6e75-4184-bba7-5950cd3130ce","resolution":{"observed_at":"2026-08-05T12:00:10.896454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.206607Z","title":"Varcmp: Adapting cross-modal pre-training models for video anomaly retrieval","venue":null,"work_id":"64fdf162-c528-4e8f-b9e0-39c96f560412","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.900700Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:b119e0b83214b175f63060b259a468e9a0fb10051f33ba824991877ef4767dc7","observation_id":"701a70f1-3fc6-4030-b6a8-db64f3001a8d","resolution":{"observed_at":"2026-08-05T12:00:13.264426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.060199Z","title":"Avadclip: Audio- visual collaboration for robust video anomaly detection","venue":null,"work_id":"ae5125eb-efce-4c28-8f76-86c239d164e2","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.904729Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:bdb99240fb7a68819b594d7ab40271764f8a4fb1ec168d90970b2cc84fa91eac","observation_id":"f595ffb2-ac58-4259-9c6b-752dcc24693c","resolution":{"observed_at":"2026-08-05T12:00:13.136783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20035","last_updated":"2026-05-19T15:55:16Z","snapshot_observed_at":"2026-07-06T23:30:39.512029Z","submitted_at":"2026-05-19T15:55:16Z","title":"Stage-adaptive Token Selection for Efficient Omni-modal LLMs","version":1},"cited_work":{"arxiv_id":"2605.20035","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.20035","snapshot_observed_at":"2026-08-05T12:00:11.182689Z","title":"Stage-adaptive Token Selection for Efficient Omni-modal LLMs","venue":"cs.CV","work_id":"69f687d0-fbb2-4eb2-b1dc-36bf0c428a4a","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.908725Z"},"links":{"cited_paper":"/paper/2605.20035","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:75fce8c59dac2ff7b7ad4feeb63147ab68eafe22a57a4a754e71c0ebb8e8e7cb","observation_id":"9aa36018-c1f7-4156-8b9e-ad6fa986daaa","resolution":{"observed_at":"2026-08-05T12:00:11.190235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-05T12:00:10.913314Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy re- duction.arXiv preprint arXiv:2410.17247, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.913314Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:f3d7e48939fbf259ae5ea261db75322a945471189d5e10cf0552c0e5b53fd7e1","observation_id":"e7cfe3c4-3dc9-4fa6-a3b7-e8a13743fa6b","resolution":{"observed_at":"2026-08-05T12:00:10.913314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T12:00:10.917458Z","title":"Qwen2.5-omni technical report.arXiv preprint arXiv:2503.20215, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.917458Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:a5eaef8d497f880f5fad8663398a2e69c2d7f69bb9ab10ef7122ad69e0b23493","observation_id":"06452d4f-c1a8-44f1-95eb-50b1c332fe3c","resolution":{"observed_at":"2026-08-05T12:00:10.917458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T12:00:10.922366Z","title":"Qwen3-omni technical report.arXiv preprint arXiv:2509.17765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.922366Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:ecff24710a5278bb3cf5f63eb88ffc3464f8d73291dc1366d1fd29f402942133","observation_id":"f8895f65-c30c-4837-8fe5-590202e4c06b","resolution":{"observed_at":"2026-08-05T12:00:10.922366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-05T12:00:10.926459Z","title":"Humanomniv2: From understand- ing to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.926459Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:95b4ca325804a96ab662f43910b7d9e952f89f901e7780335c3709e549022bd7","observation_id":"5ff0a44c-6bed-496d-a2cd-b373b08cf750","resolution":{"observed_at":"2026-08-05T12:00:10.926459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:12.912880Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":"98bf2a8c-8905-43de-8a6f-cba5bb85cc89","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.930514Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:1698c9ba8bb9a3356211b7b9b3f16a83338ecc0f5b49763403ea06c774c92296","observation_id":"cba8c6a1-d9af-4899-9b7e-b884074ff5dc","resolution":{"observed_at":"2026-08-05T12:00:12.971267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:12.742197Z","title":"Audio-centric video understanding benchmark without text shortcut","venue":null,"work_id":"fdc0279d-0822-483b-a84f-8298e43e28d5","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.934466Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:b667acf2e82595df1616011c6dae6b55321beaeaf292add3d879b52819dbf04f","observation_id":"9641e354-286a-4a75-9b54-1649e8272a96","resolution":{"observed_at":"2026-08-05T12:00:12.826632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-05T12:00:10.938425Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.938425Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:097be8441b67330a52b62aabb9d9f25350f26e59e8b0644faf9cef14c14f35ec","observation_id":"efb0d17f-458b-40e1-ab02-c7e005dbd68c","resolution":{"observed_at":"2026-08-05T12:00:10.938425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:12.612824Z","title":"Lmms-eval: Re- ality check on the evaluation of large multimodal models","venue":null,"work_id":"90ff5b00-3688-4cae-9719-20dec3c1cb5b","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.942553Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:b6cc87bbd9ac3288013eaf1e0e5d453c430d392e277aef1daf1ab11bf0d56c33","observation_id":"6589d0ef-0127-47bb-b8c3-cffbb2fe0e68","resolution":{"observed_at":"2026-08-05T12:00:12.680178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:12.491551Z","title":"Debiasing multimodal large language models via penal- ization of language priors","venue":null,"work_id":"f614df90-c96c-4794-a009-326e3262664e","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.946729Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:819b7e7baec0d196ef990dc570cf6c16d47596c84431b0328dc74606de009f27","observation_id":"ab4978fd-8478-4d6f-b98e-8b08c42cb70e","resolution":{"observed_at":"2026-08-05T12:00:12.551861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.950717Z","title":"What is this?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.950717Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:3b2e45ddbf34eee85e424ddb4b2e4138a03c69c596f68b6244971522f286a9bb","observation_id":"6b95c888-b354-4cab-b365-f2adae77069a","resolution":{"observed_at":"2026-08-05T12:00:10.950717Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":4,"verified_fuzzy":22},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.03812."}