{"as_of":"2026-08-19T20:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:928efa02aab1bb9cfbe1985ef7529a059d0350b927d9e7beda96d04fab850c86","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:35:16.391111Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08630/citation-record","integrity":"/paper/2608.08630/integrity","json":"/paper/2608.08630/citation-record.json","paper":"/paper/2608.08630"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:19.374792Z","title":"Zhang et al","venue":null,"work_id":"fbe8dc5c-bd97-4ef0-91dd-c6992deed7cc","year":2022},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.334751Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:92930e2acdf6cb6b1a37c1e9008e329be964b91989ee042efa80c9c34c1da92d","observation_id":"2ff526b5-0224-4298-8178-d657da7cf84d","resolution":{"observed_at":"2026-08-14T04:35:19.392851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-14T04:35:15.384752Z","title":"arXiv preprint arXiv:2502.13923 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.384752Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:eae4d16be387d2e7fe9fce548092ad1523824934917a659e4a1ce174100e4516","observation_id":"b1c07b5b-a398-4d88-8d16-e5f93ef93d75","resolution":{"observed_at":"2026-08-14T04:35:15.384752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:19.294437Z","title":null,"venue":null,"work_id":"90ab8d68-b8d4-4c1e-87e2-6f2ae2ade43b","year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.423283Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:7aa21b90be6273f8ec6065a10df20e4989017248a4591095c7f56abc769d3a04","observation_id":"108c75e5-66e2-4745-a2ca-d9a476677ecc","resolution":{"observed_at":"2026-08-14T04:35:19.334749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-14T04:35:15.449448Z","title":"CoRR abs/2412.05271(2024).https://doi.org/10.48550/ARXIV.2412.05271","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.449448Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:7eee6abf924d83188277d8db7916a5d3e9f79e9cbac414a04e39d79e4d48edf4","observation_id":"ad117176-c504-45b8-8bf2-33b60291a912","resolution":{"observed_at":"2026-08-14T04:35:15.449448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:19.204834Z","title":"Advances in Neural Information Processing Systems37, 109487–109516 (2024)","venue":null,"work_id":"99e90b58-22f2-41a5-9f89-9f3dc7614ae8","year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.484833Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:87b9b3df7ef4b053a640536e7bade44ad35b6946d1636fda3783417844b2a5bf","observation_id":"7073e692-45a2-4b27-b39d-02c93a2274aa","resolution":{"observed_at":"2026-08-14T04:35:19.234751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:19.154726Z","title":null,"venue":null,"work_id":"31577c79-1e05-4638-84b7-0ca34093270e","year":2023},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.504402Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:cdb1b2aac857919c1a3c55b4324a2784871143b0a946535c7ded0b02d2642731","observation_id":"2338f191-2c78-4c50-b020-3b279850c2de","resolution":{"observed_at":"2026-08-14T04:35:19.167823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:19.081054Z","title":"In: The Twelfth International Conference on Learning Represen- tations, ICLR 2024, Vienna, Austria, May 7-11, 2024","venue":null,"work_id":"41ad52fb-b1d2-40b2-964f-b5a2f1e63fe5","year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.554751Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:d14ed205d8f402ab46640c1327ed2a7783dc1cb5dfedf587abcdd12bca610f41","observation_id":"e23d082b-e111-4a27-afb9-14919ee6c879","resolution":{"observed_at":"2026-08-14T04:35:19.095449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:19.014225Z","title":"In: The Twelfth International Conference on Learning Representations (2024)","venue":null,"work_id":"c03b2a81-9465-4058-886d-8d9d1581c02f","year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.601217Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:fa55499cc95f08a0eb7879ebbd4ca6b8f9333a9c373299e1189e889f27f8190a","observation_id":"95782734-eff8-43f5-9a37-e257d609f709","resolution":{"observed_at":"2026-08-14T04:35:19.021338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:15.624749Z","title":"In: Proceedings of the IEEE/CVF confer- ence on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.624749Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:e24358e67c69f55049a6d37f185155a9c0ee191daab410ff3723c1b0a1bb436a","observation_id":"cba2200e-2e17-4f8a-a55b-362b30c94e6d","resolution":{"observed_at":"2026-08-14T04:35:15.624749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:18.744755Z","title":null,"venue":null,"work_id":"36ef68ef-1bca-4b97-ace6-d81245c3eb69","year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.645687Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:de15223a910487f59380e09ce2b048c2d2671dd1c6efb68fa2bc012e850d55c8","observation_id":"aaf5acc4-6cc1-41c8-94f7-47da376e912f","resolution":{"observed_at":"2026-08-14T04:35:18.794749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:15.651846Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.651846Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:8994587816d7c942aa93da49ef83b542a60f464819034571d597d1bb2c04651a","observation_id":"dbce9b57-50f6-47e0-885a-d44a1f204fb9","resolution":{"observed_at":"2026-08-14T04:35:15.651846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:18.504751Z","title":null,"venue":null,"work_id":"eeb4831f-c5e5-409c-a25c-05d2d4ba345c","year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.660093Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:a3466af484fce4e7080374236b33bf248cf8ea887eec297a5d5fa68f9b4673a5","observation_id":"7cac4926-e3e6-4428-914d-b3f8593be74f","resolution":{"observed_at":"2026-08-14T04:35:18.523717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:18.374830Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"00461e2e-b4c8-4290-b102-8152f44871a5","year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.694746Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:6218fb5313338ebe3008ec27d8086c24927a88faaaad2553c0728a84202aa754","observation_id":"d5957217-97c1-4ae2-b5df-078f16a5dda3","resolution":{"observed_at":"2026-08-14T04:35:18.414744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:18.280653Z","title":"In: International Conference on Machine Learning, ICML 2023, 23-29 July 2023, Honolulu, Hawaii, USA.ProceedingsofMachineLearningResearch,vol.202,pp.19730–19742.PMLR (2023)","venue":null,"work_id":"efeb1854-a663-42b0-86c7-fb3c18012acb","year":2023},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.709555Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:6189e24ee45ab57649f4d3bc16c1ba757aa0960a6738e26aa5b077ad4dc469a3","observation_id":"058134ea-d3e7-46e4-bd65-560407685752","resolution":{"observed_at":"2026-08-14T04:35:18.304148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:15.735524Z","title":"In: Bouamor, H., Pino, J., Bali, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.735524Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:4b484f5774e6f98883bfc121067be8173a266f193de5f0d6ff6cea5e0ef3275a","observation_id":"cccb54ec-ca80-44fd-8fc3-5ac53319cbbd","resolution":{"observed_at":"2026-08-14T04:35:15.735524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:18.204916Z","title":null,"venue":null,"work_id":"05c11c01-3528-4936-81a5-9ec4f17548fb","year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.760755Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:945102af6873dd7334a277cfd0ba5cb58f9e92501f824b0aa55f2555e34962f4","observation_id":"3559dda8-48df-4dfe-80b6-4493ae5e8782","resolution":{"observed_at":"2026-08-14T04:35:18.225417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:18.131583Z","title":"In: Proceed- ings of the 2025 Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":"6f35c31b-5ae7-4bda-9168-d207f01174d5","year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.785758Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:50fedc26d75b062659c7b85e38fa87a2650b2680cd98a053254bc10e93ad6a70","observation_id":"f4de36a2-c469-4a08-acd9-1db5f1dad8f7","resolution":{"observed_at":"2026-08-14T04:35:18.156551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:18.054822Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2024, Seattle, WA, USA, June 16-22, 2024","venue":null,"work_id":"357269d1-644e-4a35-9542-b01e72033365","year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.816410Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:3fbde7aabaf44f58e4e7795fa039bc7db5142366cafcc02ff7e89e5a82e623be","observation_id":"e684fabd-5f7a-4e36-aceb-fd442bce113d","resolution":{"observed_at":"2026-08-14T04:35:18.074749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.999043Z","title":null,"venue":null,"work_id":"4a22feb2-69f5-4163-af93-da92e82023c8","year":2023},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.844751Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:200cd3130e189125afc65f02d51c079cc4c69c4204f9aa024ef3c09aca385fc2","observation_id":"d57884e4-b88c-44fb-af9e-63a36dd5942d","resolution":{"observed_at":"2026-08-14T04:35:18.010291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:15.866323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.866323Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:4cdf4c6d414d97ca4acea0f1f43dc5c69f2ef03dbb12887bf7f2b1b449bd2cb8","observation_id":"bd2f1e6f-8e4e-4c0d-b432-26a5aa275d7f","resolution":{"observed_at":"2026-08-14T04:35:15.866323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:15.886038Z","title":"In: The 36th Conference on Neural Information Processing Systems (NeurIPS) (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.886038Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:6900bdbef5c7fed0b657f0be4d6ced0a26cb529702ee1209e8a742882b418580","observation_id":"fe73d3ad-4ecb-4006-bc2f-852852f0f243","resolution":{"observed_at":"2026-08-14T04:35:15.886038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-14T04:35:15.914749Z","title":"arXiv:2405.20797 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.914749Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:e74db69615bf2c117ce16dfbba9b4fa0e783a7b7d989dadfb4dc26fa9d9fef68","observation_id":"1836c33e-29ea-4d80-8e5c-30e8cb31dd43","resolution":{"observed_at":"2026-08-14T04:35:15.914749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:15.958770Z","title":"In: Proceedings of the IEEE/cvf conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.958770Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:43e3fcb8da1aeb1cbe381015bd32140b7f90e0aea4a4b5ae5575748de0ab060c","observation_id":"8fe1d68d-42f9-4d30-a89a-d2ba0e5f70a9","resolution":{"observed_at":"2026-08-14T04:35:15.958770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.930267Z","title":"Ad- vances in Neural Information Processing Systems37, 23464–23487 (2024)","venue":null,"work_id":"4a9c1467-3453-4167-ba5f-8d5473e84463","year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.981951Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:b45dd254dabe1a86537aca39acfffee884ae367debb0839727afde8e9085ddfc","observation_id":"9da1edd0-9993-44ba-9d64-9fce080af682","resolution":{"observed_at":"2026-08-14T04:35:17.945853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.890047Z","title":"Advances in Neural Information Processing Systems36, 19327–19352 (2023)","venue":null,"work_id":"d493f8be-2cac-4a12-b0eb-ca65e92635d9","year":2023},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.988857Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:593fda560abc7e90091bdfa6db11d89ed9a26915d7dfb502eb7094fcc6540349","observation_id":"d9a5c425-d43d-4b40-a662-9c97b7f22393","resolution":{"observed_at":"2026-08-14T04:35:17.897656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.867383Z","title":"In: Proceedings of the 38th In- ternational Conference on Machine Learning, ICML 2021, 18-24 July 2021, Virtual Event","venue":null,"work_id":"e4ccae23-09e4-44ad-993b-d198098ecda9","year":2021},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.001548Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:2475542f756ec86485706d68defa91dbbe6764b2ad65500cb62b3422a62dcc8d","observation_id":"7708feb5-12ae-4093-a468-77571bdacf3d","resolution":{"observed_at":"2026-08-14T04:35:17.874078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:16.044369Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.044369Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:2476abda3d2a4683a68e83efd8b794822b36e613c7ad3cd6951db803a8f13556","observation_id":"5bbadd6d-dd88-4e12-8551-5a5c8d48cf4b","resolution":{"observed_at":"2026-08-14T04:35:16.044369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18532","last_updated":"2024-05-15T05:43:30Z","snapshot_observed_at":"2026-08-19T14:46:36.716663Z","submitted_at":"2024-04-29T09:19:05Z","title":"MileBench: Benchmarking MLLMs in Long Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18532","snapshot_observed_at":"2026-08-14T04:35:16.084829Z","title":"CoRRabs/2404.18532(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.084829Z"},"links":{"cited_paper":"/paper/2404.18532","citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:468ee4b30a5ca3f17f5ad85a393f666f7a5509f89b06b9c2e1500d3a1cd72077","observation_id":"fd899c07-f931-4156-99e6-0be3770c81d0","resolution":{"observed_at":"2026-08-14T04:35:16.084829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.846251Z","title":"In: Advances in Neural Information Processing Systems 30: Annual Conference on Neural Information Processing Sys- tems 2017, December 4-9, 2017, Long Beach, CA, USA","venue":null,"work_id":"ac240b92-a3ba-4697-b3df-eecdb0e031ac","year":2017},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.110955Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:9309df4d3c5fa6a541de1100943c03dc16c65f452d6d80c8bb3edc33b197af44","observation_id":"121c3dc9-43dd-4310-8dee-105047108592","resolution":{"observed_at":"2026-08-14T04:35:17.851079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.807995Z","title":null,"venue":null,"work_id":"0e79c012-fd19-43b9-ae09-87c624016069","year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.133619Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:e5a60cd8d72dac9b222d13a34f10b587102bc3114027388e9f2bdba67e1f1fec","observation_id":"819774fa-1a55-4461-a189-63ec4f6a0ede","resolution":{"observed_at":"2026-08-14T04:35:17.816481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:16.155057Z","title":"CoRRabs/2409.02889 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.155057Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:b90c0bb6b910811c047ff08dae5701cadf7f2b81d06b7ab2d18bcb62ad635f52","observation_id":"b76fe6c6-3d31-4f40-9d17-b97dc9f006f0","resolution":{"observed_at":"2026-08-14T04:35:16.155057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:16.184694Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.184694Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:5ccd0ac98b6088bbfc7430c6214e863301a8e6dc729a3a6965bfb0d40a11e00c","observation_id":"aba2ce28-2469-408a-a4a9-8677af6a749a","resolution":{"observed_at":"2026-08-14T04:35:16.184694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.788879Z","title":"In: The Thirteenth International Conference on Learning Representations, ICLR 2025, Singapore, April 24-28, 2025","venue":null,"work_id":"384c4900-e121-4416-a249-59b6c668180f","year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.208606Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:e6a11f0f1d805abfdb3985e84ff556aea4c9cb0d3662702e23c49d4b6a138751","observation_id":"3f4abad7-d502-49f8-900a-8bd607fbaf82","resolution":{"observed_at":"2026-08-14T04:35:17.793380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.764752Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2025, Nashville, TN, USA, June 11-15, 2025","venue":null,"work_id":"13c15f30-2406-405b-9fe1-9b0c10df57af","year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.225223Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:33f6e07ebe64c0deaee416103f1ee60baf69cc31171a0a83564fc47d257b2be0","observation_id":"804dfcdb-dd59-4a18-bf1e-dee5c3c431c8","resolution":{"observed_at":"2026-08-14T04:35:17.777913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.731777Z","title":"In: The Thirteenth International Conference on Learning Representations, ICLR 2025, Singapore, April 24-28, 2025","venue":null,"work_id":"cbff25fc-5409-429f-a6a6-0dda954662c3","year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.256406Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:68e690e608c10bf70353888698c71e9178ea2c4162dc2577216de4ce5d0312b0","observation_id":"bc628f83-b4f6-4589-9df7-94dd67a4b2b2","resolution":{"observed_at":"2026-08-14T04:35:17.741675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:16.305034Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.305034Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:31cb71f1aad1f00ecc0e09ea65f55d0dfeccf08a3648ac5db8c77e89679a7b02","observation_id":"4856ed6c-cdc1-435d-8bc5-c19f1a8babe0","resolution":{"observed_at":"2026-08-14T04:35:16.305034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01548","last_updated":"2025-08-03T02:15:43Z","snapshot_observed_at":"2026-08-08T11:58:42.307183Z","submitted_at":"2025-08-03T02:15:43Z","title":"A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.01548","snapshot_observed_at":"2026-08-14T04:35:16.326920Z","title":"CoRR abs/2508.01548(2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.326920Z"},"links":{"cited_paper":"/paper/2508.01548","citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:2e4c0c85c54bf4bc862977dc6d49be1c8f4fac015cec8c4153250906f46f0619","observation_id":"44b6d593-8a6b-4df9-b18c-86ef48646009","resolution":{"observed_at":"2026-08-14T04:35:16.326920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:16.332341Z","title":"In: Findings of the Association for Computational Linguis- tics: NAACL 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.332341Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:d78bac21cd083bac09fb4184f4514c7ee47e181f4e195f320148457c6afad5ce","observation_id":"b4ee590a-6bb5-4c9b-8ebc-a9d9b5fc6695","resolution":{"observed_at":"2026-08-14T04:35:16.332341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.679288Z","title":"In: The Thirteenth International Conference on Learning Representations, ICLR 2025, Singapore, April 24-28, 2025","venue":null,"work_id":"4fae590e-e94b-4b04-b16e-e15c5724d883","year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.337191Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:3734a05e6076786aa0ef48826fff52fee70cf8377ae10644b721980e56ae400a","observation_id":"2f5d6e27-df25-423f-a10a-2199d08edd4d","resolution":{"observed_at":"2026-08-14T04:35:17.694734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13276","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:16.704751Z","title":"prune-and-forget","venue":null,"work_id":"b3f328da-084d-4b94-992b-a9fb878a5613","year":2025},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.347757Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:3d09bd4863227039c62b63bfe7b5bfe6a7bcc364f43d91a42a7166af8a2fc55e","observation_id":"93688644-706c-49bb-b358-d10b8a5b0af4","resolution":{"observed_at":"2026-08-14T04:35:16.784763Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.659371Z","title":null,"venue":null,"work_id":"d4adb311-d0f9-461e-81f3-688f2b319e15","year":null},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.357985Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:2e6f9f6273ac031fe621b5f45e96a45f2a7ef5c747d4961d1276ceb8bb5c17c8","observation_id":"275525de-2c19-4f03-8a4f-4a03960c3ada","resolution":{"observed_at":"2026-08-14T04:35:17.664170Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.582204Z","title":null,"venue":null,"work_id":"b741cbea-b738-45f0-8e87-0cafbbf9ee0f","year":null},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.362662Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:96e4201c012242f9ce770ef41716172475a5a3c0c9a80e4b709f807504c16cca","observation_id":"da3ec1a0-ee96-47a1-a4a3-961f7523aa9b","resolution":{"observed_at":"2026-08-14T04:35:17.604564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.526800Z","title":null,"venue":null,"work_id":"cbfe464f-aff1-48a8-893a-48252aa0c8ad","year":null},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.367307Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:8c5f069ecda2cdfc5613958d8765fc63a95c8054c1ea88baccbdc958ec13dc08","observation_id":"78d5c5c6-b06b-445b-97b0-1822e4618a00","resolution":{"observed_at":"2026-08-14T04:35:17.547276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.461684Z","title":"half right","venue":null,"work_id":"3bfd44ed-f407-403e-8f3d-2211c0ef31f5","year":null},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.371643Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:6b49291cc8b2dc1c57df85c55c696eacc295fc37e630ac5bc046fca1364c7032","observation_id":"245005b5-6307-4177-887c-b6c2ae79e46a","resolution":{"observed_at":"2026-08-14T04:35:17.476037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:17.336138Z","title":"score\" (an integer from 0 to 10) and “justification","venue":null,"work_id":"efe0376e-412f-46d8-a27d-2aa9b1fc8368","year":null},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:16.391111Z"},"links":{"citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:86f6b818fdfe4211fa5fd3cf6b5aff3835f1e803274f638a9b79ac1a76cfe88e","observation_id":"99fdd81a-3e1e-48cc-ab05-7f3aac2ed0d4","resolution":{"observed_at":"2026-08-14T04:35:17.374752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T14:47:07.743687Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":25,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.08630."}