{"as_of":"2026-08-20T11:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b93115629ba9787156b9dd4725c3a0be979dbe4d18984edd63906972ee6857cb","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T11:13:07.775436Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07279/citation-record","integrity":"/paper/2608.07279/integrity","json":"/paper/2608.07279/citation-record.json","paper":"/paper/2608.07279"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T11:13:07.632006Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.632006Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:0c57032e55aa12609f8fc6d287c04a3d0e1f02aac3129727a028f9c6d39170c5","observation_id":"7ecaad9c-8d8b-4506-b89d-9adb72e8e9ae","resolution":{"observed_at":"2026-08-10T11:13:07.632006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T11:13:07.636889Z","title":"Deepseek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.636889Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:aad1a9a8a577324603b136692081f92cad426ff1725d7fe66b0ad47c8011d26b","observation_id":"a5db22f9-d36f-4ce1-97e9-7c72983add4f","resolution":{"observed_at":"2026-08-10T11:13:07.636889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T11:13:07.641325Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.641325Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:6b2530f15f5844e24c3b49b8302c202a18b5f1866cf75f08cc51e71c034771c2","observation_id":"bbf9c675-e846-45cc-b5c7-4a800a01415b","resolution":{"observed_at":"2026-08-10T11:13:07.641325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-10T11:13:07.645580Z","title":"Qwen3-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.645580Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:38caa93cab51c99bbc9803eb74dc6c8cd9e2e52a656d79ed7728eabe23d7f8b2","observation_id":"7153ef3e-b8b9-4038-b605-09d8508c45c5","resolution":{"observed_at":"2026-08-10T11:13:07.645580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:09.054949Z","title":"Attention is all you need,","venue":null,"work_id":"975a47b1-dec9-47d6-84b1-a771a589114e","year":2017},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.649471Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:d34ea3e37193214d7b956a961457420b8575315e29b7888b62757eab190bb4e8","observation_id":"855e989b-70ce-4808-95ec-40eb6bb7ad47","resolution":{"observed_at":"2026-08-10T11:13:09.058515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:07.653190Z","title":"State of AI: An empirical 100 trillion token study with openrouter,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.653190Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:7e6975a6b1f24aa6c33bca157e7f396faefffa5405938e7286182b371f0e9212","observation_id":"888e5bbc-85e5-4bcb-a713-1c94cebfac09","resolution":{"observed_at":"2026-08-10T11:13:07.653190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:09.043589Z","title":"Token communications: A large model-driven framework for cross-modal context-aware semantic communications,","venue":null,"work_id":"b89b8ed1-ad81-4289-a0ff-910198be92f5","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.657057Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:169b17448bb88cfe6b278abe874f306dc26a561ecf787cac2401f0fb17058969","observation_id":"98920b2d-aa90-4611-9177-bb0b1f590f15","resolution":{"observed_at":"2026-08-10T11:13:09.047850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:09.031904Z","title":"Adaptive semantic token communication for Transformer-based edge inference,","venue":null,"work_id":"63cb9f5a-6562-4ace-b710-d2f3c5903275","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.660459Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:cfebceaaef0123490b5859619e0c6f8b5714b5b4e1cf3284bf97e39d072f1d35","observation_id":"bcd11c82-346c-4ccb-818a-026a3019c624","resolution":{"observed_at":"2026-08-10T11:13:09.036162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:09.020588Z","title":"ResiTok: A resilient tokenization- enabled framework for ultra-low-rate and robust image transmission,","venue":null,"work_id":"de8b0103-9ce3-47f8-b959-a34d6c6d6380","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.663886Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:978446e43b77b847910d3d955c5930099a49f6304f21dcfa9fb7fa580db91daf","observation_id":"0faf6efa-f02f-416d-bf62-9454c1f8736d","resolution":{"observed_at":"2026-08-10T11:13:09.024453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:07.667285Z","title":"Joint semantic-channel coding and modulation for token communications,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.667285Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:97e2568cf299ae8d1c6ac9a9e062ea9d29c3903a36381714b331fe3e93ea0a35","observation_id":"53ef0cef-ddbe-48fa-87cf-f983fe34e989","resolution":{"observed_at":"2026-08-10T11:13:07.667285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:09.003055Z","title":"Towards practical real-time neural video compression,","venue":null,"work_id":"510332a8-6e59-415b-aa79-1a761731ae0e","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.670497Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:304104e7ad3b34642874d920f04ca40955efc0281883ab1b40831ecfbcf06607","observation_id":"5360908d-3f45-436c-9f14-52728af9f7ae","resolution":{"observed_at":"2026-08-10T11:13:09.006774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.992639Z","title":"ELIC: Efficient learned image compression with unevenly grouped space- channel contextual adaptive coding,","venue":null,"work_id":"7735da48-c099-4ae1-b07d-5402b2330733","year":2022},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.674091Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:176266d800280a2de14a2489d5029cf6531cec779daddf869099f727eb7b832c","observation_id":"774c5ba9-3112-4a31-bc91-973c930037de","resolution":{"observed_at":"2026-08-10T11:13:08.996273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.982316Z","title":"Cache-to-cache: Direct semantic communication between large lan- guage models,","venue":null,"work_id":"d7fe9ec4-a27d-466f-8655-4999ad61cb7a","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.677376Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:164db7749d53db002ee8c84cb27f2ad66e110189de6b7a0d2f20f8a561b29509","observation_id":"d19045bc-e121-48b4-ade7-c00e01d47e4a","resolution":{"observed_at":"2026-08-10T11:13:08.985849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21454","last_updated":"2025-07-29T02:47:23Z","snapshot_observed_at":"2026-08-09T09:04:20.551201Z","submitted_at":"2025-07-29T02:47:23Z","title":"Transmission With Machine Language Tokens: A Paradigm for Task-Oriented Agent Communication","version":1},"cited_work":{"arxiv_id":"2507.21454","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21454","snapshot_observed_at":"2026-08-10T11:13:08.494996Z","title":"Transmission With Machine Language Tokens: A Paradigm for Task-Oriented Agent Communication","venue":"eess.SP","work_id":"24f36ebf-73a4-45a2-9d48-247e075c4d39","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.680779Z"},"links":{"cited_paper":"/paper/2507.21454","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:5f0557718c03b865a99b1d21f505b50d9729929326ca810047fa289ebcd07f73","observation_id":"8a5e0cce-f707-4287-b5a5-4e5159a1190f","resolution":{"observed_at":"2026-08-10T11:13:08.499206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.971903Z","title":"Video coding for machines: Compact visual representation compression for intelligent collaborative analytics,","venue":null,"work_id":"42778eb3-6b0f-41db-bb9c-3f73d4f65468","year":2024},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.684504Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:fe93cf963fe8124f17440e45d9534948e54f4fef01be9e111873375a5ed2b37c","observation_id":"45f102f9-a02a-4783-998e-39f9f8d459e8","resolution":{"observed_at":"2026-08-10T11:13:08.975666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.961394Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"f83c43f4-5bcc-4f51-9c7e-4cb1e8eb981e","year":2021},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.687950Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:89cba348b83d9f2de94b6cb4944dfdf00495fbf4bd2964dcfaf6ac1470fcd6bb","observation_id":"dad7d109-7b26-47bd-b32e-385d048287fb","resolution":{"observed_at":"2026-08-10T11:13:08.965249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.951620Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"f90fa00e-315e-4c32-8bbe-38aa015d0898","year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.691678Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:0232f20f1b86aefb2b3292d5c66dbddb30ded76ea183f09c5707d0b361d18116","observation_id":"dddb6459-27f1-4f03-97d1-5f2186057d3a","resolution":{"observed_at":"2026-08-10T11:13:08.955174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-10T11:13:07.695904Z","title":"SigLIP 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.695904Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:d91cde9486f3b6d579467af3fffc42e856eeace6e6cd9ea10946615e77c21442","observation_id":"5f90155f-efc7-482f-89fa-8ba0e75786c4","resolution":{"observed_at":"2026-08-10T11:13:07.695904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.941863Z","title":"FiLM: Visual reasoning with a general conditioning layer,","venue":null,"work_id":"53cc1ffa-8e67-4a7b-9cc9-5e0811f75ebe","year":2018},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.699701Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:e5bee38ee06215ca4e42a0c9c3bb5f88f32cc0a0f9e90d84ce3007c79442c641","observation_id":"927cf759-a421-45b5-8124-c9557287e158","resolution":{"observed_at":"2026-08-10T11:13:08.945436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:07.703005Z","title":"Video tokencom: Textual intent-guided multi-rate video token com- munications with UEP-based adaptive source-channel coding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.703005Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:288f00e6803859a5480d92e0c44ffd873235bd25d4fea247166b57b8e6b572ec","observation_id":"c034656f-aca6-429a-94bb-8a9fd4d49eb1","resolution":{"observed_at":"2026-08-10T11:13:07.703005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.930250Z","title":"Tokencom-UEP: Semantic importance-matched unequal error protec- tion for resilient image transmission,","venue":null,"work_id":"3228bdaf-d3fd-4003-8464-5cec80af4a51","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.706786Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:d515577f6ce073027399df149aee42515ba57062380533f2403130212ce3a5b8","observation_id":"ddf72d9f-e075-4134-a2b7-d38ba30fd2c4","resolution":{"observed_at":"2026-08-10T11:13:08.934886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.920113Z","title":"Semantic Packet Aggregation for Token Communication via genetic beam search,","venue":null,"work_id":"0d4ffdc5-8618-4699-aa2d-5249350d5f33","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.710123Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:066be359b0bf3360040db18ab28ddeeef9be7b65701fc70e4962d7556eefe5c5","observation_id":"d173f0e0-cbec-4829-9f1f-162432ab935f","resolution":{"observed_at":"2026-08-10T11:13:08.923828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.909562Z","title":"Vector quantized se- mantic communication system,","venue":null,"work_id":"cf482db8-bd03-4c63-8325-b1cc7aa9d90f","year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.713881Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:382dd1ce64722ddad440df8d03bac89799372f19e0d985e612cb8d90df24046b","observation_id":"541ad56a-b543-4f96-9afe-ed9c7da91386","resolution":{"observed_at":"2026-08-10T11:13:08.913321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:07.717438Z","title":"TokenCom: Vision-Language Model for Multimodal and Multitask Token Communications,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.717438Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:fd791fd63f187c7bb161bec71c7dde6955b7ddf08a5940581a5745e7a2e02ba8","observation_id":"9e96452b-eee0-4301-ac7f-e1f9140813ea","resolution":{"observed_at":"2026-08-10T11:13:07.717438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.898191Z","title":"VILA-U: A unified foundation model integrating visual understanding and generation,","venue":null,"work_id":"689f9e1a-864f-4c49-a7a2-2e9666038f2c","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.720344Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:270b2b6368092b2dd4bc12067787ae9796ea62a227858f331b41192e932ce523","observation_id":"078f5ff2-1485-42be-87a6-914b35814f3a","resolution":{"observed_at":"2026-08-10T11:13:08.901925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.887733Z","title":"BPG Image Format,","venue":null,"work_id":"79aeb135-b50a-42b5-be3b-a56431ff2d25","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.723210Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:bf77e9804eac42069a26bf28ee3d5727f4a5911e564604a162aa937ce0f267f3","observation_id":"f7c954d0-481f-4901-bf9f-a70be26be229","resolution":{"observed_at":"2026-08-10T11:13:08.891074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.877498Z","title":"VVC Test Model,","venue":null,"work_id":"1544a16f-4566-4f18-9e3e-e37fc961e015","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.726261Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:835f1a62be8e7eca4c81d715e08f9866669c4dd66dcff9809b18b538a532c0fe","observation_id":"9ef23ea2-cd1d-406b-9d6b-40c50e7c09e6","resolution":{"observed_at":"2026-08-10T11:13:08.880908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.867222Z","title":"Generative latent coding for ultra-low bitrate image compression,","venue":null,"work_id":"cf670747-aff5-4c47-ad5f-340655642bff","year":2024},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.729308Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:495736488ac90132413eb53a0df5251583087ead91e296fa1b95eafde148596a","observation_id":"2badacf3-8c4f-49da-817b-18633f90c9de","resolution":{"observed_at":"2026-08-10T11:13:08.870828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02897","last_updated":"2026-05-22T07:42:19Z","snapshot_observed_at":"2026-08-18T15:30:59.962378Z","submitted_at":"2026-03-03T11:47:05Z","title":"ProGIC: Progressive and Lightweight Generative Image Compression with Residual Vector Quantization","version":2},"cited_work":{"arxiv_id":"2603.02897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.02897","snapshot_observed_at":"2026-08-10T11:13:07.817677Z","title":"ProGIC: Progressive and Lightweight Generative Image Compression with Residual Vector Quantization","venue":"cs.CV","work_id":"8924af33-640a-4bbb-ada9-053a9fc33117","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.732195Z"},"links":{"cited_paper":"/paper/2603.02897","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:074a9c160a69633fc0e7eecd7781cde1b0e4048aef71197ceadefd967fc901f1","observation_id":"fd8b8371-275f-4f28-877e-9c1ffcbff8b0","resolution":{"observed_at":"2026-08-10T11:13:07.824823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.856006Z","title":"TransTIC: Transferring Transformer-based image compression from human perception to machine perception,","venue":null,"work_id":"70de1b59-8263-4275-9e53-f2630e802da0","year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.735347Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:8f1a1faeee7346c27b510793f7cde0635f2aa7f343f2321d64295699f1ba0b9f","observation_id":"c8e0059a-576e-43b0-8343-2033df4b29f9","resolution":{"observed_at":"2026-08-10T11:13:08.859941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.844514Z","title":"High efficiency image compression for large visual-language models,","venue":null,"work_id":"34c7473c-a83d-47f1-9e4b-db5f0e877ec3","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.738505Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:1168767481199596dca72adb6ed756013dad3d25d2886d1602f8248b4295543b","observation_id":"79ecba71-da28-4fcb-a584-28c608137512","resolution":{"observed_at":"2026-08-10T11:13:08.848679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.833628Z","title":"Bridging compressed image latents and multimodal large language models,","venue":null,"work_id":"3d3a7ff2-0dc2-45da-aa69-41763e37a21b","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.741570Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:dbae9d89310c9d637815744db4ae6b2f089cfd02083ed6b621092aa9998c69fc","observation_id":"b5a30225-6560-4c45-b896-b19b1500cc10","resolution":{"observed_at":"2026-08-10T11:13:08.837576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.822273Z","title":"When MLLMs meet compression distortion: A coding paradigm tailored to MLLMs,","venue":null,"work_id":"63b59790-d198-4535-a108-226c850df3d1","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.744536Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:6fce2939ea418550e162124b74f05c913e43074fba07abbf5ca30725333d19f3","observation_id":"e59c94a8-4d6a-4ddf-865c-978c7f874692","resolution":{"observed_at":"2026-08-10T11:13:08.826328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.810337Z","title":"Variational image compression with a Scale Hyperprior,","venue":null,"work_id":"2cc3c0a5-659a-4db1-ac9c-f7572fea203d","year":2018},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.748016Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:18de2c665129226f289bab2121f02714685b518734eaa45be0aecb2dddd4badc","observation_id":"f7ebd7c4-0b21-4201-9a06-f44acca20650","resolution":{"observed_at":"2026-08-10T11:13:08.814243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:07.751553Z","title":"Deep joint source- channel coding for wireless image transmission,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.751553Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:ad277df6221ece6d453f489f930f24dc0b8f861b5bcdafcaaa8aa06359f49afd","observation_id":"a22fd1e2-0f2c-42c1-a700-d72dd191200a","resolution":{"observed_at":"2026-08-10T11:13:07.751553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-10T11:13:07.755370Z","title":"Qwen-Image technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.755370Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:8d7f74f7da00e7b8eef93b44b9fb2bc9741455a4c2f192417a6c08766934dd67","observation_id":"1e87d3b4-ce2e-4e55-91a1-157cc5fff32c","resolution":{"observed_at":"2026-08-10T11:13:07.755370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.789856Z","title":"RoFormer: En- hanced transformer with rotary position embedding,","venue":null,"work_id":"a7c9a51f-e967-4788-b766-99effd7e1a89","year":2024},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.759074Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:f5fc2e3d3a5a1d945ddfeff0df4608fdc7b2b23a3494feb5fa4f27eb1ce07af5","observation_id":"1c680780-4ab5-4fe4-afa5-a90c939647ee","resolution":{"observed_at":"2026-08-10T11:13:08.794331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.776961Z","title":"LLaMA-Adapter: Efficient fine-tuning of large language models with zero-initialized attention,","venue":null,"work_id":"030fd7a8-5a9f-4eb2-b041-faceb20e4675","year":2024},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.762426Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:e3477e06a931238c9239471b20ee831ff2c896da7c194f70c933ccdccebc176b","observation_id":"03d46eb8-dd22-46a2-b7ad-dae4a800caeb","resolution":{"observed_at":"2026-08-10T11:13:08.780968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.764537Z","title":"MME: A comprehen- sive evaluation benchmark for multimodal large language models,","venue":null,"work_id":"65dacee6-1e12-4cf9-8217-10507ad46938","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.765590Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:7b5f71853f28f60be1a1618eaeab6546bf73d26294be9c96c7c9d74e40f40113","observation_id":"5de70b01-9f75-4c32-a013-bc5e60a6bc2e","resolution":{"observed_at":"2026-08-10T11:13:08.768647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.751785Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":"deb95292-d741-4423-a690-93dda9dd0bbf","year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.768948Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:55c7ba64b6abbed5900c98dd11eb3a498a08ad60edf42575cd5fe8b32787b4a4","observation_id":"84fce95a-d273-4994-96e6-61589768554b","resolution":{"observed_at":"2026-08-10T11:13:08.755815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.739286Z","title":"SEED-Bench: Benchmarking multimodal large language models,","venue":null,"work_id":"06633e09-2b22-449c-8707-24e7278b55b6","year":2024},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.772067Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:5eda1d13b234f71342a8248b601fc1e74d84bb0c43cce33c13adb2f73e10ed46","observation_id":"ec0a164b-bf2c-4c03-b2e8-1e7f83cc6415","resolution":{"observed_at":"2026-08-10T11:13:08.743228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.725456Z","title":"Deep visual-semantic alignments for gen- erating image descriptions,","venue":null,"work_id":"96e2a923-b313-41e2-a429-8c1f6892bab7","year":2015},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.775436Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:b9e6445c0e2bcff6dd31c7b7910d9fcff8f67250adbe0e8f0ebb1327aef1f56e","observation_id":"00ae0b86-3e77-46be-939d-ed1154bc40a9","resolution":{"observed_at":"2026-08-10T11:13:08.730688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","latest_version":1,"primary_category":"eess.SP","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2608.07279."}