{"as_of":"2026-08-09T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6a735c32d9d1204db9057e8fc69a0c5b5d8e1891432c8c75bf8ce6f05bcbc3cb","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T16:53:11.708868Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:23:16.226474Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12309","snapshot_observed_at":"2026-08-01T19:41:47.727930Z","title":"arXiv preprint arXiv:2605.12309 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16898","last_updated":"2026-08-02T08:43:47Z","snapshot_observed_at":"2026-08-07T11:23:33.578528Z","submitted_at":"2026-07-18T17:35:33Z","title":"Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T19:41:47.727930Z"},"links":{"cited_paper":"/paper/2605.12309","citing_paper":"/paper/2607.16898"},"observation_digest":"sha256:efe163e5c9269c5ea3104c1a21489903cc1b3857dfbce7a1ef1a75c239b92d48","observation_id":"66fef0c4-b662-4749-8b0b-bb26e25f41b4","resolution":{"observed_at":"2026-08-01T19:41:47.727930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12309","snapshot_observed_at":"2026-08-04T04:17:41.520667Z","title":"arXiv preprint arXiv:2605.12309 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16898","last_updated":"2026-08-02T08:43:47Z","snapshot_observed_at":"2026-08-07T11:23:33.578528Z","submitted_at":"2026-07-18T17:35:33Z","title":"Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T04:17:41.520667Z"},"links":{"cited_paper":"/paper/2605.12309","citing_paper":"/paper/2607.16898"},"observation_digest":"sha256:a20ed6e4a2a661c2b581fe8854f44c004736b0f5e2a520b9cc591fb2690d71ec","observation_id":"cb1dcba1-9b29-49f2-8e36-bda0ef0f3212","resolution":{"observed_at":"2026-08-04T04:17:41.520667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12309","snapshot_observed_at":"2026-08-04T17:23:16.226474Z","title":"arXiv preprint arXiv:2605.12309 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01979","last_updated":"2026-08-03T09:42:34Z","snapshot_observed_at":"2026-08-09T11:30:20.131465Z","submitted_at":"2026-08-03T09:42:34Z","title":"ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T17:23:16.226474Z"},"links":{"cited_paper":"/paper/2605.12309","citing_paper":"/paper/2608.01979"},"observation_digest":"sha256:b2ff56c0d70afdc17425da90f0d90255e9074f6d4ccf7c0ffa6d8076c9b3ae34","observation_id":"f6b5f369-d12e-4297-b3e7-68f9c8070272","resolution":{"observed_at":"2026-08-04T17:23:16.226474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.12309/citation-record","integrity":"/paper/2605.12309/integrity","json":"/paper/2605.12309/citation-record.json","paper":"/paper/2605.12309"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:da9fcb79415ef1cce40af376616bd478cdb310c4df946cf5348cf71388d38d1d","observation_id":"8925a8f0-1eac-4acc-9206-b0aa14c0c37d","resolution":{"observed_at":"2026-05-19T16:57:40.355927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving image generation with better captions","venue":null,"work_id":"ea79c0c7-072c-44cd-8531-ee4a28fe2a2f","year":2023},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:3f76d25193f22748d47ea0ea8fd44fc0224b3d99d3d6c894e2d121f12c7bfa03","observation_id":"57835968-8203-488b-85b5-8fb4a9e81436","resolution":{"observed_at":"2026-05-19T16:57:41.063119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"f5f8f484-9d8c-4b18-bcf2-5b407818c91e","year":2024},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:2a1192130ff06b31559216ec389b04a4fe215dc4bb56cb1ad256c8e6444d3122","observation_id":"93c6eadc-433d-43c1-8739-fb5db997e5ad","resolution":{"observed_at":"2026-05-19T16:57:41.067222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:2adec8db8816692fde0f92d2434cf2a4d772be66a4d0c4b7502b24cf106b7489","observation_id":"2fb7338c-1f67-4d00-93f5-a5513ab3418a","resolution":{"observed_at":"2026-05-19T16:57:40.361439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models in vision: A survey.TPAMI","venue":null,"work_id":"01288b4b-f476-46c0-a59f-3c6b857a75ad","year":2023},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:78844dc22159be6f0ebcc3d05420c720b6f075beee7929dfe97338c0eec972f3","observation_id":"409de80c-f4d7-43a7-a20a-96dd8d20815d","resolution":{"observed_at":"2026-05-19T16:57:41.065027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"11d0eba1-3f58-4764-aff6-bba5c16f357d","year":2022},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:c3ab81f4032dddde76595e37e79fc4e3f6edbf7adf5b5e782c0fe4f55f49f211","observation_id":"acf3a854-831c-4530-ad46-3314c1458c8f","resolution":{"observed_at":"2026-05-19T16:57:41.069150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:939942e40c5af54bbd20e7f929e0bc2650c538965235b1bce9ad7ac98fdc3da9","observation_id":"2edc038a-cb93-411e-b432-42c1babb6af3","resolution":{"observed_at":"2026-05-19T16:57:40.358740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":"acfe56b4-a321-4606-941c-2118059b8668","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:15a2a633a8f17d310cd0fb60ca9179175847e7eb0a52d86c3b2f290a711df2b0","observation_id":"fb4f0b5d-4128-4980-9b24-fdb4e39065a6","resolution":{"observed_at":"2026-05-19T16:57:41.091236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 3 pro image (nano banana pro)","venue":null,"work_id":"d1aeac0c-dcb3-4ed5-86df-55b3bfb9c270","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:458e05b68814fe4566f66b21c15bdc55b2611b562162c3424c512cd092edb97f","observation_id":"92304e4c-3f92-4a58-89d6-eadbfdbb90d2","resolution":{"observed_at":"2026-05-19T16:57:41.089363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02351","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding and harnessing sparsity in unified multimodal models","venue":null,"work_id":"a9da0404-0404-496e-8265-54fc67f5140a","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:e74346e4d7d2edf4efd3d093f5d605afd487627ef6a841b7abd4ea08bb6829e9","observation_id":"512906cd-a925-4aaa-a898-578662eee7c6","resolution":{"observed_at":"2026-05-19T16:57:40.396959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:05:49.784463Z","title":"Flux.https://github.com/black-forest-labs/flux","venue":null,"work_id":"ff476bd7-afa4-451d-b45d-54207aeb1545","year":2024},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:bea391360c00339ab199bb832e187ffa135bdeaf7609d9123c69ff650e9118c5","observation_id":"f7194ef7-c9ca-4ffb-a6d5-292cffebf5ef","resolution":{"observed_at":"2026-05-19T16:57:41.095103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06663","last_updated":"2026-04-20T06:42:55Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T12:47:16Z","title":"PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks","version":2},"cited_work":{"arxiv_id":"2602.06663","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.06663","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks","venue":"cs.CV","work_id":"45b1108e-4424-468d-8d15-9e18a59ece82","year":2026},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2602.06663","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:a7bc3a754b61322fe7c9149abd03419b4543b6ad579e28240934f715d2713335","observation_id":"1f75a905-337c-41eb-b527-ae6874f6692a","resolution":{"observed_at":"2026-05-19T16:57:40.367552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dual diffusion for unified image generation and understanding","venue":null,"work_id":"76069e4c-cc0b-4dc4-a514-0935c1270a89","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:a3812ab122ce5e4d34450e0a30195c3cb57629cdce34835f0f64b93ed4828362","observation_id":"a51cdea8-1a5b-4a2b-a019-274e5fd45dca","resolution":{"observed_at":"2026-05-19T16:57:41.105285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rover: Benchmarking reciprocal cross- modal reasoning for omnimodal generation","venue":null,"work_id":"8f882e3f-37a4-47ca-8fde-3a3b0868a3de","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:92f038118f1689c29938617ff8db94c7e0d647aab910eb951fcb91d0c1a1de78","observation_id":"b7f3a2a2-d2e0-43da-9e26-f4b372086679","resolution":{"observed_at":"2026-05-19T16:57:40.400396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.NeurIPS","venue":null,"work_id":"f2494f47-a1a3-4b63-bd0f-7ab54e5608a4","year":2023},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:86967c71473955ff75af85a7d52e80cf7af63e98c20c037e3aab7a2128e7116a","observation_id":"c2acda8f-bb3d-4509-bc3f-7f23171c38f5","resolution":{"observed_at":"2026-05-19T16:57:41.097712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":"2504.17761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-10T01:46:41.223286Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","venue":"cs.CV","work_id":"3392f2c8-a1cb-4d6c-8c82-2cdccffa33f9","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:1b447a004ee1e909758c6191e011354fdc4ad1fe09de0b0ae0457ab95f2f8c66","observation_id":"702ed9fb-c920-4ae1-8f1a-07f44c4fd09d","resolution":{"observed_at":"2026-05-19T16:57:40.379475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmbench: Is your multi-modal model an all-around player? InECCV","venue":null,"work_id":"e27bfb58-dc85-4dd2-b207-e849ac0f2284","year":2024},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:547e18171337477997da3c20a897609c7ac4556bd810f51a34d262636e5d8695","observation_id":"396631f7-befa-4636-88a1-800ac4718700","resolution":{"observed_at":"2026-05-19T16:57:41.109278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"cited_work":{"arxiv_id":"2502.06474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06474","snapshot_observed_at":"2026-06-30T15:34:48.324415Z","title":"Unimod: Efficient unified multimodal transformers with mixture-of-depths","venue":null,"work_id":"fd56f337-4352-446f-8752-c659d898e8ed","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2502.06474","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:e08e54f2715a58b7fe9ec823333704fc3bce0443a82412edcbd4e199bd1d3878","observation_id":"26e843a3-6b1e-45bc-9c71-5c2a53ef71b9","resolution":{"observed_at":"2026-05-19T16:57:40.364921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing our latest image generation model in the api","venue":null,"work_id":"c5843f61-da1e-4953-b243-46b3c5a60995","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:14547e47eaee5ed0fb7439b5476ac149ae176e01f81a583de69664134c82d47e","observation_id":"b6f3980e-1133-4e7e-b1c0-a35a00f4643e","resolution":{"observed_at":"2026-05-19T16:57:41.081011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.00387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.761086Z","title":"Wiseedit: Benchmarking cognition-and creativity-informed image editing","venue":null,"work_id":"3e5d0f18-5fa3-4c0f-8b3e-57f9f9ae984f","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:27c79a2a576828a4c93bc315225c605d8daba9a794da4e66bb051aa7e2a40466","observation_id":"c7dafb59-dbd9-49c7-8c81-e274df65986c","resolution":{"observed_at":"2026-05-19T16:57:40.370572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:34:01.606998Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"4758a96a-13b9-459d-a903-0afe071e2ade","year":2022},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:70f42d40f1422db583b5ebec74eb6dad878cfc166b2a497e1aeb116d1e3b8c9b","observation_id":"c257be5a-160e-4068-9868-a496e09957f2","resolution":{"observed_at":"2026-05-19T16:57:41.073244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holitom: Holistic token merging for fast video large language models","venue":null,"work_id":"754819c5-31f2-4e94-9b35-b9db0798086b","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:6927ad9c8b2fc6042703529b0ab97181735effb422bf66428a80b15380fb203c","observation_id":"d9698088-0486-4840-9bb6-dfd79191744f","resolution":{"observed_at":"2026-05-19T16:57:41.075719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of token compression for efficient multimodal large language models.TMLR","venue":null,"work_id":"93170a1d-1c0c-4a47-b1fe-6bf1fb73b911","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:c7b357429e56560786f08fbb1de053fbd9302b8612e4d34703fb04b2d80aa3a8","observation_id":"5279849e-2857-4484-85a1-a1549090b85c","resolution":{"observed_at":"2026-05-19T16:57:41.071140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Less is more: A simple yet effective token reduction method for efficient multi-modal llms","venue":null,"work_id":"ab459014-7e67-4d8b-87cb-791f788e1a79","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:1825fe52ae0a6667424c10d9e50b353f3b9480ae00151c06d8375bd3f2ce8df1","observation_id":"6648d7ce-bd9b-43ba-a4a2-2f24da9d50cb","resolution":{"observed_at":"2026-05-19T16:57:41.079133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:59:57.427564Z","title":"Ivc- prune: Revealing the implicit visual coordinates in lvlms for vision token pruning","venue":null,"work_id":"bd612f03-1714-4998-8463-aeb3661c8f13","year":2026},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:c73db73a8c3fcb2efa1a92691cd70d648bb4fe7880e62ac49e2df06c1c0b9a25","observation_id":"65fe70a0-d0bf-4b63-8b6e-dc285978a3ab","resolution":{"observed_at":"2026-05-19T16:57:40.376802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:3d3231f62cd018f27cadaffb5c8478cc5efdb416496b130e6713bd637d3ca3e5","observation_id":"90089d6c-0c9a-4f69-a0a6-6688a39f8eb4","resolution":{"observed_at":"2026-05-19T16:57:40.394111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:c15465aba2552bbe00253ed8cb3ed4b4f85182f4dc7bf625b29da4aa6f78fdb0","observation_id":"e8fc5633-70f0-465c-9a87-538748b6a09c","resolution":{"observed_at":"2026-05-19T16:57:40.391340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T15:48:35.100341Z","title":"Internvl-u: Democratizing unified multimodal models for understanding, reasoning, generation and editing","venue":null,"work_id":"d8de0ab3-1c49-444f-8d9e-a88cf0fb0c22","year":2026},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:33dd639699f41599cd513296305aa5d511962e21297d62ceb61df9e4fb223f40","observation_id":"f4b54679-5e4b-423c-88e0-ec99631350fe","resolution":{"observed_at":"2026-05-19T16:57:40.385307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"9a5dbd08-5388-46b8-9ee7-b3eade944ef9","year":2024},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:0f634ba6367bc461e3a1c38768463c9d3627bfe6bbdccdbcce8669413529570a","observation_id":"8b167d6f-4d5c-46f9-9db4-6bdd10dedf49","resolution":{"observed_at":"2026-05-19T16:57:41.085232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2504.08837","doi":"10.48550/arxiv.2504.08837","metadata_source":"pith","pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","venue":"cs.LG","work_id":"b13ff087-9614-48cc-8991-ad75b6543bbc","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:c881367cad46cb27a9643e6b8649a454d3d6716a3b691992719d95620cf89c24","observation_id":"ce83964d-a53f-4935-bb8e-7df1de413c51","resolution":{"observed_at":"2026-05-19T16:57:40.382343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11626","last_updated":"2026-04-14T06:06:15Z","snapshot_observed_at":"2026-07-06T22:59:59.220594Z","submitted_at":"2026-04-13T15:38:09Z","title":"RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time","version":2},"cited_work":{"arxiv_id":"2604.11626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.11626","snapshot_observed_at":"2026-07-07T13:23:47.436342Z","title":"RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time","venue":"cs.AI","work_id":"298e7e4d-1025-489a-9d59-e5627a56dd3f","year":2026},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2604.11626","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:f08f848b891e58006fcc7ad19d5d66e00b12f3e20afbf7eb7708f52ad381addc","observation_id":"4b4c5688-3ebe-4e3c-a403-ffca9069dd12","resolution":{"observed_at":"2026-05-19T16:57:40.403042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.03646","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:05:55.482941Z","title":"Emergent hierarchical reasoning in llms through reinforcement learning","venue":null,"work_id":"fcfdaff1-0ffe-4c1a-a987-257744e095d9","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:28060053fe69c02898c57b731b92c7ea56cbc54e82862e818183aabd805550ba","observation_id":"9dfbf07c-325d-4a9d-88ea-608045d23a5c","resolution":{"observed_at":"2026-05-19T16:57:40.406050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:21abca776b88d38a62dbeb435fe01831c26953cfa0f79a07d9d092e925369ca5","observation_id":"263065b5-48c9-4c98-83be-91bec573a427","resolution":{"observed_at":"2026-05-19T16:57:40.388168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token pruning in multimodal large language models: Are we solving the right problem? InACL Findings","venue":null,"work_id":"6b9851b2-2651-476d-aaf8-133765133c07","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:f588b835f81fc3898c7e08dca5a64982d3a6346886f66530f44693311d31bf57","observation_id":"1b789c3a-4809-4c74-8ac0-7956950501e0","resolution":{"observed_at":"2026-05-19T16:57:41.107312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":"99f0265c-4d43-4a59-a810-0cb779c4b1ca","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:4b3c23aac41b6a2f733aa88df2f531baf1ac2f03c76fcdfffe56ed199e810820","observation_id":"8bbc5f82-5fe6-497d-9c08-99d64483cfda","resolution":{"observed_at":"2026-05-19T16:57:41.111113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kris-bench: Benchmarking next-level intelligent image editing models","venue":null,"work_id":"a472b622-e557-49ce-b887-edd90a271fa1","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:af75265b1715c490970c98446be0359eed6e4a9e6a340ce7ec391797d4d964f8","observation_id":"68a2200a-c987-48c0-ad26-275c56e6a2bc","resolution":{"observed_at":"2026-05-19T16:57:41.103247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Announcing grok-1.5.https://x.ai/news/grok-1.5","venue":null,"work_id":"aee60b74-1cbd-4014-afb4-497cfc1995fd","year":2024},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:667dade9c293ba770684322225ab3fcadeddb7919f2c6c233d36d93a6b6772fd","observation_id":"06362bac-ed3e-497d-be0b-3e558285b072","resolution":{"observed_at":"2026-05-19T16:57:41.061118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":"e52d552e-deff-47ea-97d4-e7eac650f8cb","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:ea3a09f1798764feb02c6a082769ea4ee5d5eb06fa1b096c5bcabd61844f8f1e","observation_id":"0e9686c9-6da3-40ea-950f-e098201c1668","resolution":{"observed_at":"2026-05-19T16:57:41.093044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-o2: Improved native unified multimodal models","venue":null,"work_id":"0b6855a4-a09c-4cbc-b9e5-f60d33463a56","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:5fbbb69eca38ecf71ba54dee645dc7b2f2277b55753d04502f9e34cc29176bb8","observation_id":"653e866e-61f3-45bd-8d94-dff9c366794f","resolution":{"observed_at":"2026-05-19T16:57:41.099570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conical visual concentration for efficient large vision-language models","venue":null,"work_id":"e13cff2c-c05b-4f16-a75f-f8e470b13225","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:f7e87b2bb38358a0b3e9a4697a4d76fd1f7886afd14c7c71cda2e2321a0a28d3","observation_id":"ddfbf650-9dd1-45aa-a626-43c53268e365","resolution":{"observed_at":"2026-05-19T16:57:41.101372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking visual token reduction in lvlms under cross-modal misalignment","venue":null,"work_id":"d0ff386c-f1f2-40c9-9b7e-489d93c6a159","year":2026},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:b456f3bf0b8db2e530b73e2ec38c5b661377659999d3eecc05f030ee629d8663","observation_id":"369b972d-879d-4699-b2f2-69434741e0c2","resolution":{"observed_at":"2026-05-19T16:57:41.112952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vscan: Rethinking visual token reduction for efficient large vision-language models.TMLR","venue":null,"work_id":"6cb47196-352d-4809-9fcb-098fb3a343d5","year":2026},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:55a96e989b9137355ca51df271097006cd0b5e340e327929d2134abcf0d86e00","observation_id":"333c58d3-8dac-461e-8621-c8f93a8cf2db","resolution":{"observed_at":"2026-05-19T16:57:41.083000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Envisioning beyond the pixels: Bench- marking reasoning-informed visual editing","venue":null,"work_id":"1585c3df-dd96-44ba-902d-103f6d7656c4","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:791f610fb949ab70fa42b08be209ca6a834caabfcd0cbdb565efa199283c49fd","observation_id":"c0103691-5230-440f-a923-24eebb1f3db9","resolution":{"observed_at":"2026-05-19T16:57:41.087497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:af962914f9dc89617cf0077412f97614b9b370fcec7cd38d2e392f8f7737c4f1","observation_id":"f49e966b-04a2-403c-9ca8-e08a3a2ac678","resolution":{"observed_at":"2026-05-19T16:57:40.373501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":26},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 3 inbound Pith citation observations for arXiv:2605.12309."}