{"as_of":"2026-08-18T18:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc0934fd23f5be5b88e286cd6b95b115fe9d76218b781d7343bd2054c5cfb5ef","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T16:44:16.649115Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04593/citation-record","integrity":"/paper/2607.04593/integrity","json":"/paper/2607.04593/citation-record.json","paper":"/paper/2607.04593"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:fea00c67f6f3636e0a97d3ba7472ba8412970741e9d6197f6af2fdbb621f694b","observation_id":"068f632a-01ff-4501-a458-e93b1c850daf","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Divprune: Diversity-based visual token pruning for large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:d03966659b0d5498ea876661c3059a0f5f15d1efafdaa71cf5887de900138f13","observation_id":"8617793d-35ed-4093-bc50-34cb2b645810","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Hired: Attention-guided token dropping for efficient inference of high-resolution vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:0e691b72e9e28e5ba7cff54cd52848f1c3aa4e9533e9776ddb945717cfb46640","observation_id":"861ab4f6-0db7-465e-bfbf-824e94a6473d","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:851c0353e272e847688a82bb0c0c69604b47c224fb9e80ba5f62ec644916ee92","observation_id":"9395c68f-cda5-4364-9630-658f4af8cc21","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Mechanistic inter- pretability for AI safety - a review.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:e337d50d0b2ecb08c937203b82fc6f93297368c49f2fc486261732beab0ca8f8","observation_id":"9ccbda54-53d3-4dce-948e-65e22e5a71e7","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:51b680c09ec751cee48a1cd2da69349c6b8c3f7cf3c96416ac6f448364dbe498","observation_id":"7daeea18-1912-4a97-8e96-7f633f1b9dd0","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Towards Monosemanticity: Decomposing Language Models With Dictionary Learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:7925d068e326d99abaf839dee06d6918eaa421e711a06f4c15ee393ff5a40c8c","observation_id":"e95d11b0-e4c7-40ff-b04e-578e067df446","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Batchtopk sparse autoencoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:fbe0a4957406991039df7ba8d295d7cd7075559f656d3fc66ba5bbeb439f6364","observation_id":"06026149-92e0-42d0-b450-e85de426b33f","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Learning multi-level features with matryoshka sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:5da0b9271096dd51498c115632d1a85f55f34f9184ba889318e440dc22fee6fc","observation_id":"07d3e62c-6d5c-426d-86c0-12c9b697757c","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"SAEmne- sia: Erasing concepts in diffusion models with supervised sparse autoencoders","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:9d8bb996920c2f20dcccddbf3852e1796bb1574bc46bc00908f11f0475d66ba0","observation_id":"e36cde1f-8f97-46b2-aa18-cdd8650800b7","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"SAeuron: Interpretable concept unlearning in diffusion models with sparse autoen- coders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:420d36e10cb0995f56143036f27bba37d3f67bd977bb3f5ff4670530c84b53ec","observation_id":"6d25ca1c-92b0-4a43-b409-d1fcd02c0b29","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:835236d0839c8b7626e2eba3d07ac558f9b7d18e74ee485ce7e0e60626a35121","observation_id":"fdbf46d3-9d60-491b-beab-2e075dd4d109","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:4c2b515c08dc8f04175530d09680dce6515fe260b299c3bbf58a2b1e5e306b3b","observation_id":"63dba388-0617-49e9-859f-8502c49bdecc","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Davis, Gaowen Liu, George K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:426c295bc3bc1f3652ae172894ba2506a0a82813b11f894a86047ca64fbb800d","observation_id":"746a2676-7921-4887-a586-f33e49668183","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Prune redundancy, pre- serve essence: Vision token compression in VLMs via syner- gistic importance-diversity","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:2460136bd297e2881da986461cd04e979dcdafce4fe0ae287e979f5c7e546bb3","observation_id":"ac785aa1-f20b-410a-9f82-8f7314eebaf4","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:df23672df2ae8fe576e302f37006ef97750e68f7f0b6eb9bbd481065995ac473","observation_id":"80589208-d1fe-475c-86f5-0f16c00295d9","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Scaling and evaluating sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:af08a054005274fd9f66f3ae0e418b507fa658ea5b2aeab04fa4468c01e7d201","observation_id":"7da17069-3ceb-4c34-91ac-e881d750b987","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:7da6a33153626659c2ed83dacebd6bc5da6d00a36ec16bac514beeedbe3c86ef","observation_id":"5d8f7624-fa58-40d4-b8df-84d72c4aa7d9","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:984a7b8dec79d0d8be69d0af945683fe5aa3bfe28d50a12fb8a273d410715b75","observation_id":"658170cd-4ed2-41eb-b5b8-909383b6a73d","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:6618c27aca29efe124a11b14a408b342f64b2dc6cd1e91b910be1c40acc70e34","observation_id":"96a451e0-d8fc-47cb-9ed0-e0a5515dd23d","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:60a88cd11e12e8ce7e0fd81d2c437fc2d3b7d2ec7924cbc07be9ff8bf3b21964","observation_id":"f4ec53d2-9709-433c-b659-8a788423758c","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vi- sion, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:67296bf28d06072f42ba606c96a7ebb083b77d86c7f419a32262512cc761df3e","observation_id":"774869ec-8341-4856-b85c-d16649457ece","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:86dade0d03d6d1cfc0d2c4e0afbf9b83846849383093e5509c3247dc5a893fba","observation_id":"2e3a5ef2-01e5-48eb-8d20-42beb9a45eb4","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"ToMA: Token merge with attention for diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:1319b24add6cd3b9efb44a0b47861aae8fc510b584bd3636c9b824a5ae6e5dfd","observation_id":"3d8cdb03-71ca-4da8-a746-fdd427f618fc","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"A pragmatic vision for inter- pretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:0e5e60627e689a89a34669f42ba7106457cf0c626b8c5dc505fe310af2c59b6b","observation_id":"acb4e5d2-4bb4-4069-893d-854c16f563e3","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Sparse autoencoders learn monosemantic features in vision-language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:53256b2948ce83c88af7017ff7d8bdfac335440473ea2a407bb71bcf67224ab8","observation_id":"bbe6b26d-89fe-4c28-89db-109d731e221c","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Save: Sparse autoencoder-driven visual information enhancement for mitigating object hallucination","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:cb00728ce7689455c52a9673a5ce7c99bd70aae4bb5e89b4a7dc5f7ec622a1e7","observation_id":"5f00fe6d-dbcd-4eb7-aa8b-396e2828c621","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:f628a3a8f9ebb1a511d5a89ac26a6e14c7bed8227d17c22435a500f2bce412e5","observation_id":"81a7baf6-7b4b-4a06-9170-a19f1c279861","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Discover-then-name: Task-agnostic concept bottle- necks via automated concept discovery","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:9a1d3e15e68e9d95e2e807b0686abfa71944ceee0a2ab04cd262b8318954805f","observation_id":"7a287e67-958c-42da-be4f-c6c512388d13","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:a65408c12fa14e9e26114c151c054ef7c30632552980f1a47d5bc5209f045a57","observation_id":"667c600e-fb57-4863-88dd-862c258e6922","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"VL-SAE: Interpreting and enhancing vision-language alignment with a unified concept set","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:065b24dfd29979d698615a0c38c2430a4cef36a6af576ee33daadd40b5a503c9","observation_id":"a760dff2-6a1e-4776-89e7-b560e5116c12","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"A survey on sparse autoencoders: Interpreting the internal mechanisms of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:b2b6508013d45d1bf25b22475188f5082f83b9b99c44c2d8ce7fb5254380046d","observation_id":"bfa2bcd1-672d-4873-bdfd-30694d3cec7f","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:8e3b6ac17e2c9e4be2c687f8a1326bde35b39d8545936e8695f4cbbdc729133c","observation_id":"7c9ebe76-c9ce-4221-bf8b-f14018c1449b","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Folder: Accelerating multi-modal large language models with en- hanced performance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:d1b5d75976f9997ee103e2a3fd56f365fd43636c434f767a23242e1f6ce93388","observation_id":"570b0c50-c485-4349-baf6-590815bbce1b","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Gtp-vit: Efficient vision trans- formers via graph-based token propagation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:b2472ab4db03383af2ba44ec85817a6c3b2bca07bec264429883afd7169c13c8","observation_id":"cb99e466-af90-4d11-9278-b3d6baa1a2c8","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:83210852c7d71609a039e293b18876615b396be63be71512046e0f30c73dcc64","observation_id":"ed394979-9395-4dc9-9037-158dbe4a639f","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:44:16.649115Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T16:44:16.649115Z"},"links":{"citing_paper":"/paper/2607.04593"},"observation_digest":"sha256:1040610d20750a968681a12c16ff76a3fe403be7467cdbedcba08593d2bd3e2b","observation_id":"5cca032b-219b-4c9b-af00-ee7c7a8b1a39","resolution":{"observed_at":"2026-07-11T16:44:16.649115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04593","last_updated":"2026-07-06T01:43:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-11T16:44:15.961159Z","submitted_at":"2026-07-06T01:43:09Z","title":"TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2607.04593."}