{"as_of":"2026-08-09T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6dd922dc861d8efa22171225badbb15237211e933cc75845fea04d7d0f74d0e8","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:41:57.394029Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T12:10:53.720348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"cited_work":{"arxiv_id":"2506.23639","doi":"10.48550/arxiv.2506.23639","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23639","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Unified multimodal understanding via byte-pair visual encoding","venue":null,"work_id":"0549cd61-7abb-47f9-aa9e-9980354f43df","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":218,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.23639","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:e1243c6f904a6bff1c06f5967098fd178ab1113165f30abde1fef0d8c986f244","observation_id":"0e248dc9-df63-4d2e-8dbc-eb43593f295e","resolution":{"observed_at":"2026-05-18T19:21:48.550981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"cited_work":{"arxiv_id":"2506.23639","doi":"10.48550/arxiv.2506.23639","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23639","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Unified multimodal understanding via byte-pair visual encoding","venue":null,"work_id":"0549cd61-7abb-47f9-aa9e-9980354f43df","year":2025},"citing_paper":{"arxiv_id":"2604.03893","last_updated":"2026-06-01T03:09:36Z","snapshot_observed_at":"2026-07-13T12:10:48.358603Z","submitted_at":"2026-04-04T23:18:58Z","title":"FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T16:51:48.705876Z"},"links":{"cited_paper":"/paper/2506.23639","citing_paper":"/paper/2604.03893"},"observation_digest":"sha256:51764774b6a2453c40f8ea432da67a720805cc03f02fd35637612a6093205a52","observation_id":"6f14d2a7-9d87-4387-94ef-c078c35a3c65","resolution":{"observed_at":"2026-05-13T16:52:59.438120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23639","snapshot_observed_at":"2026-07-13T12:10:53.720348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03893","last_updated":"2026-06-01T03:09:36Z","snapshot_observed_at":"2026-07-13T12:10:48.358603Z","submitted_at":"2026-04-04T23:18:58Z","title":"FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T12:10:53.720348Z"},"links":{"cited_paper":"/paper/2506.23639","citing_paper":"/paper/2604.03893"},"observation_digest":"sha256:25f8eba5be79de7a0573af7b744ce888952be228354d928bd02f53ceff95b545","observation_id":"33d616b9-24d6-49f7-b3c2-152668849488","resolution":{"observed_at":"2026-07-13T12:10:53.720348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"cited_work":{"arxiv_id":"2506.23639","doi":"10.48550/arxiv.2506.23639","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23639","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Unified multimodal understanding via byte-pair visual encoding","venue":null,"work_id":"0549cd61-7abb-47f9-aa9e-9980354f43df","year":2025},"citing_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T20:48:01.461993Z"},"links":{"cited_paper":"/paper/2506.23639","citing_paper":"/paper/2605.00078"},"observation_digest":"sha256:085be2288a31a21d52427a328e79b0af9d18c13a1e1ad8a4bf75a8e0a44d5da1","observation_id":"8cb96130-6798-494e-8c20-cfd5a500a861","resolution":{"observed_at":"2026-05-11T15:01:04.671383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23639/citation-record","integrity":"/paper/2506.23639/integrity","json":"/paper/2506.23639/citation-record.json","paper":"/paper/2506.23639"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-06T21:41:50.412114Z","title":"A survey on multimodal large language models.arXiv preprint arXiv:2306.13549, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.412114Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:03b9af6fa1624357484b03eca27e11fa91edc29000431489b9350e9d221057f6","observation_id":"1f10ad92-c19c-4b6d-9332-606a508c5f8a","resolution":{"observed_at":"2026-08-06T21:41:50.412114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:50.528861Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.528861Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:032ba58a7813d34d9493827b8b98ee9b3464a5fdb34e8c18ea1393f644e4098c","observation_id":"ac1ecf7c-2e98-4186-b378-21b5978d53cc","resolution":{"observed_at":"2026-08-06T21:41:50.528861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-06T21:41:50.645391Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.645391Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:f574c46318c4a8dcbcfedc5dc1945ec796aa69fe00e89e8423ea6626c68eb9a5","observation_id":"97bfa309-ed67-4035-a364-4fff9c880e7d","resolution":{"observed_at":"2026-08-06T21:41:50.645391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:50.786380Z","title":"Multimodal machine learning: A survey and taxonomy","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.786380Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:fa004d8ef2ef852fed701bd478bc67a5f2b7a24efe433f9a5b85454231b59234","observation_id":"94ccf16c-1968-4899-ad09-671fccbaec06","resolution":{"observed_at":"2026-08-06T21:41:50.786380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07594","last_updated":"2025-01-08T02:33:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-10T09:51:24Z","title":"How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07594","snapshot_observed_at":"2026-08-06T21:41:50.893822Z","title":"How to bridge the gap between modalities: A comprehensive survey on multimodal large language model.arXiv preprint arXiv:2311.07594, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.893822Z"},"links":{"cited_paper":"/paper/2311.07594","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:b216e18d6e16acf87108042b0746780d566fd94459fca9bd9869c320b80848aa","observation_id":"60152022-7859-45d1-8304-401b38e3e0be","resolution":{"observed_at":"2026-08-06T21:41:50.893822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01293","last_updated":"2024-07-20T07:52:29Z","snapshot_observed_at":"2026-08-09T16:42:25.796159Z","submitted_at":"2024-02-02T10:30:05Z","title":"Can MLLMs Perform Text-to-Image In-Context Learning?","version":3},"cited_work":{"arxiv_id":"2402.01293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.01293","snapshot_observed_at":"2026-08-06T21:41:58.173949Z","title":"Can MLLMs Perform Text-to-Image In-Context Learning?","venue":"cs.LG","work_id":"06664973-3e68-428d-b679-be70add2f679","year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.990343Z"},"links":{"cited_paper":"/paper/2402.01293","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:5bcbcc03ccb775983e3d0c2ecc9f9915cad7d24786efe5c069631c87e48cea35","observation_id":"62a8891b-c809-48cf-b8fa-8d0059b3e8d1","resolution":{"observed_at":"2026-08-06T21:41:58.277662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:42:00.583595Z","title":"Vision transformer with quadrangle attention.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":"6cd699e1-3a96-418e-9ef5-343aeba564a6","year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.077788Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:2a0ce2f6e8222a6d17f97c1161b8e2ee68cc9a6cb5c4ea2d69fa8ae46f065736","observation_id":"5a1e2ff2-eeb0-438f-a881-2b65ee2bb72e","resolution":{"observed_at":"2026-08-06T21:42:00.700109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:51.188244Z","title":"Unified language-vision pretraining with dynamic discrete visual tokenization.arXiv preprint arXiv:2309.04669, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.188244Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:4fadaade2b5fbf0cf64fb4de2cb27879659cba93bcde252e8f31081bdc9c2e5a","observation_id":"dceb408a-7db8-4a2d-81ec-511e00dab3db","resolution":{"observed_at":"2026-08-06T21:41:51.188244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-07-06T19:56:21.333277Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16156","snapshot_observed_at":"2026-08-06T21:41:51.372359Z","title":"Videoorion: Tokenizing object dynamics in videos.arXiv preprint arXiv:2411.16156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.372359Z"},"links":{"cited_paper":"/paper/2411.16156","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:9e09df3f555badfcade4c52f9820b5823a08da5e060704aa86215d42bbcfdf4e","observation_id":"a2c3ae77-95fe-4fe4-a46a-9825521193aa","resolution":{"observed_at":"2026-08-06T21:41:51.372359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:51.514992Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.514992Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:c7362c916c4236319f5f6fecc7430af32e6a1ab0856bf5145cdcf8c8d5506796","observation_id":"a3db720f-9570-438f-9fc3-f03e80fbcb8a","resolution":{"observed_at":"2026-08-06T21:41:51.514992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-06T21:41:51.615891Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv preprint arXiv:2206.08916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.615891Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:d6855d464f9a012a7e4a5ebc28aa014bb1a01211cf574123249de698902c1544","observation_id":"40c626f2-5ee3-4f25-95ef-a2428b0320ff","resolution":{"observed_at":"2026-08-06T21:41:51.615891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T21:41:51.726124Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.726124Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:47461fc66b1beb314775159507f07b77ee0a050933af8bee6489ebbf5b9a3f5a","observation_id":"14df6c30-c4ee-4b25-8cef-7c9e5cd860f6","resolution":{"observed_at":"2026-08-06T21:41:51.726124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:51.797613Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.797613Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:c9d72ae7f21e0c5c0a5a6d1f9e2a463a5119e1d746cad011b509fab4897fd073","observation_id":"e7959311-e83a-4d77-ab7c-fac51c3246bd","resolution":{"observed_at":"2026-08-06T21:41:51.797613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09072","last_updated":"2024-03-14T03:29:58Z","snapshot_observed_at":"2026-08-08T23:40:08.502294Z","submitted_at":"2024-03-14T03:29:58Z","title":"UniCode: Learning a Unified Codebook for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09072","snapshot_observed_at":"2026-08-06T21:41:51.878757Z","title":"Unicode: Learning a unified codebook for multimodal large language models.arXiv preprint arXiv:2403.09072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.878757Z"},"links":{"cited_paper":"/paper/2403.09072","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:5fe9b059eb330e56a424379a6e84f0d8360cd68cca148f3bce17a337ef83b34d","observation_id":"c05a16ac-6e9d-4f4c-971b-e8f615e5a5c7","resolution":{"observed_at":"2026-08-06T21:41:51.878757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:51.980688Z","title":"From pixels to tokens: Byte-pair encoding on quantized visual modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.980688Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:b0cf32ff5d504817bd66713ca1ebbcaf2dff8602a5df163d6ec75ed646f5649c","observation_id":"fb917842-eb1b-4b0d-9024-15256782abc8","resolution":{"observed_at":"2026-08-06T21:41:51.980688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-06T21:41:52.044917Z","title":"Neural machine translation of rare words with subword units.arXiv preprint arXiv:1508.07909, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.044917Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:51038f1c0a7626ac659e67f80b416483f679089b44d990b66554a16979f764f2","observation_id":"dbae2431-b06b-437d-ba45-76293f103156","resolution":{"observed_at":"2026-08-06T21:41:52.044917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:52.179859Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.179859Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:c08b9cfb57ba91d7bc97a358d429ede5bf37d92ab246bd8897525b88a630333d","observation_id":"32554849-e934-45eb-9793-572d81adae65","resolution":{"observed_at":"2026-08-06T21:41:52.179859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08671","last_updated":"2024-11-13T15:04:02Z","snapshot_observed_at":"2026-07-06T19:49:48.427067Z","submitted_at":"2024-11-13T15:04:02Z","title":"Theoretical Analysis of Byte-Pair Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08671","snapshot_observed_at":"2026-08-06T21:41:52.290519Z","title":"Theoretical analysis of byte-pair encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.290519Z"},"links":{"cited_paper":"/paper/2411.08671","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:784775840bcb40a3e17471114cd4f0ef2eebf1def0735834f91ed25868bc9154","observation_id":"3aa4c49d-5a16-4c3d-8688-d66f604f5dc2","resolution":{"observed_at":"2026-08-06T21:41:52.290519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:52.416594Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.416594Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:6ec7cda46a814f21d2f3f6333c550a48c895a0296ae59564b45b844306e37f2e","observation_id":"904da95a-eb36-46a0-a7e4-908e7b5f86fb","resolution":{"observed_at":"2026-08-06T21:41:52.416594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:52.581194Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.581194Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:0934776d89d424448548cbcfcc18fcc3be5665d4b30de5bfe29943b40d6aae5a","observation_id":"378860cf-f482-455b-8674-b479503e0e1e","resolution":{"observed_at":"2026-08-06T21:41:52.581194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:42:00.281844Z","title":"Vitae: Vision transformer advanced by exploring intrinsic inductive bias","venue":null,"work_id":"d1225c54-a3ba-40bb-a569-9db5473b4761","year":2021},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.763886Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:12dc161b8e0743e1e8de5abd807989fbbfc78c7ccebe40c26a342d8c063decbc","observation_id":"908e3bf0-d01f-4182-8f0c-6fe187982334","resolution":{"observed_at":"2026-08-06T21:42:00.454518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:42:00.049150Z","title":"Vitaev2: Vision transformer advanced by exploring inductive bias for image recognition and beyond.International Journal of Computer Vision, pages 1–22, 2023","venue":null,"work_id":"4c6c200a-59cf-4dc7-8da5-7cd247071f81","year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.846325Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:97b2b39b920f6d8807bd4c44618c5a32f9397780513276a8577ed60fdb0410e1","observation_id":"85e6494a-1958-449a-b4fe-15ba1a6f0e11","resolution":{"observed_at":"2026-08-06T21:42:00.101269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:52.938876Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.938876Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:f2084b5d57cd161a3a7af120608510d8cda93b518e072d4bfa2ec745d6ef4e18","observation_id":"3092ac9c-8f69-41a3-8edc-562323d971d7","resolution":{"observed_at":"2026-08-06T21:41:52.938876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-06T21:41:53.036347Z","title":"Emu: Generative pretraining in multimodality.arXiv preprint arXiv:2307.05222, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.036347Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:26b09f2f84cc7ad5c209f6849bd5e931db4a8cb1c048d96b12da41de1640cbb2","observation_id":"3bb0f35c-9ca9-485e-ad51-fb9a0cc4e820","resolution":{"observed_at":"2026-08-06T21:41:53.036347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T21:41:53.151460Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.151460Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:903391f6f032e156df735afbc94e08ba1d6278d6ae947719c2fb8a3d562ad43b","observation_id":"4041ed2b-084f-4f77-a239-b461f30b494a","resolution":{"observed_at":"2026-08-06T21:41:53.151460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:53.268525Z","title":"Deepseek-vl: Towards real-world vision-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.268525Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:4fe94574424dc92522b41165d2a7df86576009ced48af8c22cdd0b22c5e7636a","observation_id":"096c485d-06cc-4c21-bcd4-a00f13172303","resolution":{"observed_at":"2026-08-06T21:41:53.268525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T21:41:53.387232Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.387232Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:ad4a8ea875fadd0e14a69c83201a3367b170c2a5847ffc66cb3e128299f4f3bd","observation_id":"b3724ed4-3bc6-4ad2-871a-39f8e79c6dce","resolution":{"observed_at":"2026-08-06T21:41:53.387232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T21:41:53.485037Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.485037Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:7328c286bce4bbad79a10ef12810df51cf95fc63d69247f72bf1386f11778afc","observation_id":"f78c38b3-34c1-48ad-8341-62f1348a8be0","resolution":{"observed_at":"2026-08-06T21:41:53.485037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T21:41:53.577296Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.577296Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:c418b18c32db81424d706e76def219876168861ecd682a6f205a3abf6ce7fb99","observation_id":"727709ad-1e12-44a2-b593-e034d2d5b8ea","resolution":{"observed_at":"2026-08-06T21:41:53.577296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:41:53.671687Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.671687Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:8f22159c7fdf32714dd5289ed2f884ff96058aee16d4da4eb078b0e07ecab658","observation_id":"0a063002-233b-4342-ab32-2ea48966291b","resolution":{"observed_at":"2026-08-06T21:41:53.671687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-06T21:41:53.737982Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention.arXiv preprint arXiv:2303.16199, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.737982Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:04d991d07f2b9bae870d6acd12b03d5e7fabc3dc271294b2cf94eada7aeebcc8","observation_id":"d60b045a-5505-4938-a6af-2c0fb6f8b28a","resolution":{"observed_at":"2026-08-06T21:41:53.737982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-06T21:41:53.815994Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.815994Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:87cf309017781f8ed1bb78370fe289e323d8bab8cfe2a7e2ac82fdc702409f0d","observation_id":"dfa9bd41-838a-417c-8080-dccc295891f5","resolution":{"observed_at":"2026-08-06T21:41:53.815994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11694","last_updated":"2025-03-04T01:47:20Z","snapshot_observed_at":"2026-07-06T20:07:41.462631Z","submitted_at":"2024-12-16T12:12:45Z","title":"From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11694","snapshot_observed_at":"2026-08-06T21:41:53.953513Z","title":"From specific-mllm to omni-mllm: A survey about the mllms alligned with multi-modality.arXiv preprint arXiv:2412.11694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.953513Z"},"links":{"cited_paper":"/paper/2412.11694","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:275b6f067d3c68ec5330e29c4b557d41668a07d5c516cdb6416ec23f860db3c5","observation_id":"df313483-fe6a-4964-a8f7-6a58ae9e0d70","resolution":{"observed_at":"2026-08-06T21:41:53.953513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.877365Z","title":"A systematic literature review on multimodal machine learning: Applications, challenges, gaps and future directions.Ieee access, 11:14804–14831, 2023","venue":null,"work_id":"fbf8caaf-33b8-4065-888d-7310dfa92c68","year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.056540Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:aa771fb20def110f21b4129247ac7228c88d1f3acec2e79de7e769d0e97af8f8","observation_id":"e8525320-212f-4275-b23c-269bad6a5898","resolution":{"observed_at":"2026-08-06T21:41:59.945916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:54.165235Z","title":"Vision language models are blind","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.165235Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:a40acf1fc0e4b7555046527974abd677f107c21a28b1a1fabcf505891d14d3b7","observation_id":"f975a922-0aaa-4b32-b46c-2f3a787244e7","resolution":{"observed_at":"2026-08-06T21:41:54.165235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-06T21:41:54.265985Z","title":"Hallucination of multimodal large language models: A survey.arXiv preprint arXiv:2404.18930, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.265985Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:4c994ca2b2db569661b596967d98b8e42ff87e2864dc4489a475edef911362ae","observation_id":"dc7a07c4-4dc1-4b6b-971d-e4ca46e75119","resolution":{"observed_at":"2026-08-06T21:41:54.265985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14683","last_updated":"2024-06-16T18:43:50Z","snapshot_observed_at":"2026-07-06T17:34:03.539565Z","submitted_at":"2024-02-22T16:40:33Z","title":"Visual Hallucinations of Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14683","snapshot_observed_at":"2026-08-06T21:41:54.374403Z","title":"Visual hallucinations of multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.374403Z"},"links":{"cited_paper":"/paper/2402.14683","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:bf0f11dbb83b8a9e92915c183434dcf630add6a8eefde08eb3cbffb5b87a4eec","observation_id":"490c5c7a-309b-4952-9dd1-f72c7038452c","resolution":{"observed_at":"2026-08-06T21:41:54.374403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06794","last_updated":"2023-09-13T08:33:09Z","snapshot_observed_at":"2026-07-06T16:17:50.837748Z","submitted_at":"2023-09-13T08:33:09Z","title":"Cognitive Mirage: A Review of Hallucinations in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06794","snapshot_observed_at":"2026-08-06T21:41:54.444370Z","title":"Cognitive mirage: A review of hallucinations in large language models.arXiv preprint arXiv:2309.06794, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.444370Z"},"links":{"cited_paper":"/paper/2309.06794","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:243d9db89f3c09a3810875a512c6ac207eb575e9c054af7ded56b2b6afddd1b4","observation_id":"ad0bdb8b-76c9-4534-8da4-0fe5fbeff5ad","resolution":{"observed_at":"2026-08-06T21:41:54.444370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:54.525356Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.525356Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:db1554bd92916fb8a6a3b0f169db172b32983426df22ef1a7da7ed50768cb6a4","observation_id":"7d1c231f-6acf-4df2-a2fd-6eec4c216bde","resolution":{"observed_at":"2026-08-06T21:41:54.525356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:54.592659Z","title":"Neural discrete representation learning.Advancesin neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.592659Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:3d27031a7ca82320e2f3593c03a2a4a6609527276d3d96a5f73f94d4e03d8e27","observation_id":"8cd077cc-ae94-4316-a74c-32b7d553a2a1","resolution":{"observed_at":"2026-08-06T21:41:54.592659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:54.650809Z","title":"Generating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.650809Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:71fdc997ee37bcec234c958d04f396a8cce06743f3c19df1f2ff05996cab3748","observation_id":"5edc9fc9-745c-495d-a8e4-b31378f804c5","resolution":{"observed_at":"2026-08-06T21:41:54.650809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.702086Z","title":"Investigating the effectiveness of bpe: The power of shorter sequences","venue":null,"work_id":"66d36906-5000-4b9a-843f-cba1d7feb97c","year":2019},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.723510Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:bc289fec4ccdb3f3ef10d30bcc74f4c0748bb761847ed16a1ce6d48d3145c43d","observation_id":"289f6d8b-521d-482b-9a11-6bfb53eb8c6f","resolution":{"observed_at":"2026-08-06T21:41:59.797657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04161","last_updated":"2025-07-21T14:23:40Z","snapshot_observed_at":"2026-08-07T02:03:46.144376Z","submitted_at":"2024-02-06T17:18:59Z","title":"Attention with Markov: A Framework for Principled Analysis of Transformers via Markov Chains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04161","snapshot_observed_at":"2026-08-06T21:41:54.806449Z","title":"Attention with markov: A framework for principled analysis of transformers via markov chains.arXiv preprint arXiv:2402.04161, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.806449Z"},"links":{"cited_paper":"/paper/2402.04161","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:70f679a75fd0165645c686429c509e3861c49139f8c02561978516259fc51ec1","observation_id":"9136c071-c921-468c-b820-01f716a8a1f9","resolution":{"observed_at":"2026-08-06T21:41:54.806449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11757","last_updated":"2024-04-17T21:27:33Z","snapshot_observed_at":"2026-08-05T22:08:42.476061Z","submitted_at":"2024-04-17T21:27:33Z","title":"Language Models Still Struggle to Zero-shot Reason about Time Series","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11757","snapshot_observed_at":"2026-08-06T21:41:54.902737Z","title":"Language models still struggle to zero-shot reason about time series.arXiv preprint arXiv:2404.11757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.902737Z"},"links":{"cited_paper":"/paper/2404.11757","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:47f6f2e47f5537fc581cb5b5efca1412180c05625f43376909b963e8abe738cc","observation_id":"4a4cc56b-1ec5-4cc6-8a9d-a9b0568455fa","resolution":{"observed_at":"2026-08-06T21:41:54.902737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08335","last_updated":"2025-04-10T06:00:58Z","snapshot_observed_at":"2026-08-09T16:32:49.647410Z","submitted_at":"2024-04-12T09:01:14Z","title":"Toward a Theory of Tokenization in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08335","snapshot_observed_at":"2026-08-06T21:41:54.967902Z","title":"Toward a theory of tokenization in llms.arXiv preprint arXiv:2404.08335, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.967902Z"},"links":{"cited_paper":"/paper/2404.08335","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:1f0ecdd0eee2950a21808ed58b9faadec02548658836f6a79e58a6d644993ae6","observation_id":"7d9971e9-a33c-4ab5-a4fc-725df0b3063d","resolution":{"observed_at":"2026-08-06T21:41:54.967902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.518291Z","title":"Pixel-level bpe for auto-regressive image generation","venue":null,"work_id":"06b427f7-d29d-4f70-94e9-36f69905ee35","year":2022},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.035413Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:28186ad17e7bacf0db68f5099a2a399c353272dadf80cf4e58d72a143278ca4b","observation_id":"99163494-5a32-4d4a-af9d-d3e0e4e63147","resolution":{"observed_at":"2026-08-06T21:41:59.606670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05001","last_updated":"2024-11-07T18:59:28Z","snapshot_observed_at":"2026-08-01T08:55:09.990991Z","submitted_at":"2024-11-07T18:59:28Z","title":"Analyzing The Language of Visual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05001","snapshot_observed_at":"2026-08-06T21:41:55.095533Z","title":"Analyzing the language of visual tokens.arXiv preprint arXiv:2411.05001, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.095533Z"},"links":{"cited_paper":"/paper/2411.05001","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:3fda08798a4a01c580e874619d2427d7cfc3d697e707ad85867ddda030f95ca9","observation_id":"65e2c676-d829-4538-a94d-e73944121cd5","resolution":{"observed_at":"2026-08-06T21:41:55.095533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11753","last_updated":"2025-06-01T16:10:59Z","snapshot_observed_at":"2026-07-06T18:32:19.794373Z","submitted_at":"2024-06-17T17:13:08Z","title":"A Semantic-Aware Layer-Freezing Approach to Computation-Efficient Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2406.11753","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11753","snapshot_observed_at":"2026-08-06T21:41:57.697827Z","title":"A Semantic-Aware Layer-Freezing Approach to Computation-Efficient Fine-Tuning of Language Models","venue":"cs.CL","work_id":"91f02b9d-cf90-4fc9-aa7f-3df496df6823","year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.164896Z"},"links":{"cited_paper":"/paper/2406.11753","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:82861ce10da2ace77d9763eba49d60b8319103569220431dee43c5aa5f60dd40","observation_id":"e3fe4b26-24f5-4bad-a652-228daf10189d","resolution":{"observed_at":"2026-08-06T21:41:57.746183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15600","last_updated":"2024-11-26T07:49:12Z","snapshot_observed_at":"2026-07-06T19:06:58.753073Z","submitted_at":"2024-08-28T07:48:39Z","title":"Exploring Selective Layer Fine-Tuning in Federated Learning","version":3},"cited_work":{"arxiv_id":"2408.15600","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.15600","snapshot_observed_at":"2026-08-06T21:41:57.560071Z","title":"Exploring Selective Layer Fine-Tuning in Federated Learning","venue":"cs.LG","work_id":"7473d323-bb60-461a-af9e-42a67ac96e44","year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.268049Z"},"links":{"cited_paper":"/paper/2408.15600","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:1bba49571feb47d452d0eea7a81c9dfc032b9a39eab11b0d8bf5fd642a6572e4","observation_id":"077de308-52d3-442a-bc02-bbce26764b6a","resolution":{"observed_at":"2026-08-06T21:41:57.626943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.401379Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification","venue":null,"work_id":"a7981e36-b01f-41d5-9caa-7ef36114181c","year":2015},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.325277Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:139442f17d58081a369faf48bcaa8e8089b11644d34443b117aaf89b9dd4f0a5","observation_id":"981bc695-6f18-4fbd-8167-9004f152bb67","resolution":{"observed_at":"2026-08-06T21:41:59.442424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18142","last_updated":"2024-09-21T15:22:26Z","snapshot_observed_at":"2026-08-04T13:51:52.964653Z","submitted_at":"2024-09-21T15:22:26Z","title":"A Survey on Multimodal Benchmarks: In the Era of Large AI Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18142","snapshot_observed_at":"2026-08-06T21:41:55.375826Z","title":"A survey on multimodal benchmarks: In the era of large ai models.arXiv preprint arXiv:2409.18142, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.375826Z"},"links":{"cited_paper":"/paper/2409.18142","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:21d7b03f0c6957267e70cc5b062e50d184967f30ef37af4483be36181ca926c3","observation_id":"12192f30-2fac-4490-97fa-162e39571921","resolution":{"observed_at":"2026-08-06T21:41:55.375826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-07-06T19:01:27.827878Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-06T21:41:55.436309Z","title":"A survey on benchmarks of multimodal large language models.arXiv preprint arXiv:2408.08632, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.436309Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:786e68a6bbb755043088f0b5e4f522a524c29785f386975da1570350b767bb31","observation_id":"2bd0f30d-8816-4898-adaf-fc8413a2e385","resolution":{"observed_at":"2026-08-06T21:41:55.436309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:55.516529Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.516529Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:dc2d9693be2559eabfcb73db4b554f45e6eb87e30aeda04a9cb89a9fa9df5c8d","observation_id":"7d3a3677-1ddb-407e-abe5-0762e4c7c939","resolution":{"observed_at":"2026-08-06T21:41:55.516529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:55.606187Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.606187Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:be1fb6cde959aa3418e384909307e19190978223c0ab46c55038217d73c164e8","observation_id":"5bf461eb-40f4-4ff1-b045-c705725af440","resolution":{"observed_at":"2026-08-06T21:41:55.606187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-06T21:41:55.671714Z","title":"Mmbench: Is your multi-modal model an all-around player?arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.671714Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:3b9493a1327eaecde20a2068bded0394c4ef1319a31eded4ccb26ecafc897c3e","observation_id":"72cb88e8-64a8-4d22-bd2e-47e4db4b67fc","resolution":{"observed_at":"2026-08-06T21:41:55.671714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T21:41:55.809922Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.809922Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:37a9bd171ab6a41914f97a902a4c6373aaa7b9264758db680bc0a66002b2f505","observation_id":"81ba791c-6e18-4c35-8f3f-9e6042cd0f98","resolution":{"observed_at":"2026-08-06T21:41:55.809922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:55.904538Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.904538Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:80c919037dfcae41b82d40e8868cd87fce3cca511234208903ba975baa88db3a","observation_id":"5a3742cd-c88d-4525-8100-e84213ff1ae3","resolution":{"observed_at":"2026-08-06T21:41:55.904538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.250332Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"f8dbfd41-08be-4aaa-a042-cac5bf775df2","year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.006889Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:87270c7879da9b5bd961097b89c67414382cdd3e2c2135b392a488e1d56e0b05","observation_id":"d6c8899b-482b-4dc1-8a79-b03640c421f4","resolution":{"observed_at":"2026-08-06T21:41:59.319725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.145493Z","title":"Instructblip: towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"99d9865f-b0b9-4962-863a-5917cedc2a86","year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.146472Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:f86cee6eeb4411791007a217a0303b5524e7a2f4309b7983f7a771435686585f","observation_id":"38ca8925-6387-4d10-93fb-9a00c8f191f3","resolution":{"observed_at":"2026-08-06T21:41:59.178757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:56.195219Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.195219Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:b6839c80119ceca12112eaf2bd7f5336807e4606b1a646ddb5049401a603c6bd","observation_id":"14b2c4c5-2293-4d61-b0c4-41a22caf16cb","resolution":{"observed_at":"2026-08-06T21:41:56.195219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.020222Z","title":"mplug-owl: Modularization empowers large language models with multimodality, 2023","venue":null,"work_id":"2fa184e2-e28e-46a0-be8f-5a05f7bce975","year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.339136Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:c5a4f764ae2779567ddb615848a171498b86bb2a311847d7a592c1f44b0fe4c4","observation_id":"b59c49a0-dc63-46cf-967d-66606af31a34","resolution":{"observed_at":"2026-08-06T21:41:59.070947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:56.453016Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.453016Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:6a3e807876bbb5752b87b7dae380a22fd64b2f0c06b1fc7ebb1d312dc7ee5ccc","observation_id":"7497e7c1-2a3d-44d7-a0cf-e234318c7f90","resolution":{"observed_at":"2026-08-06T21:41:56.453016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:58.851408Z","title":"Hyperllava: Dynamic visual and language expert tuning for multimodal large language models, 2024","venue":null,"work_id":"5437d34d-8c71-4a19-9a03-92a10a8e6fcb","year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.541168Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:a65f56ef6087f92ba0f36ab9bda4b1b2aa56f1f67981cd7ba56f309db00cca31","observation_id":"c35a48af-9d8b-4ec5-8b89-de100a1fd173","resolution":{"observed_at":"2026-08-06T21:41:58.920856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-06T21:41:56.615410Z","title":"Sharegpt4v: Improving large multi-modal models with better captions.arXiv preprint arXiv:2311.12793, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.615410Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:58c084aa300117846aeb1e4fb859083986a904086bcfdf41874780c3cc7de8d1","observation_id":"0bdf722b-94a7-4898-a7a9-10dd7bf76d1d","resolution":{"observed_at":"2026-08-06T21:41:56.615410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:56.711512Z","title":"Vila: On pre-training for visual language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.711512Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:1953ecf41c522b036296bfc984454f4600e64d2d04f36113f91b95f842060a97","observation_id":"0d5f0ccf-bdad-4abd-aa59-8982c2369309","resolution":{"observed_at":"2026-08-06T21:41:56.711512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:41:56.795379Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.795379Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:9ee74bfd4e92275a8134ab834c8497cfa5480a41fff79d4bf4ec17ae9c04ac6f","observation_id":"b6543114-bace-461b-889d-350cb30c3cfe","resolution":{"observed_at":"2026-08-06T21:41:56.795379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:58.716411Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"bab960bd-38ad-4f46-9b30-5d31e74500ed","year":2018},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.942368Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:2011e949181c48ba3cb936dbf72a14fc69492b3c9d9a43ed4c71332e17a6470b","observation_id":"b98bea3a-bbb0-48c6-81be-9b3e47a38762","resolution":{"observed_at":"2026-08-06T21:41:58.779225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:58.559210Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advancesin Neural Information Processing Systems, 35:25278–25294, 2022","venue":null,"work_id":"71b1cf8f-1dde-40e8-9500-30015bfa933d","year":2022},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.024279Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:d60a3a84c900ad884cc05cb025c3f5d295a2bba94b60616c4a98f0be89a4637b","observation_id":"e4ee348a-c6c8-4e94-bbd9-24ef3c999c51","resolution":{"observed_at":"2026-08-06T21:41:58.633479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:57.082546Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.082546Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:476b5f152947d8afa399a957f3635d56932ac6adde32a84f824ac921bc379b34","observation_id":"eb35cce0-617a-4291-8d8a-ba3cbe3e9ca5","resolution":{"observed_at":"2026-08-06T21:41:57.082546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:57.138710Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.138710Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:6314a3bf5a302d63c2a8f843d4984475631aa5eceb7befb439604cfa6ded7a90","observation_id":"f070fbc9-7d31-495a-b523-63b483c7784c","resolution":{"observed_at":"2026-08-06T21:41:57.138710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:41:57.184367Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.184367Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:1935ebdaf84a302725bba1465e992b8368d431e73b8181da6d2748e5e641e405","observation_id":"01018029-1a25-490c-90db-70a372e72504","resolution":{"observed_at":"2026-08-06T21:41:57.184367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:57.241233Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.241233Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:ac9bc349fb82ab1441fd0f47f435478163fdf6bee8ad66003ca722ab7a9ee070","observation_id":"4af90841-7a56-4b60-89ce-66678354582c","resolution":{"observed_at":"2026-08-06T21:41:57.241233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-07-06T19:38:57.409491Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-06T21:41:57.327402Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.327402Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:b52be0a57d56e7f5e455eb507a2ac4db95dccd5dfb0302df4763658f90067e86","observation_id":"4cb5fe32-b9e9-42ac-9d5d-df4e41a384bb","resolution":{"observed_at":"2026-08-06T21:41:57.327402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:58.394333Z","title":"• Reasoning Data (RD): We utilize 504K general QA entries and 343K reasoning-focused entries from the LLaVA-OneVision Dataset [71]","venue":null,"work_id":"f555a97d-9990-441d-8ec6-aede6149da7f","year":null},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.394029Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:316b6224f1bb435c8027c6c1e7d6392c58b83879c4b8a5339339873646aae507","observation_id":"a65df49f-9baf-4d94-89dc-31f0ad9adbc7","resolution":{"observed_at":"2026-08-06T21:41:58.451432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":3,"verified_fuzzy":14},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 4 inbound Pith citation observations for arXiv:2506.23639."}