{"as_of":"2026-08-09T17:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f3786215f5726e671ba15013a6c35f2c29c9ff949a93d3b87a0faa2591720e7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:44:58.818749Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:18:44.037310Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":"2206.08916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-03T17:18:44.037310Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.ArXiv, abs/2206.08916","venue":null,"work_id":"f27369a9-dc92-4410-8e8c-77255fa63f95","year":2022},"citing_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"reference_index":198,"source":"arxiv_source","source_observed_at":"2026-05-16T09:29:05.956863Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2209.06794"},"observation_digest":"sha256:0d040b94208553c16516d7fa94bb24759a1cb9477ada3072772cc28da45c2608","observation_id":"a1f6a5bc-6a6b-4eff-9270-32a7c46fc751","resolution":{"observed_at":"2026-05-16T09:29:06.215627Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":"2206.08916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-03T17:18:44.037310Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.ArXiv, abs/2206.08916","venue":null,"work_id":"f27369a9-dc92-4410-8e8c-77255fa63f95","year":2022},"citing_paper":{"arxiv_id":"2307.05663","last_updated":"2023-07-11T17:57:40Z","snapshot_observed_at":"2026-07-06T15:52:52.180267Z","submitted_at":"2023-07-11T17:57:40Z","title":"Objaverse-XL: A Universe of 10M+ 3D Objects","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T13:02:11.512409Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2307.05663"},"observation_digest":"sha256:08d7c54a9f0e3447438f3e4ed85f937ffbcfeee735c5e74d89250e4634298e37","observation_id":"5af69b53-b45f-4708-8630-98950a2d779f","resolution":{"observed_at":"2026-05-17T13:02:11.638947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":"2206.08916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-03T17:18:44.037310Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.ArXiv, abs/2206.08916","venue":null,"work_id":"f27369a9-dc92-4410-8e8c-77255fa63f95","year":2022},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-06T04:08:15.266897Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:c643737bfa0418303d1d7ecc635fbf52982fd4ccb1723d82f4c6886813a8205e","observation_id":"ae304f91-df2e-44eb-85c5-d36eacc2c498","resolution":{"observed_at":"2026-05-18T03:18:51.723093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":"2206.08916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-03T17:18:44.037310Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.ArXiv, abs/2206.08916","venue":null,"work_id":"f27369a9-dc92-4410-8e8c-77255fa63f95","year":2022},"citing_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T22:09:16.622717Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2406.06525"},"observation_digest":"sha256:094791fc45e425145a1b8ba6062ae82db2e2a2bc9adb04d6c6f8e346af799159","observation_id":"57d8c058-f261-4e64-bae7-caa00386527f","resolution":{"observed_at":"2026-05-11T22:09:16.941469Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-09T04:44:58.818749Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T04:38:45.202731Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.818749Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:61b9a66f197951e60baae22bf1e53c922968151afbd5ae7ac54bb874ac7f8f8e","observation_id":"18821cef-6e58-4eb4-af69-e4f3a8c919e3","resolution":{"observed_at":"2026-08-09T04:44:58.818749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-08T12:20:08.262482Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07855","last_updated":"2025-06-13T12:20:30Z","snapshot_observed_at":"2026-08-08T16:43:44.128026Z","submitted_at":"2025-02-11T14:04:43Z","title":"Vision-Language Models for Edge Networks: A Comprehensive Survey","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:08.262482Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2502.07855"},"observation_digest":"sha256:8e08d32256a05335500d5405ec692614fc079ba39afe92130401a3d4eeec69b6","observation_id":"8a54fbf0-55d9-4f9f-b408-f2d3202d4874","resolution":{"observed_at":"2026-08-08T12:20:08.262482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T15:34:54.204865Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv:2206.08916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-07T20:35:28.075030Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.204865Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:6249210b8166931020797738e35580d2550017fa90f1ae321d6ba486afadb0b0","observation_id":"a974054f-a8f6-4b30-9fba-5ae051fc1008","resolution":{"observed_at":"2026-08-07T15:34:54.204865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T14:18:55.397888Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-07T14:12:06.053516Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:55.397888Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:7c0ded33c9df7064e029513fc5ca52269a1b2bcc7415b45b3801f5f74562b9a1","observation_id":"e685d759-ba8f-47d8-b3a2-b88bacd1eddc","resolution":{"observed_at":"2026-08-07T14:18:55.397888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T14:05:01.991113Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:01.991113Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:c5d46e9d24c790d63ef4928a4b1178f00610c6ca563b4c1c90f8e61c13197118","observation_id":"083b6baa-5d7f-478c-88d3-a32dcd1b8eb4","resolution":{"observed_at":"2026-08-07T14:05:01.991113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T11:36:40.825255Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv preprint arXiv:2206.08916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-09T08:34:10.848320Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.825255Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:707d34ddbf10b1b2a0fdd1606287a0ba64e6156bbefa3ee53a8e4e5fdb9d943a","observation_id":"529958fe-3f15-4769-8f18-a9bcdd368ede","resolution":{"observed_at":"2026-08-07T11:36:40.825255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T11:14:26.091512Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv preprint arXiv:2206.08916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-09T09:01:12.643234Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.091512Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:b50372f9f3a9847aaa0b9ebccedfb259ec566ab77b94778518b5e32b70adb35f","observation_id":"0330e435-b54c-45b0-8640-3fb3636ff3be","resolution":{"observed_at":"2026-08-07T11:14:26.091512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T05:49:53.505625Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.505625Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:a15fe782a7f63a158a587b747e6a40c34a74d83f1748f18bf01135ab7d6964b6","observation_id":"8129eeaa-5041-402e-90f5-2c55f99f7835","resolution":{"observed_at":"2026-08-07T05:49:53.505625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T05:26:02.310361Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.310361Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:f01b289b02cfa212e2c28fb2bd1ffd9680b16d04c6484e4b81dedcb092bb78b1","observation_id":"446505ae-d8ab-4536-8a30-77cdf3a0a24c","resolution":{"observed_at":"2026-08-07T05:26:02.310361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T04:43:51.884460Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-07T21:45:10.885875Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:51.884460Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:88427baadb4a93b6854940b8550cb7d6fcaca61f5cef06c243df1af35fad3afa","observation_id":"71529ebe-e13d-4b3c-9d1c-94d7a2f340da","resolution":{"observed_at":"2026-08-07T04:43:51.884460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-06T21:41:51.615891Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv preprint arXiv:2206.08916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-09T16:42:27.229071Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.615891Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:d6855d464f9a012a7e4a5ebc28aa014bb1a01211cf574123249de698902c1544","observation_id":"40c626f2-5ee3-4f25-95ef-a2428b0320ff","resolution":{"observed_at":"2026-08-06T21:41:51.615891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-06T21:12:05.931398Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00868","last_updated":"2025-07-02T09:16:31Z","snapshot_observed_at":"2026-08-09T09:46:50.040681Z","submitted_at":"2025-07-01T15:32:23Z","title":"Is Visual in-Context Learning for Compositional Medical Tasks within Reach?","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:05.931398Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2507.00868"},"observation_digest":"sha256:6cd2cd571d935ec33a844226f4ba8539f59ff53ca3270c591922771ed96e8a6b","observation_id":"5c500d54-2f44-47a8-bf42-e6aab6e177ed","resolution":{"observed_at":"2026-08-06T21:12:05.931398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-06T20:25:27.623864Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02771","last_updated":"2025-07-03T16:34:34Z","snapshot_observed_at":"2026-08-09T00:45:22.366107Z","submitted_at":"2025-07-03T16:34:34Z","title":"Grounding Intelligence in Movement","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.623864Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2507.02771"},"observation_digest":"sha256:11fa82e6a756975262c790ad2c251463e412cb42fc610ba88b9888084c709f25","observation_id":"e546804f-2ced-4318-aeb4-ad53f3e54008","resolution":{"observed_at":"2026-08-06T20:25:27.623864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-06T15:48:29.595479Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-09T02:21:57.024481Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:29.595479Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:64a996e18bb8ecda4619c680934b72f38b921e2910759178fd8668d304227045","observation_id":"3d48944d-23b5-4973-ace7-88db099cecdf","resolution":{"observed_at":"2026-08-06T15:48:29.595479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":"2206.08916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-03T17:18:44.037310Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.ArXiv, abs/2206.08916","venue":null,"work_id":"f27369a9-dc92-4410-8e8c-77255fa63f95","year":2022},"citing_paper":{"arxiv_id":"2512.06581","last_updated":"2026-04-08T16:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-06T22:27:59Z","title":"MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T00:14:56.268778Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2512.06581"},"observation_digest":"sha256:8380f02a07af38abcd8e8c866347b6aa138f46daf9dafdb6a39ab0bbcde0df49","observation_id":"86f3f575-5e5f-445e-8920-db1c4aa906ec","resolution":{"observed_at":"2026-05-17T00:18:43.931214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-03T07:53:48.871339Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv preprint arXiv:2206.08916,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18929","last_updated":"2026-07-16T17:38:57Z","snapshot_observed_at":"2026-08-09T11:48:35.087059Z","submitted_at":"2026-01-26T20:04:57Z","title":"On the Role of Depth in Surgical Vision Foundation Models: An Empirical Study of RGB-D Pre-training","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-03T07:53:48.871339Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2601.18929"},"observation_digest":"sha256:172135191f219348499d52943ff2084852b5f247362f432e50e23a2a884c1cc4","observation_id":"4414eaf0-8606-4f5f-90d1-088fd1508bb6","resolution":{"observed_at":"2026-08-03T07:53:48.871339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":"2206.08916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-03T17:18:44.037310Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.ArXiv, abs/2206.08916","venue":null,"work_id":"f27369a9-dc92-4410-8e8c-77255fa63f95","year":2022},"citing_paper":{"arxiv_id":"2602.12370","last_updated":"2026-04-16T20:43:03Z","snapshot_observed_at":"2026-08-02T07:45:27.779427Z","submitted_at":"2026-02-12T20:02:21Z","title":"LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T05:01:11.880003Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2602.12370"},"observation_digest":"sha256:4463f02d93e26eebf1188d2dffb4065cf21007bd0ad06d993ef477b7f14567a5","observation_id":"de1818f7-d813-403e-b2d3-770f40479d4f","resolution":{"observed_at":"2026-05-16T05:02:19.639749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":"2206.08916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-03T17:18:44.037310Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.ArXiv, abs/2206.08916","venue":null,"work_id":"f27369a9-dc92-4410-8e8c-77255fa63f95","year":2022},"citing_paper":{"arxiv_id":"2604.23272","last_updated":"2026-04-25T12:28:47Z","snapshot_observed_at":"2026-08-01T01:40:08.735966Z","submitted_at":"2026-04-25T12:28:47Z","title":"Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T08:12:14.321695Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2604.23272"},"observation_digest":"sha256:ec85797e79aeef94637c82b49bc400171374b6eeace01c9b84d7b1253535835e","observation_id":"12a1438e-57bd-4ec8-b060-cf3f501a0141","resolution":{"observed_at":"2026-05-11T20:46:09.717580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":"2206.08916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-03T17:18:44.037310Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.ArXiv, abs/2206.08916","venue":null,"work_id":"f27369a9-dc92-4410-8e8c-77255fa63f95","year":2022},"citing_paper":{"arxiv_id":"2606.17030","last_updated":"2026-06-17T13:54:57Z","snapshot_observed_at":"2026-08-01T21:48:31.832288Z","submitted_at":"2026-06-15T17:52:31Z","title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","version":3},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-06-27T04:19:26.332718Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2606.17030"},"observation_digest":"sha256:06cfe5474e7c200552376a5c456103b697cd2b1787541307585d8c2103b2b296","observation_id":"baf255d8-f9fd-46ca-8ed8-7e50cc722152","resolution":{"observed_at":"2026-07-03T17:18:44.038647Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":"2206.08916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-03T17:18:44.037310Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.ArXiv, abs/2206.08916","venue":null,"work_id":"f27369a9-dc92-4410-8e8c-77255fa63f95","year":2022},"citing_paper":{"arxiv_id":"2607.01768","last_updated":"2026-07-02T06:34:37Z","snapshot_observed_at":"2026-07-07T00:07:19.026006Z","submitted_at":"2026-07-02T06:34:37Z","title":"JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-03T16:22:31.982484Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2607.01768"},"observation_digest":"sha256:d0d590d2abaed1bec180a344316f53d1d88dc10ecae7a0e8b28f7463dcbcf53d","observation_id":"bde73f9d-46ea-42af-ba62-e49c096c564c","resolution":{"observed_at":"2026-07-03T16:28:38.368478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2206.08916 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:93637c7213ce2f38899668dff3ad810b1cdb42fe79cfd6b747e08410c7669f86","observation_id":"564e6f96-593b-4fac-a887-9ee827fb2ff0","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-14T03:31:19.309532Z","title":"arXiv:2206.08916 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-06T12:36:13.363835Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-07-14T03:31:19.309532Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2607.11738"},"observation_digest":"sha256:1f150c6a5996b67b08222d3758b05e9ca297ed38832a974ab2acd3f8c88bb44c","observation_id":"44a4d8c8-6f4d-4fcb-8ebf-b5d8d4230cd6","resolution":{"observed_at":"2026-07-14T03:31:19.309532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-31T23:40:55.041093Z","title":"Unified- IO: A unified model for vision, language, and multi-modal tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23370","last_updated":"2026-07-25T21:25:12Z","snapshot_observed_at":"2026-08-07T23:27:08.198556Z","submitted_at":"2026-07-25T21:25:12Z","title":"Bitcoin Price Direction Prediction via Regime-Aware Multi-Modal Fusion of Social Sentiment and Technical Features","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:40:55.041093Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2607.23370"},"observation_digest":"sha256:ef65c8a135620238aa94d5f7ab5f52ae57e23ddc150eabc6d0c9d52365f246d6","observation_id":"f98a7a04-3648-44f8-889e-ca36a41f7dc5","resolution":{"observed_at":"2026-07-31T23:40:55.041093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-31T22:25:12.401226Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv preprint arXiv:2206.08916,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-07-31T22:25:11.476976Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.401226Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:d90dd1ee12846b5135d588e63d093ee350109c356ec09b957e3f6fc5d34e43fb","observation_id":"5792015c-7b09-4844-ad46-4aa3ae0fcff8","resolution":{"observed_at":"2026-07-31T22:25:12.401226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2206.08916/citation-record","integrity":"/paper/2206.08916/integrity","json":"/paper/2206.08916/citation-record.json","paper":"/paper/2206.08916"},"outbound":[],"paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2206.08916."}