{"as_of":"2026-08-18T15:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7459d236b255dc5ff68e87b2cb1b1bb29d1653df44865c0a591a3df7566e19cb","coverage":[{"denominator":222,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:43:49.218178Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.09954/citation-record","integrity":"/paper/2506.09954/integrity","json":"/paper/2506.09954/citation-record.json","paper":"/paper/2506.09954"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T04:43:32.161463Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:32.161463Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:5cd73edab55bbcd1333188b60d1582dab7fe459ac343b19215f864c76695638b","observation_id":"170492ca-7001-4dd5-b2c7-0adcd413ce29","resolution":{"observed_at":"2026-08-07T04:43:32.161463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-08-14T20:09:04.632955Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-08-07T04:43:32.301013Z","title":"Deep learning using rectified linear units (relu)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:32.301013Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:4c662ea8e5ce6426eb3dbe0c2e6e01ba54cd19547a4f0f7b164abe780a7fa79d","observation_id":"11b6f81b-f26d-4862-8abb-66cd72e73c3e","resolution":{"observed_at":"2026-08-07T04:43:32.301013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:32.492863Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:32.492863Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:89818a7f09d6ae02f4b1ce0f9928d411155862f66466c433190019ed5f6dd4d0","observation_id":"fd7ab959-d6a4-4d1d-8a68-11faf61f2e16","resolution":{"observed_at":"2026-08-07T04:43:32.492863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:32.624205Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:32.624205Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:70f7a13a0553ff459e5abac0548facdd6dd94c3dacf2bd1cabe0db510f6af964","observation_id":"dda91768-a04a-4500-8903-48c57bc8f19f","resolution":{"observed_at":"2026-08-07T04:43:32.624205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:32.808840Z","title":"Neural module networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:32.808840Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:d5a466ad906e23e7d54df07d074aaea6d79fc1e1b3d0c15abd10d6519ca301c0","observation_id":"b3433fa7-8647-45a5-a85b-412f0a3ab4e9","resolution":{"observed_at":"2026-08-07T04:43:32.808840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:32.944266Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:32.944266Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:01553b29bad34c78ba6d890bbd0318bdd877f7aaa3d3172957ef2f6b6c5fbdfb","observation_id":"d088b8bf-1a37-4879-abb3-8a7b17cf882a","resolution":{"observed_at":"2026-08-07T04:43:32.944266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-16T14:03:39.369872Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-07T04:43:33.106252Z","title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:33.106252Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:3aa3f4ff4ae21e7ab4ccf6356f631ac0ae1f2049d863195c0f303234ab6a25a3","observation_id":"8be7d67e-4201-4abc-acb6-e92aa4708ba6","resolution":{"observed_at":"2026-08-07T04:43:33.106252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13721","last_updated":"2023-07-25T17:59:18Z","snapshot_observed_at":"2026-08-18T09:05:58.448899Z","submitted_at":"2023-07-25T17:59:18Z","title":"Foundational Models Defining a New Era in Vision: A Survey and Outlook","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13721","snapshot_observed_at":"2026-08-07T04:43:33.268444Z","title":"Foundational models defining a new era in vision: A survey and outlook","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:33.268444Z"},"links":{"cited_paper":"/paper/2307.13721","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:dc8dc137892c43f8abc439becc79a3f0e38b4123aeedf0e39317fdf0a2992347","observation_id":"92a4b703-3a1e-4f75-a2fa-9085b94f0e45","resolution":{"observed_at":"2026-08-07T04:43:33.268444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T04:43:33.429052Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:33.429052Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:43b6f69e8cdcdbd39a09742fb20b519c75288275d0cc9de04e706bf27ced35ba","observation_id":"4d794112-46c5-4cc3-99bb-02288db94b87","resolution":{"observed_at":"2026-08-07T04:43:33.429052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:33.515279Z","title":"Multimae: Multi-modal multi-task masked autoencoders","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:33.515279Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:8cb11ea4b19e824071151c2c445870a6b2bcccdc0db7b1948fa505ae021cf32c","observation_id":"da406ff8-ded6-4204-a7c5-c206e9a54b5d","resolution":{"observed_at":"2026-08-07T04:43:33.515279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06418","last_updated":"2025-02-21T08:19:31Z","snapshot_observed_at":"2026-08-16T16:32:41.415020Z","submitted_at":"2022-09-14T05:05:55Z","title":"Graph Perceiver IO: A General Architecture for Graph Structured Data","version":2},"cited_work":{"arxiv_id":"2209.06418","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06418","snapshot_observed_at":"2026-08-07T04:44:08.809212Z","title":"Graph Perceiver IO: A General Architecture for Graph Structured Data","venue":"cs.LG","work_id":"cb25eed9-7a4f-44a0-aaa1-1ef9e3b58f8d","year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:33.610330Z"},"links":{"cited_paper":"/paper/2209.06418","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:773cff2c10e04d3dcee15f4b0f6a7b8ec6314f14df319aabf5d4e4114b2b2a0a","observation_id":"eddf264e-d766-4325-b410-eab7a6996f9f","resolution":{"observed_at":"2026-08-07T04:44:08.902937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:33.753726Z","title":"Data2vec: A general framework for self-supervised learning in speech, vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:33.753726Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:71dd378a07239a3f062feb385ac3934d8b3ec6abaf94a3e076394f7dc85c1db9","observation_id":"55253928-6d62-4585-8989-bc968d08efce","resolution":{"observed_at":"2026-08-07T04:43:33.753726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04408","last_updated":"2022-12-08T17:07:09Z","snapshot_observed_at":"2026-08-16T16:10:00.100476Z","submitted_at":"2022-12-08T17:07:09Z","title":"OFASys: A Multi-Modal Multi-Task Learning System for Building Generalist Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04408","snapshot_observed_at":"2026-08-07T04:43:33.884437Z","title":"Ofasys: A multi-modal multi-task learning system for building generalist models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:33.884437Z"},"links":{"cited_paper":"/paper/2212.04408","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:4ff2a9b5fa5bea6432be69c3e7e0226c7c220047b65c070b29d6595992aed545","observation_id":"d1f3a525-27a8-4630-a34b-89abd0681f0e","resolution":{"observed_at":"2026-08-07T04:43:33.884437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T04:43:34.007655Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:34.007655Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:a6aa5f3c42c4e30467889ce8eabe51760277da540312d62f480847f641248ce9","observation_id":"bf4d225b-6fa5-4514-bf1a-065548e5d0fe","resolution":{"observed_at":"2026-08-07T04:43:34.007655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:43:34.123786Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:34.123786Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:7b7b142c82084c14fa05efcbec1e41856979207b6e42fecc12463359fba0193f","observation_id":"127adca0-bb3f-4319-8cbc-aea36c14eda3","resolution":{"observed_at":"2026-08-07T04:43:34.123786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:34.225106Z","title":"Sequential modeling enables scalable learning for large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:34.225106Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:4f377a625dd0a5dc5257e176c1dfc5c453c0bcf9616762957944b941d3321428","observation_id":"f0484fda-7151-4cb3-8b01-1c6adab20335","resolution":{"observed_at":"2026-08-07T04:43:34.225106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:34.375878Z","title":"Visual prompting via image inpainting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:34.375878Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:002e625b95429af0128a520d97ce4e4303c3911dd1099a15d966173b9d23a02d","observation_id":"81e0a385-e574-44b8-84f6-362c34c4d02a","resolution":{"observed_at":"2026-08-07T04:43:34.375878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-07T04:43:34.481533Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:34.481533Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:f11636b467cb83b1470896676c97780da377a962626d3afb2e7fb64fb8468a58","observation_id":"3fd5a6a7-ad46-4fb6-b29d-59a30bc2ac10","resolution":{"observed_at":"2026-08-07T04:43:34.481533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:34.595969Z","title":"Mult: An end-to-end multitask learning transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:34.595969Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:9b730568a2f2525487bcf22fc465bd3ad1d2e24f58c0331c15fe358ce7b2ba25","observation_id":"59a1f3ea-9d07-4c95-bde1-319ffce3e17a","resolution":{"observed_at":"2026-08-07T04:43:34.595969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T04:43:34.702680Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:34.702680Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:bfa81a1ae52f360bd2d7dd5fc83ca5edc7173a4d2ecd8dd50c8f1950860e02b9","observation_id":"d3e906be-d1bc-428e-bcac-c705dee63da9","resolution":{"observed_at":"2026-08-07T04:43:34.702680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:35.039485Z","title":"What one intelligence test measures: a theoretical account of the processing in the raven progressive matrices test","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:35.039485Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:e68a52da5a679eb8c5cba8df98a93952c9593cea56d7a001f28110251f594421","observation_id":"3527e882-6dab-4a35-ae35-e46fa12c112e","resolution":{"observed_at":"2026-08-07T04:43:35.039485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10890","last_updated":"2022-11-03T18:34:02Z","snapshot_observed_at":"2026-08-16T17:19:31.295522Z","submitted_at":"2022-02-22T13:39:14Z","title":"HiP: Hierarchical Perceiver","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10890","snapshot_observed_at":"2026-08-07T04:43:37.724569Z","title":"Hip: Hierarchical perceiver","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:37.724569Z"},"links":{"cited_paper":"/paper/2202.10890","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:63207c1b7fd3e5d1dd28378df8e94367233a65550e74c01e39548e835c5e2846","observation_id":"f8c778f6-75ea-4d8d-9587-6f59cba1f1bb","resolution":{"observed_at":"2026-08-07T04:43:37.724569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:37.902765Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:37.902765Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:cb5fd86901f27e3452c72b66416bf65f7f8d60891a3a26563da9d4754eaaa9d5","observation_id":"d3b70e7e-b3d8-45c1-8cf4-919570648fb2","resolution":{"observed_at":"2026-08-07T04:43:37.902765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-07T04:43:38.064012Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:38.064012Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:f61e84bd752efae7ce0426b8f7893709680fdc9a24de748e676544c7104e26c7","observation_id":"ef691314-189e-4fde-9261-15bab6d652eb","resolution":{"observed_at":"2026-08-07T04:43:38.064012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T04:43:38.403191Z","title":"Shikra: Unleashing multimodal llm's referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:38.403191Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:f95df6a26ef05095e6d25d0d25dc0de5a92d6b8b9e2df39b91513fd89546a184","observation_id":"6aca9191-08e3-412e-818a-2e2fa2143fde","resolution":{"observed_at":"2026-08-07T04:43:38.403191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:38.558566Z","title":"Autoformer: Searching transformers for visual recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:38.558566Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:9a31b4fdf28a6a4f19c9d3fb7d3794f6b4c73fec1b58c37ef31c230493652edb","observation_id":"68732d81-8f1b-4a22-abae-203b7895dc93","resolution":{"observed_at":"2026-08-07T04:43:38.558566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06366","last_updated":"2023-10-12T22:25:43Z","snapshot_observed_at":"2026-08-16T16:24:47.193356Z","submitted_at":"2022-10-12T16:18:25Z","title":"A Generalist Framework for Panoptic Segmentation of Images and Videos","version":4},"cited_work":{"arxiv_id":"2210.06366","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.06366","snapshot_observed_at":"2026-08-07T04:44:08.596575Z","title":"A Generalist Framework for Panoptic Segmentation of Images and Videos","venue":"cs.CV","work_id":"1ce3e67e-42f1-45fd-804f-d215439f8ed7","year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:38.767467Z"},"links":{"cited_paper":"/paper/2210.06366","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:0686fbcb8db915f690d6a9bc7121f5a404de23056063b3434a39aaf1f1730b83","observation_id":"20d558c9-03d1-460a-bf15-f7bd0da26a2b","resolution":{"observed_at":"2026-08-07T04:44:08.653600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:38.906223Z","title":"A unified sequence interface for vision tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:38.906223Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:3f13ef4de0be30d4fa2bec438aeae8f73cadf00d484c3e04a9c9cd0c671f7471","observation_id":"b7cbd325-4c3d-404c-9a13-e4a87d1106bd","resolution":{"observed_at":"2026-08-07T04:43:38.906223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-16T15:49:09.216982Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-07T04:43:39.103950Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:39.103950Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:862e588f20d8c52eb0bbb7f8a800fb8e71a78f084acaec77a87c27f0b42272af","observation_id":"5b8afdf7-8fad-4379-8551-339e586231ee","resolution":{"observed_at":"2026-08-07T04:43:39.103950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-07T04:43:39.348446Z","title":"Pali-x: On scaling up a multilingual vision and language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:39.348446Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:92e541e2e8c9f871211a52dfebecde76ad8f7584d941158fe84eb9d3a4949e9f","observation_id":"6d47b4a3-6534-4612-9afc-9bfa39b894ce","resolution":{"observed_at":"2026-08-07T04:43:39.348446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:39.481354Z","title":"Learning a low-level vision generalist via visual task prompt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:39.481354Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:e87c25ff88fc3d7a43231c46b40d9a97dbb41b0f7fd111e453a6d4b6a5bc6de1","observation_id":"56a37139-f307-4f1d-b085-0b1804378a07","resolution":{"observed_at":"2026-08-07T04:43:39.481354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T04:43:39.618344Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:39.618344Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:3b15b578459f0792382ffe29dd56c4c747a4e19f6a5f2a3e3ecf932682519c3e","observation_id":"86253100-b9d1-466e-872a-67e9ae83c7dc","resolution":{"observed_at":"2026-08-07T04:43:39.618344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:39.786113Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:39.786113Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:2edf56bc48b21e469a3c03ea9b2f2b868ea7f55459a331f05c707edbb11daf07","observation_id":"3449b306-e90d-4667-8150-d155d9118250","resolution":{"observed_at":"2026-08-07T04:43:39.786113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:39.930759Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:39.930759Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:b1875585a3cf7e93053fd122c4b9fc41f529a2a73963f8afff4c7a12422bc9c4","observation_id":"808eb52b-9a43-4682-89a6-bbda36e0dd47","resolution":{"observed_at":"2026-08-07T04:43:39.930759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:40.112973Z","title":"Gradnorm: Gradient normalization for adaptive loss balancing in deep multitask networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:40.112973Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:4ba1a6c4929c1f82441982a183237d668d358f87c2085734b037681f068b2dfc","observation_id":"ef054bdd-1664-49f3-9945-9a196a359437","resolution":{"observed_at":"2026-08-07T04:43:40.112973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:40.257715Z","title":"Per-pixel classification is not all you need for semantic segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:40.257715Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:66fa2c57bee9b3e7486ba0a9faf0f9d29fe01221530d53a94467f045c601f951","observation_id":"1254a781-eb71-4467-895a-e0596341041a","resolution":{"observed_at":"2026-08-07T04:43:40.257715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:40.435426Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:40.435426Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:635e2a6e83e17d894ca917ba5067de4f48ae1aaf9e3730c4170d94f41a9fadf2","observation_id":"6f797c5f-c547-49b1-8f41-2270661b9308","resolution":{"observed_at":"2026-08-07T04:43:40.435426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:40.528315Z","title":"Unifying vision-and-language tasks via text generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:40.528315Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:2d6d18b4316fab1a3e8932f5e8636188c627239768c3a3484234526a4f407dd4","observation_id":"6818b099-ca34-4e96-8c1c-65b719307360","resolution":{"observed_at":"2026-08-07T04:43:40.528315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-16T18:43:58.639735Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-07T04:43:40.606136Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:40.606136Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:0f0ba0c841f49b235924d321c513c9849735bdafe5a522a6cd9f53580c1713a0","observation_id":"dcc5ce5f-76eb-4247-8dea-4353601196d6","resolution":{"observed_at":"2026-08-07T04:43:40.606136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:40.694473Z","title":"Instance-aware semantic segmentation via multi-task network cascades","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:40.694473Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:7465d297fdc8a37d41875f63cc35e526dc248d22edecf4dec94021eb2f595d31","observation_id":"394a616e-3668-4058-adba-c3c6372cd344","resolution":{"observed_at":"2026-08-07T04:43:40.694473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T04:43:40.810289Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:40.810289Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:96f586479a8ce0c7b5d31f18a842fa33d04d0bba3324e9efe9a861434c13d2ef","observation_id":"5d7f965a-1865-44fc-978d-b74a856fa843","resolution":{"observed_at":"2026-08-07T04:43:40.810289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:40.887551Z","title":"Decoupling zero-shot semantic segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:40.887551Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:e8edef79e49093758e7bb2b2434b982e0ce81d8653a8e9f688cf86fb57425a66","observation_id":"7c327d4b-604d-40e0-97fe-0b3d6755a824","resolution":{"observed_at":"2026-08-07T04:43:40.887551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T04:43:40.947027Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:40.947027Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:0e20d8a33a7a3a1bbae85ed2cc7469664a0c2dda00fac389dabb14510f92f5cb","observation_id":"f74f887e-624d-4bc1-b7b7-c877a16aa6c6","resolution":{"observed_at":"2026-08-07T04:43:40.947027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-07T04:43:41.092048Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:41.092048Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:cc2c98f87b7d8f20b1e7318027f9bbb361aef2488394eed502c875a9ad7eb491","observation_id":"76496712-ffb0-4f33-a0c8-dcf07cc78315","resolution":{"observed_at":"2026-08-07T04:43:41.092048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:41.218617Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:41.218617Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:f88f24c568a0d72437a0b81b06f344587872e6f74336b582a4cd4cbe9dfe9fd7","observation_id":"27e29feb-4249-43a0-80c4-70078c272ae5","resolution":{"observed_at":"2026-08-07T04:43:41.218617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:41.312439Z","title":"Multi-modal alignment using representation codebook","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:41.312439Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:83ef397f7c0ed362f18812edb41f773ec7c6f0a7a21e11da470a3ab87503d8af","observation_id":"fd737cc9-e891-4ce8-8965-e2194fa52c25","resolution":{"observed_at":"2026-08-07T04:43:41.312439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:41.401628Z","title":"Low resource dependency parsing: Cross-lingual parameter sharing in a neural network parser","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:41.401628Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:67e94a43f4a14b148ee06134a0d831d12b28d7f6bdd610bc5af4c5a90d1c0b2b","observation_id":"8a70b3b4-f3b5-4b38-aa5a-dbcb44eb9a9b","resolution":{"observed_at":"2026-08-07T04:43:41.401628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:41.537311Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:41.537311Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:6a471fd118ca2d7d3e2c13cbe4de0c61fbe57cd86328523cd2efef4ea4685934","observation_id":"7f022ef0-546d-47ef-87af-fef343b19160","resolution":{"observed_at":"2026-08-07T04:43:41.537311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:41.642922Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:41.642922Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:a67b6ba84e940c266a95f316c6eff09829bc1429e69f404c5db2735e099cf534","observation_id":"3bf1de95-4651-418a-9a3e-43aa77d84d8c","resolution":{"observed_at":"2026-08-07T04:43:41.642922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:41.769713Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:41.769713Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:97f337afbc0219280cfe29ccbde761aab47a213d9685b7953442434025280780","observation_id":"a1c4fa58-0474-4b07-93af-27137f993a10","resolution":{"observed_at":"2026-08-07T04:43:41.769713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T04:43:41.874281Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:41.874281Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:84199412980a020fd17c4cd8cbd70b47a9ff6f1ba98390c71cf19c704a25bff5","observation_id":"31a5d409-1186-47a8-b152-dc606bfc46eb","resolution":{"observed_at":"2026-08-07T04:43:41.874281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T04:43:41.983897Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:41.983897Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:aaa78ca0b56431dd6f129023166fd40dd249e4bfd0a156370206bd990257bd95","observation_id":"6bce6f40-7fc0-436d-b6ef-710168cd00f2","resolution":{"observed_at":"2026-08-07T04:43:41.983897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-14T10:19:04.189589Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-07T04:43:42.097080Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:42.097080Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:8859b86437a42a1feb78bbc062c3146b7fd19d3527070564d6addf692b5c069a","observation_id":"1198782c-3978-4d7f-bd57-b5177a52c381","resolution":{"observed_at":"2026-08-07T04:43:42.097080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01847","last_updated":"2016-09-24T01:58:59Z","snapshot_observed_at":"2026-08-14T21:53:59.472078Z","submitted_at":"2016-06-06T17:59:56Z","title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01847","snapshot_observed_at":"2026-08-07T04:43:42.214314Z","title":"Multimodal compact bilinear pooling for visual question answering and visual grounding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:42.214314Z"},"links":{"cited_paper":"/paper/1606.01847","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:fd84f09eab1e871cab63f62231b1fe258fc6bb28cb2dbdd165d3795dc0a1c0f2","observation_id":"9aa2c5a8-29d4-4069-bd67-2e16e1ac11fb","resolution":{"observed_at":"2026-08-07T04:43:42.214314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-07T04:43:42.303030Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:42.303030Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:f396de946e47417a2e07de0c0ae3b02f9777ad789a34c3dd27b73730f60fecb2","observation_id":"9539f517-a2bb-476d-8466-6d9f13caac59","resolution":{"observed_at":"2026-08-07T04:43:42.303030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:42.405980Z","title":"Mtl-nas: Task-agnostic neural architecture search towards general-purpose multi-task learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:42.405980Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:7ad533f7ed640522c6ee96e868bc670e434854017f11c68285818d72f5e11d21","observation_id":"4c99319a-658e-431f-a42e-278aeaaaed50","resolution":{"observed_at":"2026-08-07T04:43:42.405980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:42.538463Z","title":"Instructdiffusion: A generalist modeling interface for vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:42.538463Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:dd5941e7e32036717209848254099500a03c9df66b7c10a0ae880050966d29e0","observation_id":"afa323e0-db9f-45fe-819a-ef9ed949a51a","resolution":{"observed_at":"2026-08-07T04:43:42.538463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:42.648552Z","title":"Scaling open-vocabulary image segmentation with image-level labels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:42.648552Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:bf3e6fe5d35807a70f9f4be5dd51cddcb94dec61743e32e8707ef67a3c900f93","observation_id":"a4ba17bf-996a-45b2-97b6-2119824461a4","resolution":{"observed_at":"2026-08-07T04:43:42.648552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:42.724865Z","title":"Omnivore: A single model for many visual modalities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:42.724865Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:b28a08ceaeb7d77f0808fec4ca1cd45a7be0768d5c0ade97754068907d519bdd","observation_id":"59e09b5c-2843-4fe1-8a00-3791ea115380","resolution":{"observed_at":"2026-08-07T04:43:42.724865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:42.783410Z","title":"Mixture of experts models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:42.783410Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:7878783d4e668eef8920b2e4e6702d94e9e5e74dc2c19f1a13abde4820a0744e","observation_id":"64ad3603-6dd5-4182-8e21-9d7114ca8a36","resolution":{"observed_at":"2026-08-07T04:43:42.783410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:42.847069Z","title":"3d semantic segmentation with submanifold sparse convolutional networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:42.847069Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:52671f7b722512d6048d83f194d41e571d740db6c716a4e87400efc3aaa0235f","observation_id":"108fbebd-7adc-449c-843f-58344ee2372e","resolution":{"observed_at":"2026-08-07T04:43:42.847069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-16T03:57:01.951598Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-07T04:43:42.929374Z","title":"Zero-shot detection via vision and language knowledge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:42.929374Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:c7f5167b985eec4c3578dcb8e649726944446b22fb3798ece7750edf839a16fb","observation_id":"6c8fcf7c-9e11-41e3-988f-e7aae0c1e61c","resolution":{"observed_at":"2026-08-07T04:43:42.929374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:43.022561Z","title":"Deepfake video detection using recurrent neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:43.022561Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:4150bcfd7889e2004e3456b770ca2cc0259f27ea72481940cec5e96d08620141","observation_id":"524f39e1-6351-4720-8dde-b722bf31fbc3","resolution":{"observed_at":"2026-08-07T04:43:43.022561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:43.122801Z","title":"Dynamic task prioritization for multitask learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:43.122801Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:1b74bbd28d7bb1a6b4401d19da7268ac04cca4cd64bf24e2b0da90686082901d","observation_id":"dfc7ad55-1a4b-46bd-85ba-0aff07b70425","resolution":{"observed_at":"2026-08-07T04:43:43.122801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.13653","last_updated":"2022-05-02T19:26:41Z","snapshot_observed_at":"2026-08-16T17:03:53.066379Z","submitted_at":"2022-04-28T17:13:23Z","title":"GRIT: General Robust Image Task Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.13653","snapshot_observed_at":"2026-08-07T04:43:43.270853Z","title":"Grit: General robust image task benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:43.270853Z"},"links":{"cited_paper":"/paper/2204.13653","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:c3ae386d8ba95a84076a69d79ce453a917ed10141214f93ca48e85f287909bd0","observation_id":"94e049cb-e175-4c4b-84bd-d7ed481aa2a6","resolution":{"observed_at":"2026-08-07T04:43:43.270853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:43.392291Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:43.392291Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:5c0bebf53ea344f8c80acbf6e3c524042999a21f04625cf6bc3be62b3d1eb9f7","observation_id":"5909fec8-b3bb-47b2-80de-f956ce27527a","resolution":{"observed_at":"2026-08-07T04:43:43.392291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:43.490926Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:43.490926Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:3d6c01e46fdb483f463264e18b8d17353250058a3cf18a0dab7ec99c1b653d60","observation_id":"e867694b-33ca-4192-8dcf-810361659346","resolution":{"observed_at":"2026-08-07T04:43:43.490926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:43.588569Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:43.588569Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:1fadd51707409998ee3edb0a3d76c8591c88f6e6708e46674a2e51169105d3fc","observation_id":"bbeb827e-2db2-4ef1-863e-5886a6606636","resolution":{"observed_at":"2026-08-07T04:43:43.588569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:43.728282Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:43.728282Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:0bce3a9cf26ad42c9f1c749b796ea0b56ef2547818b23a7f8d4dfc2326a6cd8e","observation_id":"7f6f8551-b070-484f-b446-4d752e3b9172","resolution":{"observed_at":"2026-08-07T04:43:43.728282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T04:43:43.821811Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:43.821811Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:01c0a7891fd5314beffead274f738e52e0e41802ad7ad787b057cface3d23843","observation_id":"6184590f-6af9-4971-a072-c13aab04b41f","resolution":{"observed_at":"2026-08-07T04:43:43.821811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T04:43:43.966930Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:43.966930Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:3452ff18b4b1fe5c23875199e03b7e6ddb59d5f2f6aa66ec5860596e19074b03","observation_id":"832914b1-78db-4b26-9364-e372c3f3f8a0","resolution":{"observed_at":"2026-08-07T04:43:43.966930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:44.158944Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:44.158944Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:d817375c8202195743a46aa5c2ec6521877b3d461ee6fd5b0ee852fd657f21f3","observation_id":"1e3ed28a-94cc-4a54-be49-322a99ba2435","resolution":{"observed_at":"2026-08-07T04:43:44.158944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:44.383971Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:44.383971Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:70aeeb7ba553914ef9d29e65071c7d25f11907a4e8257d1184f57965c06c8363","observation_id":"3c883db3-43b4-4db6-9b60-9ea54adb2b37","resolution":{"observed_at":"2026-08-07T04:43:44.383971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:44.546997Z","title":"Unit: Multimodal multitask learning with a unified transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:44.546997Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:4fac5fdae7dd5daa0ee80fc20e55484a9809e08bf1a5341fd157e8640d16821e","observation_id":"14bc7247-bcb2-4667-809a-57246b0a91cf","resolution":{"observed_at":"2026-08-07T04:43:44.546997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-07T04:43:44.771145Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:44.771145Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:d1443e03d06d12083531f4260ddbd05b2e540acf1e9e6eaf3e26c462e7dc712e","observation_id":"f25d31fa-61a2-4121-a7cd-e61f9fc7b8b5","resolution":{"observed_at":"2026-08-07T04:43:44.771145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-08T05:52:17.343895Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14045","snapshot_observed_at":"2026-08-07T04:43:44.973382Z","title":"Language is not all you need: Aligning perception with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:44.973382Z"},"links":{"cited_paper":"/paper/2302.14045","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:17263d0cb498d258b682a6a37b38df74e1e34f56ce584499a34fdb2f1109f5b7","observation_id":"109d6306-2545-47c5-899b-c9395d515211","resolution":{"observed_at":"2026-08-07T04:43:44.973382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-07T04:43:45.149991Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:45.149991Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:7c4d11c6181c6348f5165504b6ca6b90bfb301d270315e1c1b8500ed44cc22cd","observation_id":"d1552308-4ba0-4b04-b8f0-3a44805f168c","resolution":{"observed_at":"2026-08-07T04:43:45.149991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:45.347606Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:45.347606Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:56e50073870d55bba4984df49bd71b388e6a27d14355efe54123442872cabf30","observation_id":"ff85f8d2-94f1-4363-9875-2957dcc4ffa8","resolution":{"observed_at":"2026-08-07T04:43:45.347606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:45.503099Z","title":"Oneformer: One transformer to rule universal image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:45.503099Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:5cc81a2ea7f45d660db0a5ba4b12ec2cc0155aad954538ca933b641ba9675df5","observation_id":"06cfafc9-e956-4a90-a212-cbacda38b73a","resolution":{"observed_at":"2026-08-07T04:43:45.503099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-16T16:26:20.587132Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-07T04:43:45.709626Z","title":"Vima: General robot manipulation with multimodal prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:45.709626Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:882882a7202c4d73a73952cd214e5acfcf642719d5cae75c843531fd1c04ce58","observation_id":"283d2273-548b-42f1-8710-1b6284021692","resolution":{"observed_at":"2026-08-07T04:43:45.709626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:45.853890Z","title":"Unified language-vision pretraining with dynamic discrete visual tokenization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:45.853890Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:40969a6060cbb620c961532e06ee58a07b756b83cbd0fa927d1ab920e0c06e11","observation_id":"f4c42f47-a091-49cf-9006-eedc72a1839c","resolution":{"observed_at":"2026-08-07T04:43:45.853890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:46.072821Z","title":"Deep visual-semantic alignments for generating image descriptions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:46.072821Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:d4fa5a8d34781c701d92314f25c3fb80e10cd44e112474a18890b60e7092c02f","observation_id":"19153742-5e8b-45c7-8dcf-9fa41894dff8","resolution":{"observed_at":"2026-08-07T04:43:46.072821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:46.234329Z","title":"Multi-task learning using uncertainty to weigh losses for scene geometry and semantics","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:46.234329Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:e598e0a103fa730efd4b52625ab4ff341d2efc663e427fd5ff228e80cffe3023","observation_id":"f62d91b2-1762-4e9d-94ad-f0c8621573a0","resolution":{"observed_at":"2026-08-07T04:43:46.234329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:46.394972Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:46.394972Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:2856c1a5cebba97e612acdab2ff9cfecc1228c502f74179df654e95559501763","observation_id":"e66a144c-082c-4c5c-abfb-8a2ef80199ae","resolution":{"observed_at":"2026-08-07T04:43:46.394972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-07T04:43:46.544041Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:46.544041Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:7173b36ca7ba0c20b4ff82123f6371d46cdf0bfa14bf31c2e0e65f4ec97712cc","observation_id":"56e22b71-6341-4b29-b253-d599cf106d49","resolution":{"observed_at":"2026-08-07T04:43:46.544041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:46.806244Z","title":"Uvim: A unified modeling approach for vision with learned guiding codes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:46.806244Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:7300f40677f1323020b6d50c45b1d766077fecb6bade77915f8fccd94eea12a5","observation_id":"3e65f32f-fda9-4c12-9da9-ba44a80e60e4","resolution":{"observed_at":"2026-08-07T04:43:46.806244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:46.982104Z","title":"Tabddpm: Modelling tabular data with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:46.982104Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:2e891e53366c9c549a110d3399d2d5c2b1090844309ad9bb839cf6b573862ef1","observation_id":"05aee257-12ce-42cb-a0d3-d062bb16a7c9","resolution":{"observed_at":"2026-08-07T04:43:46.982104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:47.129273Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:47.129273Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:8e55f8334dbe5d664f2e3b28f392911c4777e23c59dd94d4685ddf56777dc64e","observation_id":"722487cb-9dd2-4d78-97f4-8292a40b8eb1","resolution":{"observed_at":"2026-08-07T04:43:47.129273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:47.280227Z","title":"Imagenet classification with deep convolutional neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:47.280227Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:bad005074902a00f1c4f720b03c3bba77399ada677711170946a3d88e9f205f6","observation_id":"fcf16247-114b-4183-ac79-25779cbfa097","resolution":{"observed_at":"2026-08-07T04:43:47.280227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:47.423323Z","title":"Babytalk: Understanding and generating simple image descriptions","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:47.423323Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:f8eb9dda6f69e9466bac1c248b7bd3e29f0c928b0abcb8bfa4a07c29131428cb","observation_id":"60f0e233-0d61-4ae9-846c-abe12bd7ed1f","resolution":{"observed_at":"2026-08-07T04:43:47.423323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:47.581848Z","title":"Base layers: Simplifying training of large, sparse models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:47.581848Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:57e0c1e7f3bc535a4b8474e6fda457cb61d5dd318b611898c097b683ccdb6206","observation_id":"12beba6b-9608-4375-aee5-8cd89e2565f0","resolution":{"observed_at":"2026-08-07T04:43:47.581848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T04:43:47.735480Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:47.735480Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:cdbd6ec849a08ac670d09e5e92ac724226476c0c72a9c1a855c477176d4fa9c9","observation_id":"d7a90b71-5da5-46df-af46-7e3b8af095e2","resolution":{"observed_at":"2026-08-07T04:43:47.735480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10020","last_updated":"2023-09-18T17:56:28Z","snapshot_observed_at":"2026-08-16T14:59:43.121839Z","submitted_at":"2023-09-18T17:56:28Z","title":"Multimodal Foundation Models: From Specialists to General-Purpose Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10020","snapshot_observed_at":"2026-08-07T04:43:47.872697Z","title":"Multimodal foundation models: From specialists to general-purpose assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:47.872697Z"},"links":{"cited_paper":"/paper/2309.10020","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:1c3571a25453afbda40ab1e240b58381bff101c81452dcb1eba0cb0207634b56","observation_id":"594b128c-0f69-44c4-a94c-102c4f6df394","resolution":{"observed_at":"2026-08-07T04:43:47.872697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:48.106927Z","title":"Mask dino: Towards a unified transformer-based framework for object detection and segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:48.106927Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:a0407d1408bc67c77563ee30d0d785f451be4619149c7a5c8b2be412882d8d00","observation_id":"12500a93-70ca-4ca8-80c0-8f904f0bac2c","resolution":{"observed_at":"2026-08-07T04:43:48.106927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:48.304969Z","title":"Uni-perceiver v2: A generalist model for large-scale vision and vision-language tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:48.304969Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:417a73db3996690425322f8a24b9298b7f06c34c8c0c54b9eb42e48a2c6cb968","observation_id":"1a796a68-0850-4bff-9da1-2123fcf53024","resolution":{"observed_at":"2026-08-07T04:43:48.304969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:48.536824Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:48.536824Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:7e4ec8608b73ac7101f78e62cd90d311b31cf12045965cdeca410dd1db9bed0b","observation_id":"42360ffd-43e2-4579-a9fe-22f6808caddc","resolution":{"observed_at":"2026-08-07T04:43:48.536824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:48.684658Z","title":"Lavender: Unifying video-language understanding as masked language modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:48.684658Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:2e5c51e592931fe86da97d9e2a2014261de7ee42ccb2318f7f4a2f2d4afa8ea8","observation_id":"37db749b-7cc5-4cda-a039-5ffb7e93afd4","resolution":{"observed_at":"2026-08-07T04:43:48.684658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-07T04:43:48.858023Z","title":"Visualbert: A simple and performant baseline for vision and language","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:48.858023Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:84c24db6a7c9406edcfd4c6f36f29f94e6b73d0d4ee3512423c39b38649d2fcc","observation_id":"1327ed3c-d85d-480b-ac66-2fc4e89e18cf","resolution":{"observed_at":"2026-08-07T04:43:48.858023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:49.054065Z","title":"Grounded language-image pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:49.054065Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:c58900563440db9724e4c5a4e410883a8d35c9b7a1028e96af64e34b2a44c496","observation_id":"b42aa6ee-2894-45bf-99dd-8907276e4d7f","resolution":{"observed_at":"2026-08-07T04:43:49.054065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:49.218178Z","title":"Omg-seg: Is one model good enough for all segmentation? In CVPR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:49.218178Z"},"links":{"citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:b56f723b3ef38022f01b3ef308d8607fe698e72993845938d67d35c2e117164b","observation_id":"779fed7b-b38a-4d86-8a5e-eb7c7f3a422e","resolution":{"observed_at":"2026-08-07T04:43:49.218178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":222},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 222 outbound references and 0 inbound Pith citation observations for arXiv:2506.09954."}