{"as_of":"2026-08-11T18:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b664832732589ec6a8c0006b10152c4be838ed0dc14976eabf2abea2ef2d582","coverage":[{"denominator":298,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:08:09.276530Z","state":"measured"},{"denominator":112,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":112,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:02:55.719810Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T22:27:12.275903Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":"2501.02765","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Large Language Models for Generalized and Specialized Applications","venue":null,"work_id":"fb42c3c0-b890-4fb0-aa82-802aa04ecd2c","year":2025},"citing_paper":{"arxiv_id":"2503.18018","last_updated":"2026-04-08T07:40:49Z","snapshot_observed_at":"2026-08-11T17:33:17.009838Z","submitted_at":"2025-03-23T10:35:39Z","title":"Lost in Cultural Translation: Do LLMs Struggle with Math Across Cultural Contexts?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T22:27:02.059459Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2503.18018"},"observation_digest":"sha256:afa5d6e9e5b6daaa03b6d0215effd2d530f0306bdd43d732f120704d001d7a11","observation_id":"678f2bb4-176f-48b2-b4bf-280e8c7b102c","resolution":{"observed_at":"2026-05-22T22:27:12.278794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-08-07T14:02:55.719810Z","title":"Visual large language models for generalized and specialized applications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20223","last_updated":"2025-05-26T17:06:00Z","snapshot_observed_at":"2026-08-09T21:06:33.120007Z","submitted_at":"2025-05-26T17:06:00Z","title":"Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.719810Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2505.20223"},"observation_digest":"sha256:3c5c04eb5e95e22ce86c3b50448238a8e1f3090eecb5c650c7dd95a77ab3f71c","observation_id":"58e388ac-6946-4a66-8d9a-accd269b82d1","resolution":{"observed_at":"2026-08-07T14:02:55.719810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-08-07T13:54:24.604612Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20640","last_updated":"2025-05-27T02:36:17Z","snapshot_observed_at":"2026-08-09T03:09:00.133004Z","submitted_at":"2025-05-27T02:36:17Z","title":"IndustryEQA: Pushing the Frontiers of Embodied Question Answering in Industrial Scenarios","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:24.604612Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2505.20640"},"observation_digest":"sha256:b8bc979e237735ed789c49b9a57611b850c339803ff52dcd3c43c986bb026144","observation_id":"c41d5d1e-e5d9-4380-9d1f-1db7de0165a0","resolution":{"observed_at":"2026-08-07T13:54:24.604612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-08-07T11:09:30.084456Z","title":"Visual large language models for generalized and specialized applications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-08T16:09:41.636816Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.084456Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:a7a934f288d14126c01107cda34c3d7ec0da8c3c8927ad7941b34724a029381b","observation_id":"f2bfbacc-3d5b-48d5-a79f-f8303ca9cd2c","resolution":{"observed_at":"2026-08-07T11:09:30.084456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":"2501.02765","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Large Language Models for Generalized and Specialized Applications","venue":null,"work_id":"fb42c3c0-b890-4fb0-aa82-802aa04ecd2c","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-08-11T14:54:27.718296Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:d721771c3ea7e191debbd0173ea1fe4056cd91313321198d3882150d871f286e","observation_id":"78c8ddaa-47de-4843-8a1b-958b2fea1532","resolution":{"observed_at":"2026-05-19T11:13:02.863394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-08-07T00:34:26.815119Z","title":"Visual large language models for generalized and specialized applications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":215,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:26.815119Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:a824b6359f94195256d172d28816bd4ef72f51116ea4db449431616a98bc02e9","observation_id":"037ba41e-21a8-45b8-8f95-36081c8fdbb6","resolution":{"observed_at":"2026-08-07T00:34:26.815119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-08-06T23:28:56.244746Z","title":"Visual large language models for generalized and specialized applications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17900","last_updated":"2025-06-22T04:58:37Z","snapshot_observed_at":"2026-08-09T14:56:41.833498Z","submitted_at":"2025-06-22T04:58:37Z","title":"Leveraging Large Language Model for Intelligent Log Processing and Autonomous Debugging in Cloud AI Platforms","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:56.244746Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2506.17900"},"observation_digest":"sha256:6269de876dac784225cf17d501e6d63faf6f677e2f978848e1555208ca86d1e9","observation_id":"62210426-7a5e-41af-9e53-ebf45dfe7a3a","resolution":{"observed_at":"2026-08-06T23:28:56.244746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":"2501.02765","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Large Language Models for Generalized and Specialized Applications","venue":null,"work_id":"fb42c3c0-b890-4fb0-aa82-802aa04ecd2c","year":2025},"citing_paper":{"arxiv_id":"2508.01191","last_updated":"2026-05-08T20:20:58Z","snapshot_observed_at":"2026-07-06T22:06:38.785781Z","submitted_at":"2025-08-02T04:37:28Z","title":"Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T01:18:31.661827Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2508.01191"},"observation_digest":"sha256:5496305d041a4384cb249230731c1c3c796fc63056c31b550d035630fdaa99b8","observation_id":"8e0db215-d347-40c5-9b13-e62da461b9e4","resolution":{"observed_at":"2026-05-19T01:21:58.110331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-08-06T04:25:46.368463Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03535","last_updated":"2025-08-05T15:04:34Z","snapshot_observed_at":"2026-08-08T00:31:41.022417Z","submitted_at":"2025-08-05T15:04:34Z","title":"CoEmoGen: Towards Semantically-Coherent and Scalable Emotional Image Content Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T04:25:46.368463Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2508.03535"},"observation_digest":"sha256:2528d733af51c91c53cc54a75a7491225d5698beeae46ff86ec0a19550efba24","observation_id":"a8ad9122-832a-40e6-a471-fea949cb9352","resolution":{"observed_at":"2026-08-06T04:25:46.368463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-08-03T20:59:17.714781Z","title":"Visual large language models for generalized and specialized applications.arXiv preprint arXiv:2501.02765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17384","last_updated":"2026-07-03T23:12:55Z","snapshot_observed_at":"2026-08-09T03:08:31.305706Z","submitted_at":"2025-11-21T16:48:49Z","title":"IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T20:59:17.714781Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2511.17384"},"observation_digest":"sha256:20d43ef72f8be8a728f650267fc3f0f4e69370dd8dd2c55d9361771e4a0af84d","observation_id":"cda5e9a0-1daf-4993-89dd-7463904e7c07","resolution":{"observed_at":"2026-08-03T20:59:17.714781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-08-03T06:28:45.289373Z","title":"Industryeqa: Pushing the frontiers of embodied question answering in industrial scenarios","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07008","last_updated":"2026-07-20T11:10:30Z","snapshot_observed_at":"2026-08-03T23:15:33.062867Z","submitted_at":"2026-01-30T10:29:27Z","title":"Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T06:28:45.289373Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2602.07008"},"observation_digest":"sha256:f0b8b05d2257b680a04ff78be4f12c970ed25647e02c4ed7684fe4a7e47b0d61","observation_id":"d8903798-d4cf-45d4-9ef3-aed4184c790c","resolution":{"observed_at":"2026-08-03T06:28:45.289373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":"2501.02765","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Large Language Models for Generalized and Specialized Applications","venue":null,"work_id":"fb42c3c0-b890-4fb0-aa82-802aa04ecd2c","year":2025},"citing_paper":{"arxiv_id":"2604.17241","last_updated":"2026-04-19T04:04:02Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T04:04:02Z","title":"GaLa: Hypergraph-Guided Visual Language Models for Procedural Planning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T06:26:06.208036Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2604.17241"},"observation_digest":"sha256:13b09cb9c256d9871854b902d844230a0d55cc1714c079ef98bc1388a3c00bb8","observation_id":"187df4d5-837f-4c6a-a968-a90dbe08a29a","resolution":{"observed_at":"2026-05-10T06:26:27.222290Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.02765/citation-record","integrity":"/paper/2501.02765/integrity","json":"/paper/2501.02765/citation-record.json","paper":"/paper/2501.02765"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.853047Z","title":"A-fast-rcnn: Hard positive generation via adversary for object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.853047Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:c5ea29664211425119390cd325e8f7425303b6cbcd02cf4c6136e6dc04195911","observation_id":"471892d6-bf6e-47be-810c-539c03239be5","resolution":{"observed_at":"2026-08-10T22:08:08.853047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.858029Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.858029Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:bddb47483c914facc8cd34a0bd7e12dc111601e52f8863211a90efc82ddfc8d5","observation_id":"f9a7a50c-7bc6-434a-8fe5-1e8b45084a0e","resolution":{"observed_at":"2026-08-10T22:08:08.858029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.863117Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.863117Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:786cd86db26248397e3dc337be43c8c192de118512f49669abea09596adf0db6","observation_id":"645d315f-bd60-4823-a5af-97187a9d16bc","resolution":{"observed_at":"2026-08-10T22:08:08.863117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.867482Z","title":"Spatiotemporal multiplier networks for video action recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.867482Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:c0a3769335a60fa296ff53be58cca565671c4082e473f664f6b88a913e54d6dc","observation_id":"37c9aacd-964e-47b5-a557-80b0b4dd4efe","resolution":{"observed_at":"2026-08-10T22:08:08.867482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.871785Z","title":"Temporal action segmentation: An analysis of modern techniques,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.871785Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:d635ae9e3487f670294879cb309a2ebee172c7f313d5cb6ac6a2ecc24e15ca72","observation_id":"a801af0c-f895-463f-acc3-0444d4bfeaa9","resolution":{"observed_at":"2026-08-10T22:08:08.871785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.876145Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.876145Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:e05b784dd3f913165ca025dce0ad568093e546b0dfc0ff2309211094c070616d","observation_id":"1ff6cd80-6f21-4682-adb0-9c5e7c560c96","resolution":{"observed_at":"2026-08-10T22:08:08.876145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.880318Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.880318Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:c53e1b1d07fa1044185c45dbf2d6fe68329bf339c32315c9c68c93cd751b2967","observation_id":"38750cda-6073-4b12-987d-96820a017c06","resolution":{"observed_at":"2026-08-10T22:08:08.880318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.884423Z","title":"From captions to visual concepts and back,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.884423Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:af077f40952d06097c7514c35e55d1a410f723a902bd80403de0d047781bf262","observation_id":"4bc4732e-f008-4be5-8105-351e3acba32f","resolution":{"observed_at":"2026-08-10T22:08:08.884423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.888595Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.888595Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:e8fa250017263c8f2fd872f44ad86c2a3608fbdd05f41964bd7bd6a8ce7f503a","observation_id":"c1454048-42c3-4ede-8f19-5b7e5db08083","resolution":{"observed_at":"2026-08-10T22:08:08.888595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.892696Z","title":"Deep visual-semantic alignments for generating image descriptions,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.892696Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:c7e2a4199956c46f00ab3993ac306a5e8e005e23b6c1b00b6eb16e1508ace173","observation_id":"11e3e2fe-8184-4092-86f0-27665a8bdd14","resolution":{"observed_at":"2026-08-10T22:08:08.892696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.896385Z","title":"Guiding the long- short term memory model for image caption generation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.896385Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:45d6ed2d0054f5e293c2d8ae65881ffb52c5751c68336da44363c16a87c3614e","observation_id":"2409a84a-55c2-4431-b8ea-50a397cc87a0","resolution":{"observed_at":"2026-08-10T22:08:08.896385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.900544Z","title":"Babytalk: Understanding and generating simple image descriptions,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.900544Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:0e07e5beca0b7d472a20a3421b19114af3b2a3be01d68b9a527dbfab3f7d06d2","observation_id":"46560339-5bfa-4400-9572-7afdebb65f17","resolution":{"observed_at":"2026-08-10T22:08:08.900544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.905379Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.905379Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:2d14467fd7d3b3f21fa564212b35d34edd774f9823471149896a525d7029b770","observation_id":"90977128-0520-4f9b-bbf5-8a5237f92251","resolution":{"observed_at":"2026-08-10T22:08:08.905379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.909619Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.909619Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:00a431221b29aa4bb485a1be38c34a1b3bf4c3bd26d5fc9dc0e77fbf1aab25b4","observation_id":"a029bf49-88bc-42cc-9b1a-440b5fe6000a","resolution":{"observed_at":"2026-08-10T22:08:08.909619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.916968Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.916968Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:5b100b2d1e5b6e4617696c596d730bb7960369725a6c8bdf795397a8901335d3","observation_id":"957da850-5e49-4c09-a9b6-0e92c4e56954","resolution":{"observed_at":"2026-08-10T22:08:08.916968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-10T22:08:08.920635Z","title":"Visual- bert: A simple and performant baseline for vision and language,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.920635Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:b3f0d9cd2ea09e45f4f7fc1f702eafa6a6f5bc07141e21c979b81f8c5e36d806","observation_id":"bed99a16-983d-4140-b533-910a3c601807","resolution":{"observed_at":"2026-08-10T22:08:08.920635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.924459Z","title":"Vilbert: Pretraining task- agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.924459Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:3fa4e55c602060720ca46f808bf945ff2e7cd6fa424a963057be0914e4574d62","observation_id":"671051be-7985-4b51-b265-2ee5e6d617b9","resolution":{"observed_at":"2026-08-10T22:08:08.924459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.929515Z","title":"Nsp-bert: A prompt-based few-shot learner through an original pre-training task——next sentence prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.929515Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:db598f4fd07e4e447ba65a2da1c6feaa8383ce94f72b6a1004cbc6cbc8fafa84","observation_id":"8fe23a5e-67d5-45b8-8975-209776c11845","resolution":{"observed_at":"2026-08-10T22:08:08.929515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.933386Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.933386Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:6bebe3ec593aa254ee9f3444dfc5f6bd9c7ad401a55d5a5afd273dfd213dccb0","observation_id":"79685515-2ea2-462b-9b60-db5e52a6c29a","resolution":{"observed_at":"2026-08-10T22:08:08.933386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.937810Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.937810Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:29ba61d26769695fe8f159129eb16f2c04ab7c5fe3202476313739688caf2858","observation_id":"fe1adfe3-c40d-46ea-bdd4-277122b10a34","resolution":{"observed_at":"2026-08-10T22:08:08.937810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.941916Z","title":"Slip: Self-supervision meets language-image pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.941916Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:23819cdf15231058d6e80f5eccd8b484e60cf5546d3791fbe97bea3c46169230","observation_id":"f44fc438-43c3-45b6-afc4-12574b8090dc","resolution":{"observed_at":"2026-08-10T22:08:08.941916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.946084Z","title":"Decoupling zero-shot semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.946084Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:892c6b3021c369e51a760964800b27a4ea7a1158fb5847f7c73d055bb57d5dac","observation_id":"919cb908-8036-474f-b089-97e252b2f95f","resolution":{"observed_at":"2026-08-10T22:08:08.946084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.950010Z","title":"Open-vocabulary object detection via vision and language knowledge distillation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.950010Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:aa333722a6eab658baab4dfe806ae4fca698f8e3c170382eb2a546e1113c43e6","observation_id":"8cdc7770-b105-4d6d-a255-3ffbab656aa6","resolution":{"observed_at":"2026-08-10T22:08:08.950010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.954075Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.954075Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:9ae012809032e90f64e04fd2af7f0959b75a170c37b79578de0f585bae77462e","observation_id":"7a898a00-6d68-43de-bb1d-220564bba826","resolution":{"observed_at":"2026-08-10T22:08:08.954075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.958726Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.958726Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:56e2150ad7455e65d0d8b1c99ec5394c3ce8c7a2a5f9fe2b83de7d1d8d369061","observation_id":"38b183f4-509b-419b-beed-83a614d8bd26","resolution":{"observed_at":"2026-08-10T22:08:08.958726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.961882Z","title":"Instruction tuning for large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.961882Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:a1543cfb5b134fa29f631fac076125e0513bd75da65ceab60c804fa565c394c3","observation_id":"57844911-0787-43e1-afdd-909d74cdd694","resolution":{"observed_at":"2026-08-10T22:08:08.961882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.964884Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.964884Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:01bbeb5bdf89763745eca01c2175c464a0e7eeb2dc2131d93e1e7e07df4feed5","observation_id":"be38f458-40ab-4a5e-a0d8-a7e028e5fe02","resolution":{"observed_at":"2026-08-10T22:08:08.964884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07356","last_updated":"2022-05-03T21:31:58Z","snapshot_observed_at":"2026-08-10T11:23:41.263502Z","submitted_at":"2022-04-15T07:33:06Z","title":"Vision-and-Language Pretrained Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07356","snapshot_observed_at":"2026-08-10T22:08:08.967883Z","title":"Vision-and-language pretrained models: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.967883Z"},"links":{"cited_paper":"/paper/2204.07356","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:57c9a0433b6b61dfb3955dc75d64c232afc0cded7790dd1804cfe7c74be9c989","observation_id":"2658480e-728c-493f-ad32-158e8761d2a7","resolution":{"observed_at":"2026-08-10T22:08:08.967883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14414","last_updated":"2024-06-20T19:36:38Z","snapshot_observed_at":"2026-08-10T03:48:10.050411Z","submitted_at":"2023-10-22T21:06:10Z","title":"Vision Language Models in Autonomous Driving: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14414","snapshot_observed_at":"2026-08-10T22:08:08.972024Z","title":"Vision language models in autonomous driving and intelligent transportation systems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.972024Z"},"links":{"cited_paper":"/paper/2310.14414","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:12c858b90a129b76c665bb98c56169b8c48da426b7172cda9f62a09f07b77bf8","observation_id":"cfb5b4ed-0690-4b99-9182-029ef12a5fb7","resolution":{"observed_at":"2026-08-10T22:08:08.972024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:08.976052Z","title":"Exploring the frontier of vision-language models: A survey of current methodologies and future directions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.976052Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:06184e9c2db8dbdb120e653cd48bfdf96929273ed022d067fafbb28f058cbc43","observation_id":"a8b619b9-9f92-4f8d-84e9-7bbe7dddfde9","resolution":{"observed_at":"2026-08-10T22:08:08.976052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-10T21:32:36.140961Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-10T22:08:08.979027Z","title":"Mm-llms: Recent advances in multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.979027Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:4f833683b663ca48faecb202d5e4ebb8dd6367654d152c166e2777d52cde65ef","observation_id":"c191914f-cafa-48d2-8239-f5186b9eb42d","resolution":{"observed_at":"2026-08-10T22:08:08.979027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16602","last_updated":"2023-12-27T14:54:37Z","snapshot_observed_at":"2026-08-09T23:45:51.952888Z","submitted_at":"2023-12-27T14:54:37Z","title":"Visual Instruction Tuning towards General-Purpose Multimodal Model: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16602","snapshot_observed_at":"2026-08-10T22:08:08.983223Z","title":"Visual instruction tuning towards general-purpose multimodal model: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.983223Z"},"links":{"cited_paper":"/paper/2312.16602","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:bad977ad08c2d31c0e6615199615f86694bfd2429184b6782efc737cc9975293","observation_id":"ab626ba4-9043-4e99-b595-da6c85bd7601","resolution":{"observed_at":"2026-08-10T22:08:08.983223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-10T22:08:08.987964Z","title":"Exploring the reasoning abilities of multimodal large language models (mllms): A comprehensive survey on emerging trends in multimodal reasoning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.987964Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:a61acd709e4e72b083f22e7b58ca76fbb8a5f5c98770be7fe9ccceffb6f50b7d","observation_id":"05250eb3-ccd6-490c-ae5b-b6566d20ad43","resolution":{"observed_at":"2026-08-10T22:08:08.987964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-08-11T02:03:00.199542Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02104","snapshot_observed_at":"2026-08-10T22:08:08.992543Z","title":"Explainable and interpretable multimodal large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.992543Z"},"links":{"cited_paper":"/paper/2412.02104","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:72763a8de90ca3b6ad999b7a8dda461a1bd6ade92bd721cb5f6cbf30e5ac1377","observation_id":"29a2ec10-7a9a-47d3-a41a-d496548f5f10","resolution":{"observed_at":"2026-08-10T22:08:08.992543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-07T09:14:56.498818Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-10T22:08:08.997103Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:08.997103Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:07220b54a84029f9fcad06f7a240aab02209a191719c5dddcb5c1e56904b8b34","observation_id":"58b0312e-73ff-42f8-b310-a2d89b9933b8","resolution":{"observed_at":"2026-08-10T22:08:08.997103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.001205Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.001205Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:eb8fff600cad650f521765107542652ecf4e20b578401e50eea9b6d78a2f1751","observation_id":"07d3a5f8-a1a3-4bea-b6a5-e97b8e914936","resolution":{"observed_at":"2026-08-10T22:08:09.001205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.005903Z","title":"Multimodal large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.005903Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:d625b41482c5a7ec8c4695102e439f04a4869799c13236c898ec3793325a8c75","observation_id":"cf2cdd04-5b5d-49d2-ae35-4a9158483203","resolution":{"observed_at":"2026-08-10T22:08:09.005903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.011318Z","title":"The (r) evolution of multimodal large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.011318Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:cafd43844eff60bf7cb9c0b6f42b7aecfa1c3fdbe9eb6137ea6ca90a1141c5a1","observation_id":"f0225710-3452-405d-ad3d-0768d628a8ed","resolution":{"observed_at":"2026-08-10T22:08:09.011318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.015231Z","title":"Multimodal foundation models: From specialists to general-purpose assistants,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.015231Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:8e0de22e2a97e517d6df551be52a32be5a109fcfd3a51bb18b32f2ff0507338c","observation_id":"d6e45c17-a997-4cda-a95a-fb42c3756e9c","resolution":{"observed_at":"2026-08-10T22:08:09.015231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-11T03:31:28.001151Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-10T22:08:09.019312Z","title":"A survey on hallucination in large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.019312Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:88e57e54ac17473a1dc711c6efd049dafab07df066b81abbfc0830678f6f637d","observation_id":"b052469d-cdb0-4376-a4cd-19b10d8c243f","resolution":{"observed_at":"2026-08-10T22:08:09.019312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.023651Z","title":"Language is not all you need: Aligning perception with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.023651Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:29be131313a0471a495e4c648743eebec3fff1a5ca3c552c031d078c3484ba4f","observation_id":"826df491-a925-4de3-a07c-76636f75a182","resolution":{"observed_at":"2026-08-10T22:08:09.023651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.027608Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.027608Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:738560c7030170c345b46d9a9d0740e560127c55580b7de4ec3fa7251d911ae7","observation_id":"29cde9ac-3917-46c9-9cea-2da88292dedd","resolution":{"observed_at":"2026-08-10T22:08:09.027608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.031756Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.031756Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:fe96ad6f64ff6fa9ae2d4122ec753ce506cfe8ea095465975cd8773e4a10770a","observation_id":"7b5d3f44-c541-45bb-a854-631c6dc6604c","resolution":{"observed_at":"2026-08-10T22:08:09.031756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T22:08:09.036027Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.036027Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:7ae229b1a0d8dbdc8ae7b0068103ad2a6c0181ea2ba5d5c92cb055aabf38c2b7","observation_id":"d57865e9-e27f-4dd1-9526-316afe1bdd72","resolution":{"observed_at":"2026-08-10T22:08:09.036027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-10T22:08:09.039703Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.039703Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:7948ba182ab3ba2ecbebf237891f3108319adb34111db6073bac2b9a2663cc48","observation_id":"10838aa6-f0c5-476b-8562-fe08ac8c3e74","resolution":{"observed_at":"2026-08-10T22:08:09.039703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.049542Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.049542Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:3295ffb660dc41fa2240e00c8b6b5c5a60f96ab0feb7b5102764bae01df53ff4","observation_id":"8631ea6b-81cc-428e-94da-bf4bb37f53c0","resolution":{"observed_at":"2026-08-10T22:08:09.049542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-10T22:08:09.053527Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.053527Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:2fd09bdfccae84faeac2fb152427d2df28f01c913dd279e4fac0c0b2156c370a","observation_id":"f82b663f-b97d-4d92-b9ca-c7905134c92c","resolution":{"observed_at":"2026-08-10T22:08:09.053527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-10T22:08:09.058272Z","title":"Multimodal-gpt: A vi- sion and language model for dialogue with humans,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.058272Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:dccddf45916f19b57f42558a2b919fe4035c7f6842c44b6b5a158e8bbb057800","observation_id":"b61c15f0-da57-44a2-accf-17509c225f4f","resolution":{"observed_at":"2026-08-10T22:08:09.058272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-10T22:08:09.061991Z","title":"Otter: A multi- modal model with in-context instruction tuning. corr abs/2305.03726 (2023),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.061991Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:82471f11e7183e7d10154d6730020e7aa67d5587e4cdbeb98bed88dbb7527302","observation_id":"78f1acbf-11ee-4a9b-9479-c2658865a39d","resolution":{"observed_at":"2026-08-10T22:08:09.061991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-10T22:08:09.066684Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning. arxiv 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.066684Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:c136ce6f3b7ef3a989b69a1ebdcc72b6483581993f5a6a6446b8b6c5be965c69","observation_id":"3da2b34a-0b30-4955-825a-754528c89ee4","resolution":{"observed_at":"2026-08-10T22:08:09.066684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.071186Z","title":"Cheap and quick: Efficient vision-language instruction tuning for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.071186Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:f21f77b5a0dee6e4a8060b01d354e15cefc9504d047bbc1d3af1f5970ff6e121","observation_id":"0efb19d4-8cec-4076-8741-facaddc3f7b7","resolution":{"observed_at":"2026-08-10T22:08:09.071186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.076028Z","title":"Bliva: A simple multimodal llm for better handling of text-rich visual questions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.076028Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:2b5a09624b02f23a13e97a9f0d932d41892ee14dcc83a125cdd38b4db7c436d7","observation_id":"077b2f04-1f56-401e-9490-134b47064b2d","resolution":{"observed_at":"2026-08-10T22:08:09.076028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10253","last_updated":"2023-12-28T03:44:28Z","snapshot_observed_at":"2026-07-06T16:08:13.029564Z","submitted_at":"2023-08-20T12:43:52Z","title":"StableLLaVA: Enhanced Visual Instruction Tuning with Synthesized Image-Dialogue Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10253","snapshot_observed_at":"2026-08-10T22:08:09.080258Z","title":"Stablellava: Enhanced visual instruction tuning with synthesized image-dialogue data,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.080258Z"},"links":{"cited_paper":"/paper/2308.10253","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:52466bd435e8b970d554d6544f5be26e39746135d81aa5337740a94e394f1008","observation_id":"a304fd03-3513-4f8d-b377-20c6df1a35f8","resolution":{"observed_at":"2026-08-10T22:08:09.080258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T22:08:09.085674Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.085674Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:45bd2e5f9ac90e722b36e8e0c68f1525d4b66e19c85f6f5e539fba9bbd23f5ec","observation_id":"1e78c950-23cb-4846-b432-b6aa0d9baa46","resolution":{"observed_at":"2026-08-10T22:08:09.085674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-10T22:08:09.089948Z","title":"Internlm-xcomposer: A vision-language large model for advanced text-image comprehension and composition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.089948Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:0b8269250629d8d3aa4fed25f2b07b5a8087c742a86329795d2a4cf388225fdf","observation_id":"e3cbdba7-192c-4ef8-8c3c-30fe5727bf8c","resolution":{"observed_at":"2026-08-10T22:08:09.089948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.093619Z","title":"Introducing our multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.093619Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:b2c2aa7ebfe10aa23275906a3bd2927934f563d2791704fc45dad8d65da8d69b","observation_id":"a1aba056-37e8-4e9c-a31a-c08b751d53c6","resolution":{"observed_at":"2026-08-10T22:08:09.093619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.097440Z","title":"Monkey: Image resolution and text label are important things JOURNAL OF LATEX CLASS FILES, JANUARY 2025 20 for large multi-modal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.097440Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:6b31f6d66d777719b990da39e544b443a824e51af1161db3bff1df6f598ec722","observation_id":"b3523e60-4dda-44e2-a029-e6e5a998551a","resolution":{"observed_at":"2026-08-10T22:08:09.097440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.101742Z","title":"Honeybee: Locality-enhanced projector for multimodal llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.101742Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:4948e694100147dc3879fb81e48adf0e833bbf4902f3360bf96dfcadfc9b007a","observation_id":"b0df3684-1657-4600-85ec-33de71cef630","resolution":{"observed_at":"2026-08-10T22:08:09.101742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-10T22:08:09.106319Z","title":"Vary: Scaling up the vision vocabulary for large vision- language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.106319Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:ae934e2aaff8330c349f34d07c746e81463996bd58cf1f2e78da727fa6665e00","observation_id":"9b41511c-8f44-46d5-80ac-40c03ea1cf5f","resolution":{"observed_at":"2026-08-10T22:08:09.106319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.110962Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.110962Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:686e673eb4589f9819b6da3ef54cfcbca264a9478ec56f060eb260d1e877b132","observation_id":"7cc276f3-7196-4396-b185-3c04728823ff","resolution":{"observed_at":"2026-08-10T22:08:09.110962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-10T22:08:09.114597Z","title":"Deepseek-vl: towards real-world vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.114597Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:e32d7ee1bfb64f3db444a7bf6bf335819cb1d873e1d9b5c34de127f8b6c3e5e7","observation_id":"f17b19f4-b99a-4441-9bee-d62bf484118d","resolution":{"observed_at":"2026-08-10T22:08:09.114597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-10T22:08:09.118747Z","title":"Deepseek-vl2: Mixture-of-experts vision- language models for advanced multimodal understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.118747Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:4cf865100afedaad24e850b740c31884db1ceca5e1579938435518fe6540ea72","observation_id":"84c01329-abf5-450f-b226-2e64313fd04c","resolution":{"observed_at":"2026-08-10T22:08:09.118747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-10T22:08:09.123093Z","title":"Mm1: Methods, anal- ysis & insights from multimodal llm pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.123093Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:27f98db0f849257bcce464e6d3bd76520a23ec4c9c5e16d06d79aea2d323e7d7","observation_id":"028f0d74-561b-4578-81d8-a40e7a26d598","resolution":{"observed_at":"2026-08-10T22:08:09.123093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T22:08:09.126439Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.126439Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:1454ff04f2e11e0a306f7adfc2cc3e7bbf87699f808537780c33fc16ac2b4c91","observation_id":"c580a315-6f9f-4a4e-82a5-99a0acc31263","resolution":{"observed_at":"2026-08-10T22:08:09.126439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-10T22:08:09.130291Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.130291Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:6430d1aca4bc29659c61c1af5682d7f891200d99e649891b56dee90a1cf6d9a0","observation_id":"64384dc8-e750-4d2a-891a-fce6c4f356e4","resolution":{"observed_at":"2026-08-10T22:08:09.130291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.134364Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.134364Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:4ebc1c1af20ea47568f91aa8cdabd0b47e2795650c78186483cfcaa3de8773b0","observation_id":"72b8fb2e-97cb-44d3-935b-e5dbcebb5745","resolution":{"observed_at":"2026-08-10T22:08:09.134364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.138705Z","title":"Groundhog: Grounding large language models to holistic segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.138705Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:1c091860a9290f2601bc8d63e49d35575c1c6254f2b86dbcd1b6d793db980f9a","observation_id":"4039403b-4b4c-40e9-9075-3d60c57560ed","resolution":{"observed_at":"2026-08-10T22:08:09.138705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.147338Z","title":"Jack of all tasks master of many: Designing general-purpose coarse-to-fine vision-language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.147338Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:a1ff84700bb3ba4d86397453ad09202e9cd4b12fe21684fc2a97f61f4af37f3e","observation_id":"2d2266d1-d6e9-4da1-bc83-b8e2a7bcc5d6","resolution":{"observed_at":"2026-08-10T22:08:09.147338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18279","last_updated":"2024-08-12T07:14:00Z","snapshot_observed_at":"2026-08-10T04:55:17.331940Z","submitted_at":"2023-05-29T17:50:33Z","title":"Contextual Object Detection with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18279","snapshot_observed_at":"2026-08-10T22:08:09.151036Z","title":"Contextual object detection with multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.151036Z"},"links":{"cited_paper":"/paper/2305.18279","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:0e326f372028bbad29baef0400f0b01616f75800cfa1b386b52b36986c287fd4","observation_id":"720f258a-3f55-4b43-ad82-ce55448b6d11","resolution":{"observed_at":"2026-08-10T22:08:09.151036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.155891Z","title":"Pixellm: Pixel reasoning with large multimodal model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.155891Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:0d9df43f7528494b9a4960f38cd16643e6eb6a5a71a9be9f084c118241cde4b7","observation_id":"34bac95e-f369-4a3e-9acc-cf5d70daf4f3","resolution":{"observed_at":"2026-08-10T22:08:09.155891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.159006Z","title":"Pixel-aligned language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.159006Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:92da5c559ec7bf4977398f868c956d2055e8e0b4cc202581542ac45d883e839f","observation_id":"f4ac02f4-25e8-4613-8449-9383856b2d7b","resolution":{"observed_at":"2026-08-10T22:08:09.159006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.162393Z","title":"Gsva: Generalized segmentation via multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.162393Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:4b6213d7643c5df5196417a52e394ee64eab6035c2cff560bd0922977556b9ee","observation_id":"773a9d28-bab2-418b-8967-c88e7e2d0008","resolution":{"observed_at":"2026-08-10T22:08:09.162393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.166323Z","title":"Llafs: When large language models meet few-shot segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.166323Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:2b7c789f2a72ae56695e6e041ae1a55eb5358c28d1e34a1ed3f6b5b24e24fd3d","observation_id":"50087dbd-d00d-42b0-a186-a0e84e9fb5af","resolution":{"observed_at":"2026-08-10T22:08:09.166323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.170520Z","title":"Glamm: Pixel grounding large multimodal model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.170520Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:f7d680cf7f305bc193de093d8e7a8f82ee14e2eecec159748016ffb1f24b6d5c","observation_id":"a35cb8eb-a35e-4c50-a8fe-96b1eea29335","resolution":{"observed_at":"2026-08-10T22:08:09.170520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.175234Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.175234Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:f3bf82c68c92be4710ab4cb8d64dd04ec3519d96ff3a0ca6736eb860d44fe87a","observation_id":"c6d090ca-31a8-4356-a9b4-b915f2976c72","resolution":{"observed_at":"2026-08-10T22:08:09.175234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-06T17:31:18.801416Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-10T22:08:09.179783Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.179783Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:688d3a7597e073a4c663828b1ac7e629d90f792c3bbb14d2c0297b3fdd69998a","observation_id":"c29b4852-fd46-4d46-a2ca-4cd8a8d820b2","resolution":{"observed_at":"2026-08-10T22:08:09.179783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.183960Z","title":"Osprey: Pixel understanding with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.183960Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:47a293416b059a6cbf24b3b2d7f59cab099f272cd385134f2026e70b601da10b","observation_id":"4cf59903-b8a9-4de8-9906-0e7bad060347","resolution":{"observed_at":"2026-08-10T22:08:09.183960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19389","last_updated":"2024-10-01T06:07:24Z","snapshot_observed_at":"2026-07-06T18:38:05.229292Z","submitted_at":"2024-06-27T17:59:01Z","title":"OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19389","snapshot_observed_at":"2026-08-10T22:08:09.187364Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.187364Z"},"links":{"cited_paper":"/paper/2406.19389","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:f149e594ba1ae2a872a18b20db71e5dd6e73141b7671cd83cbecbedc920e96e9","observation_id":"f3a54099-3b22-49d6-87b5-3e72f5081c62","resolution":{"observed_at":"2026-08-10T22:08:09.187364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.191999Z","title":"Llm-seg: Bridging image segmentation and large language model reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.191999Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:16855df64aa08b14a04a14b7e88728c940f9e7a338de33693910097e59171f52","observation_id":"295759cd-79e0-4dff-929b-98b16726d800","resolution":{"observed_at":"2026-08-10T22:08:09.191999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14598","last_updated":"2024-03-21T17:50:47Z","snapshot_observed_at":"2026-07-06T17:48:29.589765Z","submitted_at":"2024-03-21T17:50:47Z","title":"PSALM: Pixelwise SegmentAtion with Large Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14598","snapshot_observed_at":"2026-08-10T22:08:09.196290Z","title":"Psalm: Pixelwise segmentation with large multi-modal model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.196290Z"},"links":{"cited_paper":"/paper/2403.14598","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:8ff7a4a3e573e9d2b8caab07eb032e7630ec4a6c78ad0117c1661f798d0eb2d4","observation_id":"12eb69c5-d263-4009-a722-bd60c4d88cd6","resolution":{"observed_at":"2026-08-10T22:08:09.196290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02555","last_updated":"2026-06-03T14:06:58Z","snapshot_observed_at":"2026-08-02T07:30:11.990278Z","submitted_at":"2024-02-04T16:06:05Z","title":"High-Quality Entity Segmentation and Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02555","snapshot_observed_at":"2026-08-10T22:08:09.200713Z","title":"Generalizable entity grounding via assistance of large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.200713Z"},"links":{"cited_paper":"/paper/2402.02555","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:91d5d2e0eb6124e5a16ada5bc3d7553750830e3d994152b9942e827eec347e94","observation_id":"b7939f39-074d-4d56-9661-49c6465823f6","resolution":{"observed_at":"2026-08-10T22:08:09.200713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14167","last_updated":"2023-05-24T02:51:37Z","snapshot_observed_at":"2026-08-06T19:11:00.161773Z","submitted_at":"2023-05-23T15:37:28Z","title":"DetGPT: Detect What You Need via Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14167","snapshot_observed_at":"2026-08-10T22:08:09.205049Z","title":"Detgpt: Detect what you need via reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.205049Z"},"links":{"cited_paper":"/paper/2305.14167","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:97979a3b28841b9c0ed7975edc5f19a67438ec39e02c8fee4e3c7d01cfae5255","observation_id":"5c8f212d-9576-4172-af34-77b7d3eac30b","resolution":{"observed_at":"2026-08-10T22:08:09.205049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-10T22:08:09.209616Z","title":"Kosmos-2: Grounding multimodal large language models to the world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.209616Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:de1e941bd3dede9422bedc21efc08957cd77b459db96e7b96bfd52f8d0479d01","observation_id":"c274bec4-ace3-4ebd-b265-17053a7fb8a6","resolution":{"observed_at":"2026-08-10T22:08:09.209616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-10T22:08:09.213246Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.213246Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:afedaa8c245e5f2f2e9e4970fffc2674da74069682ebbedd341f747c9c1f5fe4","observation_id":"3757acce-7c71-46a2-94bf-e6f0f6b3881b","resolution":{"observed_at":"2026-08-10T22:08:09.213246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09474","last_updated":"2023-07-18T17:56:06Z","snapshot_observed_at":"2026-08-09T11:47:54.530329Z","submitted_at":"2023-07-18T17:56:06Z","title":"ChatSpot: Bootstrapping Multimodal LLMs via Precise Referring Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09474","snapshot_observed_at":"2026-08-10T22:08:09.216959Z","title":"Chatspot: Bootstrapping multimodal llms via precise referring instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.216959Z"},"links":{"cited_paper":"/paper/2307.09474","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:839bd24b8e742977caf7b9ab384155b2db0fc7ce878cbf588cffd68740c8b631","observation_id":"7e0c75be-d544-4487-99a1-7095e9845e83","resolution":{"observed_at":"2026-08-10T22:08:09.216959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-07T18:00:59.339869Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-10T22:08:09.220351Z","title":"Gpt4roi: Instruction tuning large language model on region- of-interest,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.220351Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:c0f89fdba8262477552c2afe21de6346ca564be7c67a4783ba128beb5b662f76","observation_id":"821b2ad9-254b-4062-b5fe-f02f30c56f55","resolution":{"observed_at":"2026-08-10T22:08:09.220351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08581","last_updated":"2023-07-17T15:51:47Z","snapshot_observed_at":"2026-08-10T13:18:06.198450Z","submitted_at":"2023-07-17T15:51:47Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08581","snapshot_observed_at":"2026-08-10T22:08:09.224221Z","title":"Bubogpt: Enabling visual grounding in multi-modal llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.224221Z"},"links":{"cited_paper":"/paper/2307.08581","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:b5e8645e3edec44d73911138658b8d2756261d7367e0b24bad2552c4ea8683d0","observation_id":"9ad3271b-c977-4fb8-8125-94e52b906c45","resolution":{"observed_at":"2026-08-10T22:08:09.224221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.229000Z","title":"Pink: Unveiling the power of referential comprehension for multi-modal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.229000Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:54199ddca5c61efead81cd191dc679d7eefd3160044b1b1c4cb9f169abb22684","observation_id":"97b84671-bcc8-4d56-8f9e-f065a7a5b6b4","resolution":{"observed_at":"2026-08-10T22:08:09.229000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-10T22:08:09.233293Z","title":"Ferret: Refer and ground anything anywhere at any granularity,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.233293Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:6a103fae91dcb953ec8b898dd430038ce9b4d66b33678d7bed279808fd2c0d49","observation_id":"1d7e84db-6650-43bf-b8ab-700823197c4b","resolution":{"observed_at":"2026-08-10T22:08:09.233293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-10T22:08:09.237852Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.237852Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:c57fc03dcdc31f730a403eed3b63a6692ab862bdf5add167783bb0e9ea06d43e","observation_id":"d94408d8-8a68-4b3d-965e-527907aedec8","resolution":{"observed_at":"2026-08-10T22:08:09.237852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06791","last_updated":"2023-12-06T11:06:06Z","snapshot_observed_at":"2026-07-06T16:46:13.977014Z","submitted_at":"2023-11-12T09:58:16Z","title":"InfMLLM: A Unified Framework for Visual-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06791","snapshot_observed_at":"2026-08-10T22:08:09.241365Z","title":"Infm- llm: A unified framework for visual-language tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.241365Z"},"links":{"cited_paper":"/paper/2311.06791","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:9bfea4d94c92788aad0d21a5e451b4c216ecb3ffc04aeebdbfa5cfa8e4bffcea","observation_id":"9e94c0bd-0618-47da-8a62-9a9240eead46","resolution":{"observed_at":"2026-08-10T22:08:09.241365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:08:09.245024Z","title":"Lion: Empowering multimodal large language model with dual-level visual knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.245024Z"},"links":{"citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:32b283d543adb4f134d9cf0aa37bc1fe33dbb772697f290906ad919c7528076b","observation_id":"1fbe80b3-402a-4d1d-ad35-135da6b9e3b6","resolution":{"observed_at":"2026-08-10T22:08:09.245024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-10T22:08:09.249066Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.249066Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:5e866f41a5218c7dab355b7e399f2b075885a1c662660c57e0c1a3642bc656d7","observation_id":"e90aba5a-d9c9-4b29-85de-0d1999ffbb63","resolution":{"observed_at":"2026-08-10T22:08:09.249066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04498","last_updated":"2023-12-18T12:15:26Z","snapshot_observed_at":"2026-08-06T14:33:43.511633Z","submitted_at":"2023-11-08T07:15:05Z","title":"NExT-Chat: An LMM for Chat, Detection and Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04498","snapshot_observed_at":"2026-08-10T22:08:09.252943Z","title":"Next- chat: An lmm for chat, detection and segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.252943Z"},"links":{"cited_paper":"/paper/2311.04498","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:15882d2afba8af9d9f5749297ba94f361b41f3c3f37aa8dfa7236eb461883d8b","observation_id":"36949f8a-0830-4cdb-9115-913f2a23aded","resolution":{"observed_at":"2026-08-10T22:08:09.252943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14552","last_updated":"2024-10-08T03:05:09Z","snapshot_observed_at":"2026-08-11T14:50:16.365651Z","submitted_at":"2023-11-24T15:35:07Z","title":"Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14552","snapshot_observed_at":"2026-08-10T22:08:09.257115Z","title":"Griffon: Spelling out all object locations at any granularity with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.257115Z"},"links":{"cited_paper":"/paper/2311.14552","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:31e1c527938071a7d6914091d91daba61b835a07552a7fdb3368ce5e7317b508","observation_id":"8f517d6a-4f26-40b5-959d-1ca379553f64","resolution":{"observed_at":"2026-08-10T22:08:09.257115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T22:08:09.260850Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.260850Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:943cd725d00a0b84c2db056f728e4961209b717f40b808119daaeeab5f505a63","observation_id":"dc59dfea-9a5f-4d55-acb7-7be0fffb2415","resolution":{"observed_at":"2026-08-10T22:08:09.260850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02949","last_updated":"2023-12-05T18:29:31Z","snapshot_observed_at":"2026-08-08T01:04:28.020505Z","submitted_at":"2023-12-05T18:29:31Z","title":"LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02949","snapshot_observed_at":"2026-08-10T22:08:09.264452Z","title":"Llava-grounding: Grounded visual chat with large multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.264452Z"},"links":{"cited_paper":"/paper/2312.02949","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:a972e4c9863357f39ca37306fedaeb3d1914fa838e9a1a4388edac98735cc361","observation_id":"1502aaa5-2893-4cbb-8bd8-183d28e27b86","resolution":{"observed_at":"2026-08-10T22:08:09.264452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02433","last_updated":"2023-12-05T02:19:35Z","snapshot_observed_at":"2026-08-11T03:21:18.076705Z","submitted_at":"2023-12-05T02:19:35Z","title":"Lenna: Language Enhanced Reasoning Detection Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02433","snapshot_observed_at":"2026-08-10T22:08:09.268427Z","title":"Lenna: Language enhanced reasoning detection assistant,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.268427Z"},"links":{"cited_paper":"/paper/2312.02433","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:4797ca148f2bf4abda9f051f7c3c2aaec03d1318d41c40fba40e145122f2cf69","observation_id":"d20aa233-836a-467b-8115-2d971f4d6da0","resolution":{"observed_at":"2026-08-10T22:08:09.268427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13307","last_updated":"2024-01-24T09:02:00Z","snapshot_observed_at":"2026-07-06T17:19:48.251975Z","submitted_at":"2024-01-24T09:02:00Z","title":"ChatterBox: Multi-round Multimodal Referring and Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13307","snapshot_observed_at":"2026-08-10T22:08:09.272318Z","title":"Chatterbox: Multi-round multimodal referring and grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.272318Z"},"links":{"cited_paper":"/paper/2401.13307","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:0be288f2776e0abbf71721b256b28ddf582159015c0b0cea92f61a01c729857f","observation_id":"0416a874-b557-45af-b665-202975af1755","resolution":{"observed_at":"2026-08-10T22:08:09.272318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13013","last_updated":"2024-04-19T17:22:51Z","snapshot_observed_at":"2026-08-10T13:03:52.883055Z","submitted_at":"2024-04-19T17:22:51Z","title":"Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13013","snapshot_observed_at":"2026-08-10T22:08:09.276530Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.276530Z"},"links":{"cited_paper":"/paper/2404.13013","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:488a79be08df7bca28684eb07e52604d40fa19ded2b4ca48cef5861afb9dcc05","observation_id":"24b98bc0-fd9c-445c-8ff8-9b4a8d910f6a","resolution":{"observed_at":"2026-08-10T22:08:09.276530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":298},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 298 outbound references and 12 inbound Pith citation observations for arXiv:2501.02765."}