{"as_of":"2026-08-09T21:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b150638cacb72d332daefae9e67c2ee9eaf0e450ee5feff690a9c1145bb8534","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:06:36.710288Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:45:06.207778Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:37.032506Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09925","snapshot_observed_at":"2026-08-06T20:45:06.207778Z","title":"Taskgalaxy: Scaling multi-modal instruction fine-tuning with tens of thousands vision task types","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-06T20:37:19.866170Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:06.207778Z"},"links":{"cited_paper":"/paper/2502.09925","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:cbfe890fa5de9536102b7664a89ec6c9c20bce9886acbeadbd9e114e1b65c8da","observation_id":"87b4da9b-480f-4490-9f66-1bc60373c293","resolution":{"observed_at":"2026-08-06T20:45:06.207778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09925","snapshot_observed_at":"2026-08-05T12:28:29.290584Z","title":"Taskgalaxy: Scaling multi-modal instruction fine-tuning with tens of thousands vision task types","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-08T11:15:53.631141Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.290584Z"},"links":{"cited_paper":"/paper/2502.09925","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:fe1127f871d2231548c35891f828cf0db7b7cf256888372b6e9c9134fdf6ea0a","observation_id":"97dacf39-386f-42ba-af0c-d2a9fb255764","resolution":{"observed_at":"2026-08-05T12:28:29.290584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"cited_work":{"arxiv_id":"2502.09925","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09925","snapshot_observed_at":"2026-07-03T04:27:37.032506Z","title":"arXiv preprint arXiv:2502.09925 , year=","venue":null,"work_id":"1469d16e-d744-45c7-ba3c-3b4c16466675","year":null},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2502.09925","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:a8a528be110cdcedd6b514b285fc49fa61b46357a0c3f5275d2e0a09cde8fbe4","observation_id":"526c5012-c317-4475-b0f7-ba0feb98be64","resolution":{"observed_at":"2026-07-03T04:27:37.033831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09925/citation-record","integrity":"/paper/2502.09925/integrity","json":"/paper/2502.09925/citation-record.json","paper":"/paper/2502.09925"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T20:06:36.587149Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.587149Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:4b5adf604b2fac9e4feb6c5653f40bc6193599181618b17c7fa0c5a120ae15db","observation_id":"4db4ffb9-9d64-44c3-a625-712967287eba","resolution":{"observed_at":"2026-08-07T20:06:36.587149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.598507Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.598507Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:104ebdf8835d191b21180b3a081dc679af10fc475da86b91c88141be6e490611","observation_id":"b71ad4a1-42f5-4d43-a009-88110819570d","resolution":{"observed_at":"2026-08-07T20:06:36.598507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.883746Z","title":"Additionally, the average performance across 15 benchmarks, excluding MME, increased by approx- imately 1.3 points with CoT","venue":null,"work_id":"ca4a292f-c1f7-416e-93e4-f2e963b21fe2","year":2025},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.710288Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:cc8eb847e838a726ec1fbb8b3f32ef3fe2e3c70e141b4ad25b873ad7edc9bbc3","observation_id":"d740592a-1470-40c0-b80b-0fc907a50796","resolution":{"observed_at":"2026-08-07T20:06:36.887931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T20:06:36.609590Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.609590Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:168a025ac04f64277e127ab2d9dd4ba93335a7176e39588c93ed831328a4e3d9","observation_id":"bb33dac4-92e9-4f04-b7cd-85f805478307","resolution":{"observed_at":"2026-08-07T20:06:36.609590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-07T20:06:36.612990Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.612990Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:d676eebd84a8090ece406718710e0771955a8650ad26f12768f22ff10f673db1","observation_id":"f006b962-2118-4ea3-b807-24ca6e1b8ff0","resolution":{"observed_at":"2026-08-07T20:06:36.612990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.981807Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":"cb5d725c-d3bc-4dcf-bdff-fb5dcab0eb97","year":2025},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.615773Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:3a53a763bad4de92cf05cbb15fb684302198175f5d540ef9718bbaa29db476f3","observation_id":"00ce9b05-e205-4785-a849-6b65ef110902","resolution":{"observed_at":"2026-08-07T20:06:36.984192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T20:06:36.618283Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.618283Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:b756aeaf6de90500ae47b518c98d64fc700361caea4f610fad19400e65aee753","observation_id":"89c64930-2031-4d20-9fa2-62450ea5aefa","resolution":{"observed_at":"2026-08-07T20:06:36.618283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-07T20:06:36.629857Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.629857Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:4a2178b38da9de3363cf40dbef2160967f353726fb693d4ed965820db17cefe2","observation_id":"c8440316-70c4-4b2c-aeea-5864f1099fa8","resolution":{"observed_at":"2026-08-07T20:06:36.629857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-08-07T21:24:23.287695Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-08-07T20:06:36.633214Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.633214Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:37215c3e4e19232cde2796badea7a043cbedba27b24deeaba1b4128faab906e9","observation_id":"a2cff039-6b07-4082-a7f2-b173d14f87da","resolution":{"observed_at":"2026-08-07T20:06:36.633214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T20:06:36.636293Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.636293Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:df97794d7cecac8445c09f9f963f3f7c8b98435488f18da49fa2ad1da6a60b38","observation_id":"4eb6d2d8-0e6c-4974-bf75-4e4a18535df7","resolution":{"observed_at":"2026-08-07T20:06:36.636293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-08T00:29:35.147198Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-07T20:06:36.638524Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.638524Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:1ac606fbc25e5cb8036eec40eadba72bbaec354c8c6cbc09f4a116dfe6d26d6f","observation_id":"a1d1e027-957c-42bf-94e0-f94604204e11","resolution":{"observed_at":"2026-08-07T20:06:36.638524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.966703Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"d264d82e-3617-4afc-9157-a9859a67b052","year":2019},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.643505Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:782e149de56a67ea1c231a0eb2e645bb0cd631cdaacaffc063560a95a32a3911","observation_id":"8ad6874f-97cc-4519-9e1c-7f851a5ab7af","resolution":{"observed_at":"2026-08-07T20:06:36.969092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.958942Z","title":"Vicente Ordonez, Girish Kulkarni, and Tamara Berg","venue":null,"work_id":"f5956db7-1319-44fd-b27a-9fd68190bee9","year":2025},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.645606Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:af44799a119de9a32b47f9d48cee4f93c08d02711a43d31c8843c4760943d55e","observation_id":"d0ea9767-8369-471b-89d3-06807f362983","resolution":{"observed_at":"2026-08-07T20:06:36.961764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.948675Z","title":"Solving geometry problems: Combining text and diagram interpretation","venue":null,"work_id":"b429861d-a5ef-42e1-b7b7-db04cab068e1","year":2015},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.650079Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:50fe52a448faa3810cda74a7290a7084785f1240a1f22c6acfbedeb404540a49","observation_id":"36598b57-5f47-429d-8820-b1cf2a23c9b9","resolution":{"observed_at":"2026-08-07T20:06:36.952198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-08T00:41:26.316141Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-07T20:06:36.653295Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.653295Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:13ce049b0c9fb341656c3278141081b007988cf53314f46636d48d47b252e0a5","observation_id":"4d15d3ad-3a5f-49ce-92f3-9463fdbcb74d","resolution":{"observed_at":"2026-08-07T20:06:36.653295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T20:06:36.656360Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.656360Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:b5d4eea93f361925cc042d114af010b540d5cdff11de1bde294ab298aac83e3a","observation_id":"4c38e666-d464-42f6-b926-12bb72dfaba6","resolution":{"observed_at":"2026-08-07T20:06:36.656360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T20:06:36.658902Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.658902Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:28162e5f1f1a40c50a84f6a627a19096bc1529a29099ff6035015343e6cc69b6","observation_id":"66f82cbf-2116-46a3-bd17-063b44d2e308","resolution":{"observed_at":"2026-08-07T20:06:36.658902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T20:06:36.661803Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.661803Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:9fa38e96f67eb6940230764ff5cd4fa09b00652c8886690ca91a35797f5e1c4a","observation_id":"8cbb7385-bbcb-425e-bbff-1cbe2f657cfc","resolution":{"observed_at":"2026-08-07T20:06:36.661803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-08-09T09:24:00.370216Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-07T20:06:36.665171Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.665171Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:2900435541e20f250542134796ca2fbc559413026fec5f6fd8624964ea507d10","observation_id":"5ce108d0-e454-49f4-87cd-7d8c01268d5d","resolution":{"observed_at":"2026-08-07T20:06:36.665171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-06T17:31:18.801416Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-07T20:06:36.667965Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.667965Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:f07acf5a6c4d7cfe7254ac36d0833e658e21d8c55ad0eb67498dc958a4620bd2","observation_id":"65a650b0-96d6-417c-aeb3-4f6ac7e412d7","resolution":{"observed_at":"2026-08-07T20:06:36.667965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11690","last_updated":"2024-02-18T19:38:44Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:38:44Z","title":"Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11690","snapshot_observed_at":"2026-08-07T20:06:36.670967Z","title":"Vision-flan: Scaling human-labeled tasks in visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.670967Z"},"links":{"cited_paper":"/paper/2402.11690","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:da752044333fa7ec0b70a69eb159064b7fc31312f7b59332dbd2388d9ed63ec7","observation_id":"22adde2f-2960-441e-a9bb-fbb12cdc4497","resolution":{"observed_at":"2026-08-07T20:06:36.670967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-07T20:06:36.673940Z","title":"Baichuan 2: Open large-scale language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.673940Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:2a174f74a37e198d8c572b43bb5505c4af7425f12f272c4e859cc8514ae3721f","observation_id":"fdab4b81-927f-4110-b384-2009ac551252","resolution":{"observed_at":"2026-08-07T20:06:36.673940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-07T20:06:36.676780Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.676780Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:16d7f5e0c7d5672330f9d39c07c7bbc4a442e109acdfbccbb828208143dceb26","observation_id":"3f161150-a1eb-41c7-aa20-5ac45c0e4fad","resolution":{"observed_at":"2026-08-07T20:06:36.676780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T20:06:36.680130Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.680130Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:33614164bbfe6de2ef81ce21c10a2628d2b4b2f116c815fbeec7336cd7ab45e3","observation_id":"2c7450c7-b950-4cda-bd3c-b69801092acd","resolution":{"observed_at":"2026-08-07T20:06:36.680130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02582","last_updated":"2024-01-05T00:26:07Z","snapshot_observed_at":"2026-08-09T16:57:52.708316Z","submitted_at":"2024-01-05T00:26:07Z","title":"CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02582","snapshot_observed_at":"2026-08-07T20:06:36.683745Z","title":"Cocot: Contrastive chain-of-thought prompting for large multimodal models with multiple image inputs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.683745Z"},"links":{"cited_paper":"/paper/2401.02582","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:a95a63e80eda46ba40e4cee696d4f5445be106ac495066f76add938907461fd9","observation_id":"a4454b98-c9c2-4fcd-857e-251e059622f2","resolution":{"observed_at":"2026-08-07T20:06:36.683745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16989","last_updated":"2024-07-16T05:59:06Z","snapshot_observed_at":"2026-08-07T11:02:42.163743Z","submitted_at":"2024-06-24T05:24:41Z","title":"Retrieval-Augmented Mixture of LoRA Experts for Uploadable Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16989","snapshot_observed_at":"2026-08-07T20:06:36.687453Z","title":"Retrieval-augmented mixture of lora experts for uploadable machine learning.arXiv preprint arXiv:2406.16989,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.687453Z"},"links":{"cited_paper":"/paper/2406.16989","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:aaed1619e48f884cce271c539a7df18c223236433e90be885735225364fbf41d","observation_id":"8edb9f04-add9-4cf5-9119-d2de3bb9b0e7","resolution":{"observed_at":"2026-08-07T20:06:36.687453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T20:06:36.690405Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.690405Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:43ef8c6b8a7d0db461b2a98cc690454a3881cad2578e18096ec2709c0270b599","observation_id":"af849d5c-5d51-4666-955a-871ec3ad7d12","resolution":{"observed_at":"2026-08-07T20:06:36.690405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.938674Z","title":"Model tailor: Mitigating catastrophic forgetting in multi-modal large language models","venue":null,"work_id":"fb722bff-6277-4061-92c3-984149868867","year":2024},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.693230Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:9c040ee01edb6d8c8bff3e1490269ef1d783f000d10e694a24fa9679724179fb","observation_id":"c18cf347-567f-4610-8eda-40bcd69d31fb","resolution":{"observed_at":"2026-08-07T20:06:36.941270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.929816Z","title":"The approximate data sources and their corre- sponding sample sizes are presented in Table 1 of the main text","venue":null,"work_id":"05781d75-2af4-45eb-9840-ea73f20dcd66","year":2025},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.696223Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:4062d14e5cf1a230aa9c3344421daf701fee4a4700e90d9c36d633def134aa92","observation_id":"f224347c-01f6-43d6-802a-4f82d953065c","resolution":{"observed_at":"2026-08-07T20:06:36.933258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.920231Z","title":"data fusion,","venue":null,"work_id":"02f212e2-3ef1-46ac-bf2c-d2368b8ea782","year":2023},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.699123Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:2873bd529649980c8006196b837985df9c611449e8230f5adceefd849d438ead","observation_id":"b86f269b-e027-408c-81be-60da4a06a5c1","resolution":{"observed_at":"2026-08-07T20:06:36.923364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.910824Z","title":"flooding inundates the marina and affects nearby buildings and facilities","venue":null,"work_id":"07f0022c-b7d3-46e2-b84d-4513a1ff8b41","year":2023},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.701887Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:c0e6175319399a62f8400a7fb57a72695091ee7900997abd036b3213947115d9","observation_id":"b21b3808-eca5-42b6-9b9d-285b43a72509","resolution":{"observed_at":"2026-08-07T20:06:36.913966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.893582Z","title":null,"venue":null,"work_id":"99442c3d-00dd-46ff-b957-5d8fe9cf052b","year":2023},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.707923Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:2d5b1d412a306f9543582919ed2af469754bf45199a5ff6438ef734428368d7f","observation_id":"01ddcfb7-30c0-4aa1-b4a1-e2331c2a7d38","resolution":{"observed_at":"2026-08-07T20:06:36.896132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.901746Z","title":null,"venue":null,"work_id":"94703de1-0521-4d09-9ff3-5f33749d5507","year":2025},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.705243Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:d845896a530b1bd1c1ecf016f0c29533f4428f53ae5e2cab0d608488d5850a3e","observation_id":"a6bb92ac-b941-4e67-b564-aa8923970de3","resolution":{"observed_at":"2026-08-07T20:06:36.905609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.623857Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.623857Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:a941d4c5f56d178c95fae50aeb7e5b3ccf95bc5ea7bd85d8b6b5ef6379800266","observation_id":"703968e8-f301-40e6-98b0-f0cdc48b472e","resolution":{"observed_at":"2026-08-07T20:06:36.623857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-07T20:06:36.627225Z","title":"Mimic-it: Multi-modal in-context instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.627225Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:22189771edc4ba14ed9040732eaeb0ee9cb7865fca1a2cb678e298967d6172e7","observation_id":"193ca38e-eb40-44fb-a523-8f2f0805e407","resolution":{"observed_at":"2026-08-07T20:06:36.627225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:06:36.621120Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.621120Z"},"links":{"citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:b16142dcd881c79c772826146759553018a957108bd5db07716e64853ba72935","observation_id":"37e7c896-7c61-416e-86a3-ac736fff99f6","resolution":{"observed_at":"2026-08-07T20:06:36.621120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T20:06:36.640824Z","title":"Chartqa: A bench- mark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.640824Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:d94a81bbb774e819ecb4c53f60809413b8a45f37b28ecfef7632116f083894ac","observation_id":"165ab99b-7c93-46c3-b49b-2117d17e4627","resolution":{"observed_at":"2026-08-07T20:06:36.640824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08545","last_updated":"2022-11-15T22:31:38Z","snapshot_observed_at":"2026-07-06T14:18:49.988227Z","submitted_at":"2022-11-15T22:31:38Z","title":"MapQA: A Dataset for Question Answering on Choropleth Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08545","snapshot_observed_at":"2026-08-07T20:06:36.601511Z","title":"Mapqa: A dataset for question answering on choropleth maps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.601511Z"},"links":{"cited_paper":"/paper/2211.08545","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:18f6c4914c69e01176e76d03899e2683a98dbd6e2bac7fda917c3a5f06cd31cb","observation_id":"13a67b69-b0f5-40f0-8346-5d8c6d2de46a","resolution":{"observed_at":"2026-08-07T20:06:36.601511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-07T20:06:36.647480Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.647480Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:ce2e58052450ba8e4933483677638f6012596114c812f80090891e7eff723a16","observation_id":"d0ffdbe8-93f2-40c9-8df8-093b6ad9a183","resolution":{"observed_at":"2026-08-07T20:06:36.647480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-07T20:06:36.605834Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.605834Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:623b37951fd1d2b75d5d26650cf5e0e4156eae6e492cd15b592a91912fc934dd","observation_id":"32db08a6-1578-42f1-88d7-7628405639c0","resolution":{"observed_at":"2026-08-07T20:06:36.605834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06496","last_updated":"2024-06-14T19:47:20Z","snapshot_observed_at":"2026-07-06T18:28:16.301122Z","submitted_at":"2024-06-10T17:31:36Z","title":"Direct Preference Optimization for Suppressing Hallucinated Prior Exams in Radiology Report Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06496","snapshot_observed_at":"2026-08-07T20:06:36.595667Z","title":"Direct preference optimization for suppressing hallucinated prior exams in radiology report gen- eration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.595667Z"},"links":{"cited_paper":"/paper/2406.06496","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:2835ff29dacd8cb86bec5d147a53ebacdc9acdbe1c4325fed399e66f4299cd04","observation_id":"74ad1edd-eb65-4678-be2c-1be2619bde63","resolution":{"observed_at":"2026-08-07T20:06:36.595667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T20:06:36.592185Z","title":"Jinze Bai, Shuai Bai, Shusheng Yang, Shijie Wang, Sinan Tan, Peng Wang, Junyang Lin, Chang Zhou, and Jingren Zhou","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.592185Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:a13bca40d78786477577ad43d1673248e3a5b485be54fc0f355b0295e1a93bf9","observation_id":"8f80a52c-1705-44dc-9737-1391e0f854d4","resolution":{"observed_at":"2026-08-07T20:06:36.592185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 3 inbound Pith citation observations for arXiv:2502.09925."}