{"as_of":"2026-08-15T20:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd6620614f0164db116c7e557f1a8779b8111bd92958925b08ead5694e8751c2","coverage":[{"denominator":102,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:57:06.818547Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:14:42.975508Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:14:45.125038Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"cited_work":{"arxiv_id":"2412.09612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09612","snapshot_observed_at":"2026-08-07T11:14:45.125038Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","venue":"cs.CV","work_id":"26231900-df47-4365-b0f6-ff8ecdc4db7c","year":2024},"citing_paper":{"arxiv_id":"2506.03150","last_updated":"2025-06-03T17:59:52Z","snapshot_observed_at":"2026-08-09T04:47:45.249838Z","submitted_at":"2025-06-03T17:59:52Z","title":"IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:42.975508Z"},"links":{"cited_paper":"/paper/2412.09612","citing_paper":"/paper/2506.03150"},"observation_digest":"sha256:18fc3b3ff17854f053a52a44ce2c882e74b1f3fe11d82f844eef28bd6782f771","observation_id":"5107b992-66d4-4588-b9e9-4437c1efa220","resolution":{"observed_at":"2026-08-07T11:14:45.153165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.09612/citation-record","integrity":"/paper/2412.09612/integrity","json":"/paper/2412.09612/citation-record.json","paper":"/paper/2412.09612"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.739052Z","title":"Jointly training large autoregressive multi- modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.739052Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:52ed75142118fab68971fd82009b1f79d445187029964f507c732dda6a3f4cd7","observation_id":"f5f8ebd4-2298-4343-9a45-0bc80dba677f","resolution":{"observed_at":"2026-08-11T16:57:05.739052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.750471Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.750471Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:22a1ad563d6987ae3e6301f18a0dd25664d83282c3d699eb03ece3f2de02c222","observation_id":"f8074de5-f924-495e-b8be-8ed07ecbfc3a","resolution":{"observed_at":"2026-08-11T16:57:05.750471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T16:57:05.763199Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.763199Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:8703a110ca886a7015e00c07daec1361742b5701197d580602393ea79a7ef9da","observation_id":"5e0662cb-420b-4460-b502-37702a660500","resolution":{"observed_at":"2026-08-11T16:57:05.763199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.779086Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.779086Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:bc3f8e66f73165730e922640c8354e575dd6b0737f0ea1797a800d2fe39fab8a","observation_id":"cf49f528-b834-4f9d-bae9-a9f96b913ef6","resolution":{"observed_at":"2026-08-11T16:57:05.779086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T16:57:05.788903Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.788903Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:5ba148791121c6e342a28266c0cab95cdc989f722109932ec9974478f2a18e61","observation_id":"24f30fd7-eba8-41e7-a57f-d4f27ac30262","resolution":{"observed_at":"2026-08-11T16:57:05.788903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.801317Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.801317Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:a96f57b7b48fc4c90a983254a0cb0a291c7257621cb278c9c6a496cda2c1da4e","observation_id":"f6827a3a-35a7-439c-8758-eab2f98db29e","resolution":{"observed_at":"2026-08-11T16:57:05.801317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.818171Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.818171Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:7949e6ee6558266ae62bec0cdec93c7f937f20b1dd4bba241b711b622c6f4bd8","observation_id":"5ff84088-9dc4-45ce-8106-a5d639bcf826","resolution":{"observed_at":"2026-08-11T16:57:05.818171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-11T16:57:05.827444Z","title":"Shikra: Unleashing multimodal llm’s ref- erential dialogue magic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.827444Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:d33db4125dc50910d5d25e06deccd6203ff9d32a1937ec240cb8f6336cda78da","observation_id":"63253333-4349-4526-831f-2ef8f38e3e98","resolution":{"observed_at":"2026-08-11T16:57:05.827444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.842477Z","title":"Text-to-3d using gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.842477Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:3471484100afd72eaed543fed81387f4b9f51aec618b4d62be5a8b336085c0c8","observation_id":"4c43580b-f786-4bee-b863-cd8448fc4d7c","resolution":{"observed_at":"2026-08-11T16:57:05.842477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.848790Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.848790Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:2327dddd5a1c8bf47c38b196dbe73575b79e711331f9e49889dfe0eb85642740","observation_id":"6180be68-b226-4889-9aae-24618a048fc1","resolution":{"observed_at":"2026-08-11T16:57:05.848790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.858906Z","title":"Shazeer, Vinodkumar Prabhakaran, Emily Reif, Nan Du, Benton C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.858906Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:a5c2af412e874b493aa3ca8cc091d312b0a7537b711b84508bcdc084d58220cc","observation_id":"d39d4adc-2360-4716-9ed6-535f32f1af5b","resolution":{"observed_at":"2026-08-11T16:57:05.858906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-11T16:57:05.869030Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.869030Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:b9544af9601a87ac9ad410b2fd4761a7fb517dee4f5490475d77892998aff3fd","observation_id":"413c2f35-be99-454d-a4c1-e40a2e70ac73","resolution":{"observed_at":"2026-08-11T16:57:05.869030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-11T16:57:05.877440Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model.arXiv preprint arXiv:2402.03766,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.877440Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:cada524ae85e5771970f237eb8fac92a0f414d2087a9b2c6748f5ea1e4dccd0d","observation_id":"b5953200-717a-4380-abbc-8d18c8a9ba63","resolution":{"observed_at":"2026-08-11T16:57:05.877440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.891307Z","title":"Swin2sr: Swinv2 transformer for compressed im- age super-resolution and restoration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.891307Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:443253901fa9ac8a3d23ac4dd7286c48368a2db0925c4c6037b1ba110458598e","observation_id":"28498705-c197-4dd1-b2f2-438994bccc90","resolution":{"observed_at":"2026-08-11T16:57:05.891307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16468","last_updated":"2024-09-25T20:29:36Z","snapshot_observed_at":"2026-08-13T04:32:25.046017Z","submitted_at":"2024-01-29T18:53:33Z","title":"InstructIR: High-Quality Image Restoration Following Human Instructions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16468","snapshot_observed_at":"2026-08-11T16:57:05.904435Z","title":"High- quality image restoration following human instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.904435Z"},"links":{"cited_paper":"/paper/2401.16468","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:ba6da19f6654dcd75885a647947cae63d7de15c406e11d49772b16d3a44097e2","observation_id":"a0dcd795-c6c6-4542-b704-bb72b06f01ef","resolution":{"observed_at":"2026-08-11T16:57:05.904435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.914435Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.914435Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:3c948b829506966cedb9d695b76de4e01c651c9c53dea56150a8dd31026b962e","observation_id":"cfb28bee-8a3c-4b6e-858f-c404232f58ec","resolution":{"observed_at":"2026-08-11T16:57:05.914435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.938658Z","title":"DreamLLM: Synergistic multimodal com- prehension and creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.938658Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:52462af1c9c2057c90df22d36e6210a3f192c34a2f6806bd861fcc876716ee3e","observation_id":"09647163-bcc2-475c-8f2d-4282bde20cb3","resolution":{"observed_at":"2026-08-11T16:57:05.938658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.945583Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.945583Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:80a152f810935a95904d5a28781438144967e6ee173d13d0419d30ec3c546f97","observation_id":"7e92694b-5216-49a0-a326-13524f07d6e9","resolution":{"observed_at":"2026-08-11T16:57:05.945583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.961591Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.961591Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:f767f1d68acc4edbf946d30802b3b8494f76edace6996f63f7673480a72522b7","observation_id":"4f1cb4f0-01c1-4e75-baa1-9dd39be6f903","resolution":{"observed_at":"2026-08-11T16:57:05.961591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T16:57:05.977798Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.977798Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:208a47aa915744f21095aacd3842eca80dc7307d17b2b51e260a4a1f33921ca5","observation_id":"52bd0f10-12b4-467c-82ef-eee4156a0c75","resolution":{"observed_at":"2026-08-11T16:57:05.977798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-11T16:57:05.985650Z","title":"Seed-x: Multimodal models with unified multi-granularity compre- hension and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.985650Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:d14527b5535d25f0f3be28de09451245b84044068aea69b92c2f0f92102c04b5","observation_id":"ed89863c-9687-4265-b18f-38da981a60d2","resolution":{"observed_at":"2026-08-11T16:57:05.985650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:05.994989Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:05.994989Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:0cdf1705154da4adc9b280f96a2c85110c3a46144e0887bb633810531bfeb398","observation_id":"879700aa-4510-4ca0-92c6-83b078cfd6c3","resolution":{"observed_at":"2026-08-11T16:57:05.994989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.000710Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.000710Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:bf0565b7c6929ba267ee8958a6bfbff3dd6f5fd8b04be98f0e7aba21155d0da9","observation_id":"63ce18e2-ca37-4576-af68-722e1a4b4aed","resolution":{"observed_at":"2026-08-11T16:57:06.000710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.014009Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.014009Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:6b88090432765b7e5f0b76a1986175fce7414bf500c50c75a46e1e54d6a14af2","observation_id":"be1e08b0-c69c-4162-9aad-b68a774727c9","resolution":{"observed_at":"2026-08-11T16:57:06.014009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-14T10:26:56.366247Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-11T16:57:06.024131Z","title":"Efficient multimodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.024131Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:1ad590a1ac2bd249d0494fbc763de77b85aead0e7e22b8ace6bf7c963d20ee89","observation_id":"f57083ff-43df-484f-8131-e01d1f431a9f","resolution":{"observed_at":"2026-08-11T16:57:06.024131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.030297Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.030297Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:f3ba3a332b78453a1b2c41e51caa9e0b743e16155325666d380271a764345223","observation_id":"4d547d06-d94f-4d01-90f1-f41824c16405","resolution":{"observed_at":"2026-08-11T16:57:06.030297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.061769Z","title":"Video diffu- sion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.061769Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:23cde909388b44a95a496345ce7ac97373fa761feefb52e301d59aba864656ee","observation_id":"8fa00956-1704-4db1-aac4-a396a27972a1","resolution":{"observed_at":"2026-08-11T16:57:06.061769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.071077Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.071077Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:527ac5a5187f3d37ef7fff0d020ee3462774ab53f8fc20bca2f57f7cf4f4f084","observation_id":"79d767ff-aed9-4263-9f97-9e0324c62875","resolution":{"observed_at":"2026-08-11T16:57:06.071077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-11T16:57:06.081115Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.081115Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:0b92e9715de26ffbebaf685fb41317c9ca56d76266c6e52cc016a70aff653d09","observation_id":"2f58b597-9f1e-490e-924b-a61d7e4b5213","resolution":{"observed_at":"2026-08-11T16:57:06.081115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.087395Z","title":"Text2video-zero: Text-to- image diffusion models are zero-shot video generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.087395Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:a3520d3712bd2bda6393ad9820d13494ba7ebf7181dd3778b1544ebf0c11996d","observation_id":"153f4d05-3b25-4b49-9c1a-c6ae14fa6f57","resolution":{"observed_at":"2026-08-11T16:57:06.087395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T16:57:06.095406Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.095406Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:9a773b27edaa1d705672eaed9aebee6ec6ec5fa2f48121eb04c0acdc888c62c6","observation_id":"074f8014-4c4d-444c-83e6-11db2b7a5f67","resolution":{"observed_at":"2026-08-11T16:57:06.095406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T16:57:06.112192Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.112192Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:02cf9275a8b1924d26cf1325c390b0de5e608df795262154a8be173a9cbe7964","observation_id":"b815a305-1770-44aa-8764-c50cabcfb95e","resolution":{"observed_at":"2026-08-11T16:57:06.112192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.123830Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.123830Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:2ab81a68e01e892b08429f8e3912aec6de37c0a18e413cc41a2488113cb4a9dc","observation_id":"af63466e-3bd7-43eb-9d8b-98eef79a04bc","resolution":{"observed_at":"2026-08-11T16:57:06.123830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T16:57:06.130954Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.130954Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:da86aca10c7d642418a93bd145d513e998e1de1d57412888eba6f908476944a5","observation_id":"596f06dc-b71e-4528-bc44-eec994744491","resolution":{"observed_at":"2026-08-11T16:57:06.130954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.140440Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.140440Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:3a65168d8c23a6f6075655dce867ebc97e130338c763572f76bf6e16277914d0","observation_id":"68b6491e-5845-4741-9ddc-b9f54858f562","resolution":{"observed_at":"2026-08-11T16:57:06.140440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-11T16:57:06.150477Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.150477Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:add67bdbff0444ded5f2ab529a25d77256a9d34598b324717e2f28891428948b","observation_id":"2aa77f1f-837c-4504-88fc-a72a8e0eac97","resolution":{"observed_at":"2026-08-11T16:57:06.150477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-11T16:57:06.161470Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.161470Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:56b9930cdd400be8639d89775dae30a642aa4d464670f7b393f5d5f8680c0003","observation_id":"e388f73d-46fd-4485-affd-7bf6cf84da69","resolution":{"observed_at":"2026-08-11T16:57:06.161470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:10.089334Z","title":"Taskmatrix","venue":null,"work_id":"5fc414a0-5617-412d-bb8d-f57514f78e49","year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.173060Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:3a9508175e682c16e03613cf0095194516e3e29e2180ac769ac21311623f250d","observation_id":"9b99bae4-854b-4e3c-aabd-43cedaedfd3c","resolution":{"observed_at":"2026-08-11T16:57:10.101330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-11T16:57:06.181897Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.181897Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:7f7a5a08523433731d9db45620e8cdb1a41260f84e5b18e027988ef234d86b31","observation_id":"2dbd13d8-b596-4c2c-abbe-156399e844fe","resolution":{"observed_at":"2026-08-11T16:57:06.181897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:10.037764Z","title":"Revive: Regional visual represen- tation matters in knowledge-based visual question answer- ing","venue":null,"work_id":"50b15a67-d55a-4976-b809-e0656ad063d4","year":2022},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.198388Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:35819b73d97b2a4bc2341ac674e3122f97e17db223c2bbbf652b5f78d5a2e68c","observation_id":"c8b5ac1b-688c-4cae-82b0-20efe3db61c4","resolution":{"observed_at":"2026-08-11T16:57:10.044415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:10.004857Z","title":"Smaug: Sparse masked autoencoder for effi- cient video-language pre-training","venue":null,"work_id":"38c8031c-36d0-4ef4-8f83-91effa132a63","year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.212095Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:46610d100a812a30211b6fc4e4fb335d6a92ce7daa3bdc147453b63b7b4e9992","observation_id":"8b114b7f-a2d6-41a5-aea4-6e8b00ce3bed","resolution":{"observed_at":"2026-08-11T16:57:10.012964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.974523Z","title":"Text-driven image editing via learnable regions","venue":null,"work_id":"83a0d3a3-40ea-4a58-8009-5f37c20b2bc7","year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.221520Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:bc7f2371ce24ebd3753a0c0a7c216fdfed0eb470a264a8774f18bf9e35f1bde9","observation_id":"b57ec712-b42d-485c-bdce-99aa453cdc52","resolution":{"observed_at":"2026-08-11T16:57:09.989331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17237","last_updated":"2024-03-25T22:34:05Z","snapshot_observed_at":"2026-08-13T00:45:12.781229Z","submitted_at":"2024-03-25T22:34:05Z","title":"DreamPolisher: Towards High-Quality Text-to-3D Generation via Geometric Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17237","snapshot_observed_at":"2026-08-11T16:57:06.235045Z","title":"Dreampolisher: Towards high-quality text-to-3d generation via geometric diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.235045Z"},"links":{"cited_paper":"/paper/2403.17237","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:17ff697e982223a21dc934deb1371efbcf59a0fd429c57afb93b6ba1ee1070c6","observation_id":"3dc1c883-4108-4578-90c9-ceb11602342e","resolution":{"observed_at":"2026-08-11T16:57:06.235045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04681","last_updated":"2024-07-05T17:43:30Z","snapshot_observed_at":"2026-08-15T13:35:16.329113Z","submitted_at":"2024-07-05T17:43:30Z","title":"Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge","version":1},"cited_work":{"arxiv_id":"2407.04681","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04681","snapshot_observed_at":"2026-08-11T16:57:08.251516Z","title":"Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge","venue":"cs.CV","work_id":"aa1fc069-168a-4abb-967c-081dab04be61","year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.241776Z"},"links":{"cited_paper":"/paper/2407.04681","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:4fcd1d2e834793ee772623f10cacd16cf332b2aad2edc695dcb55158d67cc883","observation_id":"39cf98f6-871e-4caf-959c-2d746af44546","resolution":{"observed_at":"2026-08-11T16:57:08.262214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.936727Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"334dd37b-bf8a-48b8-90d6-c8b1b0282767","year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.253395Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:b0e7c2939af08bf12fd857d70c0b18062e6fc8bb1e1af30cc824e502fa7e1831","observation_id":"f2f0e5d6-a6aa-4faf-a735-c88385a36711","resolution":{"observed_at":"2026-08-11T16:57:09.950437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.267493Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.267493Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:0abbbd1365df6a04b5ccc70357dd398d55560c30c60ca9b65067b816062eb4cb","observation_id":"8ad5e083-1d51-457c-a4dd-18e90383590f","resolution":{"observed_at":"2026-08-11T16:57:06.267493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.277100Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.277100Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:16a2c3e2c4824f5b0cd1fa90d29d021c1d82991c8622d40c1fd88de904467ef6","observation_id":"eccf3dc0-527b-4d4d-a5fa-1f14ea540741","resolution":{"observed_at":"2026-08-11T16:57:06.277100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.867896Z","title":"Visual instruction tuning","venue":null,"work_id":"17d1899c-2d33-48ed-a2b2-19f0f776a2a5","year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.284472Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:9293a9153ec54f742208b22fbd932ae2b73e3c42b7d50f4b3d3c05a6bf5c2ba8","observation_id":"2d632f72-8bea-4ab6-a33b-29a9a7a58912","resolution":{"observed_at":"2026-08-11T16:57:09.874943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-11T16:57:06.291226Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.291226Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:0c54691804fb9f09cae2a44f9f6865492dbf98925cd1bc082848ca6fe9502db1","observation_id":"173af06e-3ddb-4933-b580-fd213a232042","resolution":{"observed_at":"2026-08-11T16:57:06.291226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-11T16:57:06.299895Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.299895Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:3f3471c264eb3dc137502406b4f03f3e2bfa44b170c05bf5e8456637846cff2c","observation_id":"1f65522e-41b5-4bae-ba4f-26e62e743e0b","resolution":{"observed_at":"2026-08-11T16:57:06.299895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.838236Z","title":"Wonder3d: Single image to 3d using cross-domain diffusion","venue":null,"work_id":"3a944bab-10f5-448b-8214-56a626688342","year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.313191Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:d52b3f0527d20b5542826e2b965784c8023299b89ec350e719983183a4f97882","observation_id":"0bbbcf05-3ef4-4f87-b9ed-1f73b3e7eeb9","resolution":{"observed_at":"2026-08-11T16:57:09.845097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.322005Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.322005Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:05eff35df57632b9d07c7902155493c877194f955dd9de65ea17fd9a0aeb04c1","observation_id":"eed922a2-6872-4a12-83b7-623b300def17","resolution":{"observed_at":"2026-08-11T16:57:06.322005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.782121Z","title":"Computation of normal- ized edit distance and applications","venue":null,"work_id":"a640c288-91b9-4051-8bef-20bb79de1bfc","year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.327652Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:fe7d1eb8be8173748829f2c2c3d1b523408f93d53ac362a490b3dd6848238024","observation_id":"3103a04d-74eb-4f3a-950a-5e9604070d88","resolution":{"observed_at":"2026-08-11T16:57:09.789078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-11T16:57:06.339114Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.339114Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:3e1a78a8826bbe47f8a670fc4d2a41fba03bce2c346cbb822937f81daecc0f3f","observation_id":"be23d132-43b9-4498-bd91-628c2264475f","resolution":{"observed_at":"2026-08-11T16:57:06.339114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.748045Z","title":"Phi-2: The surprising power of small language models, 2023","venue":null,"work_id":"b52ceda8-10bb-4deb-aa6f-9aa986744ad0","year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.347560Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:2fe35fd77e88d5839cf2ca559657f2ea500d002699655be3a5c91a3a47fa42d4","observation_id":"1ff440b1-5ec6-4a83-92ea-619618a455c3","resolution":{"observed_at":"2026-08-11T16:57:09.754906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.358713Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.358713Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:3cba39b550a177c6023f0537a7fb9de746095be2c21752a90c285c53f0ed2933","observation_id":"1a14f775-3761-4d4d-9a73-bf91356bcd9a","resolution":{"observed_at":"2026-08-11T16:57:06.358713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-11T16:57:06.374889Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.374889Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:bd6958d1f3e85c0ee36917dc387e607f629534a3ed1b3d4b8074ab466dee0461","observation_id":"332e90d5-d41f-41ea-b1c6-ddd79b0bd221","resolution":{"observed_at":"2026-08-11T16:57:06.374889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T16:57:06.388795Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.388795Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:af8fe03ace4f63343ee4732126686e5a72f7791476a4c4365f965d1c7662ef96","observation_id":"22fc9ff3-1f3d-412b-bc46-db09e861eacd","resolution":{"observed_at":"2026-08-11T16:57:06.388795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.691653Z","title":"Tool learning with foundation models, 2023","venue":null,"work_id":"cf5df32f-d999-4331-b9b6-f3f15939e198","year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.396571Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:31407d51eebd99a8b09a72e3cf645f05be7b9516fcf79a46f1ee2017ec68f359","observation_id":"64e75bec-70cf-49d2-a2ff-840ef6d6489b","resolution":{"observed_at":"2026-08-11T16:57:09.702326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.667677Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"e27e4083-e152-4f54-bf36-e9fb64a77c37","year":2022},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.403942Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:16a4f5a5f829018ee530843708ae8ab45e4cc8d4fa34165bd2f014bf0f7e7c81","observation_id":"8881dc30-2730-419d-a7bd-6c8dc9845864","resolution":{"observed_at":"2026-08-11T16:57:09.676668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.624720Z","title":"Toolformer: Lan- guage models can teach themselves to use tools","venue":null,"work_id":"e4e218bf-6d87-4bf6-ae8d-b4ed666555b3","year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.414930Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:fcad5991f2a83f7d0da514ecbaa3dcb69d269e5a6cb3a97ed6ff9efb6b6aebfb","observation_id":"6b3b3e7c-87b0-49df-889b-5a39d2f1593c","resolution":{"observed_at":"2026-08-11T16:57:09.635889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.588527Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":"e5bb73cf-1911-431c-a98b-417b2af2ea09","year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.425612Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:dbbee3e835bb12d9431cf9789c67fc25f200e98d57db13201d98902a510a6c13","observation_id":"98a23545-0ad7-4122-a6e7-a66dfdcc0628","resolution":{"observed_at":"2026-08-11T16:57:09.596101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-12T22:55:41.155703Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-11T16:57:06.434821Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.434821Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:9851e4ad425b8f20a9bf168ecd792b8f20df4e10f2fe528e12f20f8052d7d6fa","observation_id":"702ae479-9a6d-4899-9919-2aa79d520fd7","resolution":{"observed_at":"2026-08-11T16:57:06.434821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T16:57:06.445814Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.445814Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:3a0d89fde06b38842eaafd1beca7169f3cf68b7835eb3aeafdc45a258e6a5df1","observation_id":"f615300b-e68c-45cb-995f-055759bdab95","resolution":{"observed_at":"2026-08-11T16:57:06.445814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.562431Z","title":"Towards vqa models that can read","venue":null,"work_id":"6b431a1a-7f2a-4afe-bef6-e1a9030a492d","year":2019},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.453326Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:a33a191a7dffe1e176cec58ab82d746fe2d4996d7bc08b828f3b87ea4279f07a","observation_id":"75ce509b-ebb7-45a5-bf2c-39432f6673c6","resolution":{"observed_at":"2026-08-11T16:57:09.569932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.461329Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.461329Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:1c4c3f5bcffdb88ad86c3f12b000f0ebacdf7d12625e0d680635c6073e73ddd2","observation_id":"3f77945a-dd15-4250-ac02-b931a53b9615","resolution":{"observed_at":"2026-08-11T16:57:06.461329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14933","last_updated":"2023-10-11T15:08:51Z","snapshot_observed_at":"2026-08-13T11:53:02.164754Z","submitted_at":"2023-04-28T15:43:21Z","title":"An Empirical Study of Multimodal Model Merging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14933","snapshot_observed_at":"2026-08-11T16:57:06.469711Z","title":"An empirical study of multimodal model merging","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.469711Z"},"links":{"cited_paper":"/paper/2304.14933","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:5fe0ac3b155c361a9c49c998eb40b53a9220f401b796bc69da83ef8e0ed24da1","observation_id":"41f6e9fa-8a80-42ab-a5f7-bfababe1f242","resolution":{"observed_at":"2026-08-11T16:57:06.469711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.501923Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"f816c715-30a3-4eee-9377-9117ecd4a390","year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.479853Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:3ddff4149ff253ed68950b5febed54b225029cfa4acc63e37fe4352043f9fe2e","observation_id":"110fa0c3-e474-48ec-9aeb-4eb775b2cdd3","resolution":{"observed_at":"2026-08-11T16:57:09.510466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.454438Z","title":"Lgm: Large multi-view gaussian model for high-resolution 3d content creation","venue":null,"work_id":"80f1278b-be92-4604-a3bf-485244f4041f","year":2025},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.488168Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:88258721237cf2af251d1266803dd42a68da960671d2acee006f056fdc94a199","observation_id":"7c368a9a-2525-41ef-aaa4-f75eac08d3f1","resolution":{"observed_at":"2026-08-11T16:57:09.467959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.416078Z","title":"Any-to-any generation via composable diffusion","venue":null,"work_id":"10e9d038-bb04-4cf7-9d0b-dab408969241","year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.496849Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:1f05adf5033b922f81580f15ebcbe28820ce23d5a2048da429c9deaca40720f8","observation_id":"b2fa4058-4ff7-44b7-a808-4996554c662b","resolution":{"observed_at":"2026-08-11T16:57:09.428213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-11T16:57:06.508803Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.508803Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:f735f61c12954528fe8d8b9993e45757893c4c5bc84fd7d09de4f096b38095b3","observation_id":"a52d5fc2-798f-4c27-ae20-2e37aebb3129","resolution":{"observed_at":"2026-08-11T16:57:06.508803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-11T16:57:06.525636Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.525636Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:94dc8a165102d99fcef2ee8e635e62aeb6e6ecb8be0e0d264b8560aab17aea73","observation_id":"009075ca-5b90-47f6-a29a-0565ad916360","resolution":{"observed_at":"2026-08-11T16:57:06.525636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T16:57:06.534914Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.534914Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:163c5b5ed346d0e0d8c1dc1c13dd07a5aa7dda7acee0ebaff3dedbc490ffc44f","observation_id":"ecbce76f-6c7a-4a3a-a62a-ffc2e2c7e6d0","resolution":{"observed_at":"2026-08-11T16:57:06.534914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T16:57:06.545433Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.545433Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:cc8e87efdcc2af282e684efb1884625ffd7199c20ea39bfd54c93d228525c2c5","observation_id":"9b6f357e-f1e0-45aa-95da-a20d48baec2f","resolution":{"observed_at":"2026-08-11T16:57:06.545433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-08-15T10:03:23.497428Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-11T16:57:06.555393Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.555393Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:053c63d358459e7be6c4a997c7b1f059408bfec7db1e5e114f803c97e3f817b6","observation_id":"9414bdaf-b781-47d4-b560-a7194aa76a8d","resolution":{"observed_at":"2026-08-11T16:57:06.555393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.385344Z","title":"General object foundation model for images and videos at scale","venue":null,"work_id":"0ea5e13c-7eb1-4466-8edd-335b66730807","year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.567868Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:c6c62e82f30f5a6ce40b1980835fbca93a2c3a6f4b155631f97d1ef88afc9231","observation_id":"92615464-8fb5-479b-8100-b317c8dbd6f4","resolution":{"observed_at":"2026-08-11T16:57:09.392821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.577043Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.577043Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:26f60107297331bb5fc05e9033b745f6e34d74bc310d2597a00570a84cb99cbf","observation_id":"474b456c-df7a-4e04-9822-dcc99e0cd337","resolution":{"observed_at":"2026-08-11T16:57:06.577043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-14T02:26:17.829525Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-11T16:57:06.586644Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.586644Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:98b5f7a7d7364ea257f60a56c6d19b53f1b072fbfc3b514c7983c6914dff4e3d","observation_id":"4573a69c-cef9-4e6e-9e57-06640bc20b12","resolution":{"observed_at":"2026-08-11T16:57:06.586644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-14T06:13:17.008769Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-11T16:57:06.594700Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.594700Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:8d8e9e39ab8f9b43382483f2d43ba13570185f0874516665726b410895fcf0b8","observation_id":"56f113ee-d064-4a3e-a554-bc032c86245c","resolution":{"observed_at":"2026-08-11T16:57:06.594700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.318689Z","title":"Segformer: Simple and efficient design for semantic segmentation with transform- ers","venue":null,"work_id":"f6acdd34-d821-4a9e-b36b-acd093b30333","year":2021},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.604714Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:15f529d1b04b54837eacf2a0ca0e7436c3b70b1e1c6f7ed0c14ffceed1f29674","observation_id":"e7480453-182b-4561-b16e-e5e76cd5032a","resolution":{"observed_at":"2026-08-11T16:57:09.333404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-11T16:57:06.613698Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.613698Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:155de7af968820d48d66a1c67a19abc63305225f3eca55afaaa1a05527f333b1","observation_id":"2cee957c-1db8-4a2d-94ca-6f3448285f19","resolution":{"observed_at":"2026-08-11T16:57:06.613698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:06.620645Z","title":"xgen-mm (blip-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.620645Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:2acbfe08d8625a465d680777caf11ddcf1f3d0ced6189c23081941265b61391a","observation_id":"591bf398-99fc-43d8-824d-8d4b9385402b","resolution":{"observed_at":"2026-08-11T16:57:06.620645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-11T16:57:06.627632Z","title":"Depth anything v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.627632Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:ae2565eed0d8bcf5ab7d81fa69d239454ae54ba9c0882b6e61e11a96578f0f30","observation_id":"00c3e428-45e3-4abf-8006-aa6ae9a18da3","resolution":{"observed_at":"2026-08-11T16:57:06.627632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-14T05:39:12.719595Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-11T16:57:06.647447Z","title":"Seed-story: Multimodal long story generation with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.647447Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:310da024aacc63dbdcaf744bf4b35667c53e3e5830d0a36bda939c07aef11118","observation_id":"1c9b2f8d-ec45-4230-8951-73f294e3a390","resolution":{"observed_at":"2026-08-11T16:57:06.647447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.276588Z","title":"Effec- tive whole-body pose estimation with two-stages distillation","venue":null,"work_id":"35817a02-c6e9-4d86-8b99-05773b1e5b3e","year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.656672Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:74be6c670134af5123e9e885522daf7b0045e0eb158d100047404795154573ea","observation_id":"ba5958f9-32c9-448c-8339-8248cb331ac5","resolution":{"observed_at":"2026-08-11T16:57:09.288670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T16:57:06.670118Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.670118Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:1b41ed8ab337eb66ab73d965ebf4198f0578568c0334a2830e5f96904bbce6e7","observation_id":"96e2ee73-1641-4f64-a244-6b4bb204ba61","resolution":{"observed_at":"2026-08-11T16:57:06.670118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19335","last_updated":"2024-05-29T17:59:58Z","snapshot_observed_at":"2026-08-12T23:54:54.762113Z","submitted_at":"2024-05-29T17:59:58Z","title":"X-VILA: Cross-Modality Alignment for Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19335","snapshot_observed_at":"2026-08-11T16:57:06.678270Z","title":"X-vila: Cross-modality alignment for large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.678270Z"},"links":{"cited_paper":"/paper/2405.19335","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:36e1a66f9c390d3f3d3275cf23d18e1b3063c960b55cb1b2b93447efe1d34e3f","observation_id":"4bc95560-121a-4c73-8631-2b8e258f4c55","resolution":{"observed_at":"2026-08-11T16:57:06.678270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-06T04:08:15.266897Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-08-11T16:57:06.685194Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.685194Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:3cd98f65ab66358dfa9f61bdd6d3b70f4e1b84b9ad4265eb4eab60f9976cd972","observation_id":"c727b0cb-7c99-47b2-b93c-2987120b4c66","resolution":{"observed_at":"2026-08-11T16:57:06.685194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-14T13:35:07.349897Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-11T16:57:06.697783Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.697783Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:5f9a49ee4f234b930d3c1163d5c162057f1cfeb958a53394247d0a9bcff51ac9","observation_id":"5b4ec436-78ae-4f69-9a6f-668f022d1bff","resolution":{"observed_at":"2026-08-11T16:57:06.697783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T16:57:06.713700Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.713700Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:805bbcdf272e4b8b9404723e6e46c2490ae034bce4f2a22c60f93b28a43407b9","observation_id":"43e2af3f-6910-4e58-b436-2b6b308b6e5c","resolution":{"observed_at":"2026-08-11T16:57:06.713700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.236060Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"d864cefd-005a-4b64-8002-78519605739b","year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.721779Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:54ee6485495c4fa2d6209d8dd6548ad9f316777087c886b1dea9160fe11c37bf","observation_id":"ca5f6c16-ada8-4ff5-a221-193265025458","resolution":{"observed_at":"2026-08-11T16:57:09.250717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.196270Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"f2b4e409-36c6-4a9f-bf2d-aea0e39da689","year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.730548Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:61ddd4c0b03471a3f6157de34cd14008ac47959d2660c238122402849ef81609","observation_id":"a4504037-b643-4c5e-8e24-f40cf451b5dc","resolution":{"observed_at":"2026-08-11T16:57:09.203355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-08-13T04:15:20.480186Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-11T16:57:06.741831Z","title":"Anygpt: Unified multimodal llm with dis- crete sequence modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.741831Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:826e58cf024a5366819dead14ce991e3e33a99796c625e4c0255887942554e03","observation_id":"ae212811-3589-4a7f-8dc9-b8d64013523e","resolution":{"observed_at":"2026-08-11T16:57:06.741831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.164414Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"01a0a650-d072-4ef2-9237-f938ac251f21","year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.752753Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:f35dbfa762b29489ab36c6e033ec9ff9767e1dc26208eef0a2875495c5f15f17","observation_id":"9ca8dcb7-4c0f-45fd-b97e-9d6e7669307f","resolution":{"observed_at":"2026-08-11T16:57:09.179127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-13T04:13:12.046147Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-11T16:57:06.775315Z","title":"Tinyllava: A framework of small-scale large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.775315Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:a02adbe3bef3f0fcfa0728fe25eb352e4da93ddc886a4058ba71841fa6d41715","observation_id":"0adb6467-9173-4dfc-9e8b-4fa8e873a8c0","resolution":{"observed_at":"2026-08-11T16:57:06.775315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-11T16:57:06.786978Z","title":"Transfusion: Pre- dict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.786978Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:a1bd089a299075634ca39c7d1d198efe61cfb9447990646a05f393c340e70a35","observation_id":"0fd87351-a4e7-4ca9-8008-d1b6529d15d1","resolution":{"observed_at":"2026-08-11T16:57:06.786978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T16:57:06.795666Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.795666Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:9a95a937f5f595220df74559184b52680a1dc0577a348f5259c54024991428cd","observation_id":"4d93e074-3274-4cd9-97fc-75fc5893ee8b","resolution":{"observed_at":"2026-08-11T16:57:06.795666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-14T17:39:36.185216Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-11T16:57:06.802539Z","title":"VL-GPT: A generative pre-trained transformer for vision and language understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.802539Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:81cebd3d2c544b39ebcc9ca2a6b60cc43353fd2365fa3df1433c78457cd9c849","observation_id":"2020f042-2401-46d7-aa31-dfdfa02ce3c7","resolution":{"observed_at":"2026-08-11T16:57:06.802539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:57:09.110346Z","title":"Mipha: A comprehensive overhaul of multimodal assistant with small language models","venue":null,"work_id":"3144f982-126f-4da8-940a-41e637b3de3a","year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.809177Z"},"links":{"citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:16a94f5cd1b948b5699405f4abd4478703cf4e5205a065765851d8d619c6c39a","observation_id":"cc37c1ed-4bb5-499f-82f0-b8bfdaffeef7","resolution":{"observed_at":"2026-08-11T16:57:09.122407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-13T04:48:56.604912Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-11T16:57:06.818547Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.818547Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:c86109dfe289b15a274adcf4a374172bc51c9d2c67fe013b75390c6d27b34ae9","observation_id":"01a51fb4-2b19-467e-95e9-18ad1872f3f2","resolution":{"observed_at":"2026-08-11T16:57:06.818547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T13:23:22.725695Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":75,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":102},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 102 outbound references and 1 inbound Pith citation observation for arXiv:2412.09612."}