{"as_of":"2026-08-11T09:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:118883b0d6521b390c79c42cc14f9559a89f57a9ea4665b107a7bc4e2747830a","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T11:26:29.251213Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:40:53.903009Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T23:00:50.182088Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16688","snapshot_observed_at":"2026-08-07T00:40:53.903009Z","title":"arXiv:2501.16688 [cs.CL] https://arxiv.org/abs/2501.16688","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13055","last_updated":"2025-06-16T02:52:44Z","snapshot_observed_at":"2026-08-09T18:48:47.190095Z","submitted_at":"2025-06-16T02:52:44Z","title":"CFBenchmark-MM: Chinese Financial Assistant Benchmark for Multimodal Large Language Model","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:53.903009Z"},"links":{"cited_paper":"/paper/2501.16688","citing_paper":"/paper/2506.13055"},"observation_digest":"sha256:58860b541b9594faa990b2ab25fffa8e29940ee190f1ec7c2f694fb3f0515fe5","observation_id":"54de9421-cea9-4749-b7f6-ae489d8dfa0a","resolution":{"observed_at":"2026-08-07T00:40:53.903009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"cited_work":{"arxiv_id":"2501.16688","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16688","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MME-industry: A cross-industry multimodal evaluation benchmark","venue":null,"work_id":"05aada78-52de-4be1-a0c6-982dad7615b2","year":2025},"citing_paper":{"arxiv_id":"2604.07413","last_updated":"2026-04-12T03:02:53Z","snapshot_observed_at":"2026-08-11T04:13:59.160710Z","submitted_at":"2026-04-08T12:23:27Z","title":"FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T19:24:23.367540Z"},"links":{"cited_paper":"/paper/2501.16688","citing_paper":"/paper/2604.07413"},"observation_digest":"sha256:cd463e6f8b4d111a264d4df620187e143e8208756a3f116a76f4da89ce1e8c77","observation_id":"e28b1841-9f53-4e79-9ad8-b828921e8db5","resolution":{"observed_at":"2026-05-10T23:00:50.187662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16688/citation-record","integrity":"/paper/2501.16688/integrity","json":"/paper/2501.16688/citation-record.json","paper":"/paper/2501.16688"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T11:26:29.095678Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.095678Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:9441175f8ac6935756c38350b3f4aace46ceb6906ac5a86f88fc2c675cb2935f","observation_id":"56dee464-c6dc-4e45-94ae-38a77f8ab241","resolution":{"observed_at":"2026-08-10T11:26:29.095678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T11:26:29.106417Z","title":"Qwen technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.106417Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:4818a98763206e2f5f3884a4db6e005701b76d52bdcdf9ba60be4ee94df2636c","observation_id":"0ee1f056-df51-40de-a25d-1334ec1bf855","resolution":{"observed_at":"2026-08-10T11:26:29.106417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T11:26:29.111354Z","title":"Qwen-vl: A frontier large vision- language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.111354Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:d4905676d9ec9c4c1b97575c43577dd17b95f51c5eec79dde61fff0eabf6ad61","observation_id":"7541bcbd-747b-4a1e-949a-f766a4eb5ec7","resolution":{"observed_at":"2026-08-10T11:26:29.111354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-10T11:26:29.116371Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.116371Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:190472954e623042c4a7222c75453038d6d43258e453156147dd4e36ce065c20","observation_id":"6a476e83-9698-48be-bf23-0ffde00e9e27","resolution":{"observed_at":"2026-08-10T11:26:29.116371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-10T11:26:29.130502Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and comprehension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.130502Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:fbf9c0fa2f671c6c088532dda6e6e1bb1dcd9a79258c8745b9498da6171f9a88","observation_id":"082f44b9-beeb-4f8b-adc0-9a808a21cd22","resolution":{"observed_at":"2026-08-10T11:26:29.130502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-10T11:26:29.135777Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.135777Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:7762978222ad0483f0eec9efc4a6f00ae6f9a4d14398f2affe6932b8e57cabcb","observation_id":"7b7b239c-115f-466d-b19a-0da33d7cbb05","resolution":{"observed_at":"2026-08-10T11:26:29.135777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.742002Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models,","venue":null,"work_id":"a598cb7d-3e9a-4a0b-9800-cfd70d3b9df6","year":2024},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.140299Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:7c4d1909f0c98cfb17a9028f70ce1d61d1d4745ab35c55b3d756a0fc9d499e45","observation_id":"e58c7726-ab28-4d01-867d-e240faf4511c","resolution":{"observed_at":"2026-08-10T11:26:29.746437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T11:26:29.144676Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.144676Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:78a2d5a2395cc44e55ef611955f54cf17818be4e37e0d7bf8147693956297f44","observation_id":"f59c7468-ccd1-43b9-b979-c4bd9fb569cb","resolution":{"observed_at":"2026-08-10T11:26:29.144676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-10T11:26:29.149135Z","title":"Chatglm: A fam- ily of large language models from glm-130b to glm-4 all tools","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.149135Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:56ebfb09d4f890728846214844fc111ba2a7305b42460218bbfb8124c20d15df","observation_id":"71da6fb4-77e6-47e2-9fa3-fe8291ac4b4e","resolution":{"observed_at":"2026-08-10T11:26:29.149135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T11:26:29.153567Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.153567Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:bceb6898299f136f687a66f8ba00c90b82c50041921a977f1c938f2e5514ac3d","observation_id":"82b174a3-5d82-4411-a330-5a0c2363df82","resolution":{"observed_at":"2026-08-10T11:26:29.153567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.713672Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":"adf78df8-197f-48a4-938c-281b237e853f","year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.161982Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:9cf9858d52e2e3ebeb2b610c082c2b2734b43a0c0859f503bc1bfb3d13e3ec3d","observation_id":"da99e05f-54cd-4157-bac8-f596a5559318","resolution":{"observed_at":"2026-08-10T11:26:29.717602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.700316Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"ec27da9d-fa99-4f74-bbb3-cef3518cc6d2","year":2024},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.165933Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:6f775e51c430d51621cb9775cf0934d5dabc253af6e4e45d1bfb4e655567f25c","observation_id":"a9ae5d96-87d5-4fa8-915e-3fcf61f6979f","resolution":{"observed_at":"2026-08-10T11:26:29.704491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-10T11:26:29.169977Z","title":"Mmbench: Is your multi-modal model an all- around player? arXiv preprint arXiv:2307.06281,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.169977Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:779516699cb1a0778bc862eb6a164cb18bee1f99487a1ccfd4b439818df308a9","observation_id":"945af6d2-102f-47e0-84a2-4a0a090dafa8","resolution":{"observed_at":"2026-08-10T11:26:29.169977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-10T11:26:29.174488Z","title":"On the hidden mystery of ocr in large multi- modal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.174488Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:378d24572ef4e6551f5e95bcd691e95b15fd5d023e2ef0d9ba73b56b417de964","observation_id":"e83c63da-d2a5-43fd-98e7-9449af5fd5e3","resolution":{"observed_at":"2026-08-10T11:26:29.174488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05935","last_updated":"2025-03-21T10:19:01Z","snapshot_observed_at":"2026-08-06T11:32:00.537531Z","submitted_at":"2024-02-08T18:59:48Z","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05935","snapshot_observed_at":"2026-08-10T11:26:29.178954Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.178954Z"},"links":{"cited_paper":"/paper/2402.05935","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:7d90f2522441948b653e7057cf66ab963b8d6aa8fe9bd7ef3e50bdb15f44fb60","observation_id":"7b675fb5-e226-4e93-853a-ee05c37b0b8b","resolution":{"observed_at":"2026-08-10T11:26:29.178954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-10T11:26:29.183284Z","title":"Chartqa: A bench- mark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.183284Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:b5671b705dbe513a3284accbb5ef8c4af29976b38ad200606c61ae4ab2532dca","observation_id":"07d84a8d-8c82-4c1e-9f4e-114d04f26442","resolution":{"observed_at":"2026-08-10T11:26:29.183284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.190299Z","title":"Training language models to follow instruc- tions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.190299Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:7f13229bb4224c36316fdbc11b4fffa27948490cc0456206bf094f47fe49a4ad","observation_id":"40f43e90-910f-4e14-881c-eb6eff3996f9","resolution":{"observed_at":"2026-08-10T11:26:29.190299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.668964Z","title":"Multilayer perceptron (mlp)","venue":null,"work_id":"06fd0d36-24d2-45d3-be10-310b518c31e0","year":2018},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.193733Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:c4898c65fffb02d1bb31dff75988826280a8d9505da6c5e6dcaad1f12136a843","observation_id":"6b632a4b-1418-4641-be56-30d1e43b18a5","resolution":{"observed_at":"2026-08-10T11:26:29.672920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.655911Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities,","venue":null,"work_id":"0ac892e5-dafe-4cff-af39-e6fcf15d1568","year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.201842Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:726805ed17bf8224a11fc0391a07a09bc42366c15fcb19767c748f58e0ae4897","observation_id":"519b8997-851e-41ea-8111-42621960c03b","resolution":{"observed_at":"2026-08-10T11:26:29.659920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T11:26:29.205860Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.205860Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:4dcff6df746a208029e6d22b3148e0b29b3f3970bb32dab27b325470f5878598","observation_id":"38df5ea7-3fb6-450b-ad8c-f086bdfc7e49","resolution":{"observed_at":"2026-08-10T11:26:29.205860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-06T03:52:00.226360Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-10T11:26:29.210443Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.210443Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:e51a344ab1ebf218392d5df40d2a10c74abad4debd698bee9286d887306d244c","observation_id":"e5d65e6f-ce52-4940-894f-d073327309c7","resolution":{"observed_at":"2026-08-10T11:26:29.210443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T11:26:29.215489Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.215489Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:acc506802ea50226e43f28653f240daf63027df573fbb542a20b27add87cae22","observation_id":"50448d07-38c6-45dc-997b-dde94c40c5b2","resolution":{"observed_at":"2026-08-10T11:26:29.215489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-10T11:26:29.219967Z","title":"Baichuan 2: Open large- scale language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.219967Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:419646c7159023f806705881ee3b8d5c67c0da58c3bfb6f29cda206f812c1e93","observation_id":"b88beee7-c818-4108-82b2-687df36d5a08","resolution":{"observed_at":"2026-08-10T11:26:29.219967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-10T11:26:29.224231Z","title":"mplug-owl: Modulariza- tion empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.224231Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:72150553179e8e3cccf9533d8ab5ad906c4b4375d65f981912c9481d7f86fc0c","observation_id":"37d07d4e-13e8-45f8-ab6c-0509483a77fb","resolution":{"observed_at":"2026-08-10T11:26:29.224231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.641549Z","title":"mplug-owl3: Towards long image-sequence under- standing in multi-modal large language models,","venue":null,"work_id":"72e5ead4-d8c0-4dbf-9e51-0d65a8709117","year":2024},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.228675Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:96db758be0e19bfd677c97f0d3347bec61722daa74cfc52f589e80d71b36b27a","observation_id":"3093fe24-26ce-4dd0-8863-13feed24e6dc","resolution":{"observed_at":"2026-08-10T11:26:29.646159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-10T11:26:29.232724Z","title":"Mm-vet: Evaluating large multi- modal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.232724Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:caa448d3fd14c7236ff9a7bdbff0b1c7ee7f3647e078ffd36e119e1035c533fa","observation_id":"0941ea37-996e-46b0-a446-d7a3510215e6","resolution":{"observed_at":"2026-08-10T11:26:29.232724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.624317Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"5cf52900-a7fa-408b-81e5-714e377709e9","year":2024},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.237069Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:234a768ae928e3ac76a1fdb6f93facd5588143bb7fb4502b59106a38c4fb98bc","observation_id":"05f96119-e74e-4678-ae06-f8e452a0beba","resolution":{"observed_at":"2026-08-10T11:26:29.630621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-10T21:32:36.140961Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-10T11:26:29.241357Z","title":"Mm-llms: Recent advances in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.241357Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:c640ed173458ff5941f842a27a9922c629fd2c289952954bd4c4323d89bdfdbe","observation_id":"8e1a6271-5d9e-4084-b77c-f2a4a9a756f8","resolution":{"observed_at":"2026-08-10T11:26:29.241357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-10T11:26:29.246647Z","title":"Mme-realworld: Could your multimodal llm challenge high-resolution real-world scenarios that are difficult for humans? arXiv preprint arXiv:2408.13257,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.246647Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:472a1a9e73b3df33469f8a55680c6a78e4c8a03997bff7ac55b24c4cc44a4a11","observation_id":"4b5ce515-2087-4987-9dc4-0acbe47afee9","resolution":{"observed_at":"2026-08-10T11:26:29.246647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T11:26:29.251213Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.251213Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:6d0fc45b638cbefa3f88174a1b281463d8376d9f6a16689620dc25b1695cbedd","observation_id":"e6d42da3-5a4f-4899-80b3-07d14b2c7270","resolution":{"observed_at":"2026-08-10T11:26:29.251213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T11:26:29.197255Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.197255Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:07aa8b61d4b7d420e526155aac6acf0ac72b81708fe3d35f6d2ea97f2a4ef820","observation_id":"361c4051-056e-45f1-919e-07e7e8cbebaf","resolution":{"observed_at":"2026-08-10T11:26:29.197255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.727534Z","title":"Scaling up visual and vision-language representation learning with noisy text su- pervision","venue":null,"work_id":"0d4c27da-2a14-4951-ab44-40b0fd7d3b44","year":2021},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.157837Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:600d1385f35fe3cc5828c9b7002d54c4dca033347ec8b13b4e381849921b42f6","observation_id":"de929faf-3875-4ebd-bf05-fa60ce8b9334","resolution":{"observed_at":"2026-08-10T11:26:29.732271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.187027Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.187027Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:a6088e6914878567521c6536ee2ab0363ad2a63640e8651f41c7f48f2aeac454","observation_id":"4b5406b8-2c45-4456-89e2-507d466cc627","resolution":{"observed_at":"2026-08-10T11:26:29.187027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-10T11:26:29.101250Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.101250Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:66d29b44df20bd4c49ea3446b7a8530d5d46cee1eea15ce0f6d7c36308c8fb41","observation_id":"9064c011-934f-4443-b298-8b06eea20d22","resolution":{"observed_at":"2026-08-10T11:26:29.101250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.771192Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":"5b479d9b-675c-4ca4-9133-7fb3d68e453c","year":2025},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.121335Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:046812a576fe5ee17c5610498c85962bd8445cc1e62c01d519c948a9f0a6b40a","observation_id":"bfdcad41-56da-4654-9e62-6125effff869","resolution":{"observed_at":"2026-08-10T11:26:29.776399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:26:29.755910Z","title":"Palm: Scaling lan- guage modeling with pathways","venue":null,"work_id":"1de6ea0c-349a-4960-b64b-60b0f6367ea8","year":2023},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.125959Z"},"links":{"citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:3f61c62966c75bc35c0429d7639e9c29256c9f026c73ee356901cbe3c302d223","observation_id":"1a8370a7-1b44-4ba9-80bb-363b55e9d0bd","resolution":{"observed_at":"2026-08-10T11:26:29.761004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 2 inbound Pith citation observations for arXiv:2501.16688."}