{"as_of":"2026-08-14T02:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f2193af1588f344f911e6862d466e0bf7a6c0fd1396d262da1e94735370abbef","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:03:24.836356Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14725/citation-record","integrity":"/paper/2411.14725/integrity","json":"/paper/2411.14725/citation-record.json","paper":"/paper/2411.14725"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T15:03:23.770624Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.770624Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:c5ee3d4979eb99ca2b4646f5afe110aea6fbe16a1f19364c9f1c2e5f8adc9a17","observation_id":"29f63658-53bf-4aba-9f23-ce43457dc585","resolution":{"observed_at":"2026-08-12T15:03:23.770624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-12T23:06:15.847795Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-08-12T15:03:23.786991Z","title":"Al-Tahan, Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.786991Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:071690f538aeecfa9174f98084dc079b44f845a87c4a5cc7512e24d84df2b2cd","observation_id":"17e6553f-9f94-4f44-aac6-1cd611c55cae","resolution":{"observed_at":"2026-08-12T15:03:23.786991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:27.096960Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"1f061e49-33e7-4a4b-a1e3-565c9b57a8ee","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.818926Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:9c7bbf9924b34a0e5be811d3152936c3ff6312dbd31d628ec43948a3c7b7fdcb","observation_id":"4b7f9521-41e0-4bed-bb9c-4d07204918cc","resolution":{"observed_at":"2026-08-12T15:03:27.104020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04667","last_updated":"2025-04-02T15:17:02Z","snapshot_observed_at":"2026-08-14T00:16:56.532983Z","submitted_at":"2024-08-06T16:43:35Z","title":"Non-Determinism of \"Deterministic\" LLM Settings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04667","snapshot_observed_at":"2026-08-12T15:03:23.837472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.837472Z"},"links":{"cited_paper":"/paper/2408.04667","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:8b3b6f37563f2122bebe5fbcb1c8481eb8686b1187ff4d5d2eeaf08c78d0ea6b","observation_id":"4dd63f1c-c7d0-4a21-b8ec-672b916c5bad","resolution":{"observed_at":"2026-08-12T15:03:23.837472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T15:03:23.871962Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.871962Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:f4d05733ac1d861ba6035c7ce34aa09594a34649574ac29729a3ae81db2070a8","observation_id":"010a7473-fc9e-4e04-957e-d292964a54b4","resolution":{"observed_at":"2026-08-12T15:03:23.871962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-12T15:03:23.904276Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.904276Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:3016e0da12455338de87e180c9eebc8caceca2c47d72d6c0938c1f52d91d8bd2","observation_id":"f6e0c276-55a1-40d6-a0cf-39bbb76421d6","resolution":{"observed_at":"2026-08-12T15:03:23.904276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10566","last_updated":"2024-09-13T18:01:49Z","snapshot_observed_at":"2026-08-12T22:45:15.997572Z","submitted_at":"2024-09-13T18:01:49Z","title":"Eureka: Evaluating and Understanding Large Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10566","snapshot_observed_at":"2026-08-12T15:03:23.957999Z","title":"Balachandran, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.957999Z"},"links":{"cited_paper":"/paper/2409.10566","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:ed3a839c8da7e3538a814e2632a5e014b2390dac1a9964e32664551030169032","observation_id":"592d8c6c-0a72-40e8-b66a-d1f9e90797b0","resolution":{"observed_at":"2026-08-12T15:03:23.957999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T15:03:23.965262Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.965262Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:c30aafdd0768420d1783ff8ce8f92b914d867a449aa012373730d4ea62104a74","observation_id":"d75277d9-30a9-4b51-958b-d3ff16e000d1","resolution":{"observed_at":"2026-08-12T15:03:23.965262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-12T15:03:23.972836Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.972836Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:6cd55b3a035d62319515d95e8796a4843eb84b392362cf27712074ed70fbc8c8","observation_id":"9e811f0f-c327-4f70-9912-7d228f702d79","resolution":{"observed_at":"2026-08-12T15:03:23.972836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T15:03:23.978719Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.978719Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:17ddec5c4b0b026c334d96e0850b577da97d99a593e403f89f8bba6d05f5eb70","observation_id":"21a2f1b4-1b4d-4656-9d21-9cc70730fd1e","resolution":{"observed_at":"2026-08-12T15:03:23.978719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-12T22:43:01.323456Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-12T15:03:23.984309Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.984309Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:9dabf60ede33bc130d6a1a2ca01035eb0d4d7f93d22ccb1054617a4eab1e4bfc","observation_id":"f054d048-c168-4083-8c5b-19c9e477b4dd","resolution":{"observed_at":"2026-08-12T15:03:23.984309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T15:03:23.989904Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.989904Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:7e410098a15f77defba17639f05ef8a6940c3d8fe9704db5960a653e8bb09ff4","observation_id":"bd75654c-1b80-4804-bf6f-7f17fc094c34","resolution":{"observed_at":"2026-08-12T15:03:23.989904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-12T15:03:23.995882Z","title":"Hurst, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.995882Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:b5cc80c36c14ddb95a57b3f7871e774f12cfc825ac96dcf25cb2e71937762cd9","observation_id":"142f118c-2802-4fee-89e7-c344e8f7350e","resolution":{"observed_at":"2026-08-12T15:03:23.995882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-13T03:27:01.609831Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-12T15:03:24.002580Z","title":"Ilharco, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.002580Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:058fb1b3d0567a246d959b7389533736da4b4c1a9a78df979d188f74605b79af","observation_id":"8958e039-5a48-4600-8a83-0d73af34ad82","resolution":{"observed_at":"2026-08-12T15:03:24.002580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-13T00:16:01.500475Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-12T15:03:24.010418Z","title":"Jiang, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.010418Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:2ab049583690e579ea252e81ef115b7aec06a535d357ce342207ade9d5c28716","observation_id":"8020696b-2d88-4235-9430-16c73e0b7b33","resolution":{"observed_at":"2026-08-12T15:03:24.010418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:27.050557Z","title":"Kembhavi, M","venue":null,"work_id":"83116e2a-61c4-44f8-a164-99844ee99dfa","year":2016},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.020558Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:89133de607b40b6e96eb8f26acf129dd36d3c527a1b29de35ac62827a4a01ed6","observation_id":"53f61553-04d1-475e-b527-02875aa567fa","resolution":{"observed_at":"2026-08-12T15:03:27.081220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.969735Z","title":null,"venue":null,"work_id":"6db77c7b-1a6a-4fc9-81ee-feed4c9619bd","year":2022},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.025849Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:37f6eee21573458a2e0934e4cca59a31d2a5d125465f4d8d279c6fb2fc044196","observation_id":"e10dfaac-e4cb-4126-8a3a-aac64e9c0850","resolution":{"observed_at":"2026-08-12T15:03:26.981473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.951708Z","title":null,"venue":null,"work_id":"7449b522-23ab-4f6f-a1f4-6fc0f6d81bbf","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.031716Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:b023ab003e79ebf0ec5e8460d923da6593f18db5ebc9d5cd4c33257e7fc620b5","observation_id":"8d2e9f02-2eda-4165-9a63-59487947c66c","resolution":{"observed_at":"2026-08-12T15:03:26.956819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T15:03:24.037367Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.037367Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:c1b3bf6209e761005f227cad0bc6d4f2c0b77d5439887512b37b561eda0a0d48","observation_id":"e8c890f3-d616-4444-b28c-1e4c30500148","resolution":{"observed_at":"2026-08-12T15:03:24.037367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:24.043058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.043058Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:2a1e5909f24da3658c44dc4038b6d20efb273c1aee98ff652ecd9ddc06ac99ac","observation_id":"021cca4d-b97f-457a-94cc-63aa3825ecdc","resolution":{"observed_at":"2026-08-12T15:03:24.043058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.921865Z","title":null,"venue":null,"work_id":"cca3ae8b-57d8-4b23-bc74-e30c31a4969b","year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.061742Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:c1ad155adcb624f872ccef84e7b5d487d39a01071e07ce3f1a06dc87dfacc4ee","observation_id":"6b522d49-fecd-4b49-a8aa-e01599866372","resolution":{"observed_at":"2026-08-12T15:03:26.926888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:24.077979Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.077979Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:88fcd9efe4842ad798002269a7d4bb92fc90f70eee92007aed61ea0a00a437d7","observation_id":"5e19d423-3489-49aa-bfb3-53f14d09e3f6","resolution":{"observed_at":"2026-08-12T15:03:24.077979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:24.105463Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.105463Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:9509c0ed2214e83820d8c34a94c2053115aa547401e97d35dbf229e9b19ee55e","observation_id":"2db77923-8e89-4ab5-b815-4b1b233f7607","resolution":{"observed_at":"2026-08-12T15:03:24.105463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.880552Z","title":null,"venue":null,"work_id":"47e32584-afda-4d64-9a91-279a56cfc757","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.129970Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:7f7187dc3130f7d304a30c5a02dbb50bfff422959e0003f370674039c9b1c978","observation_id":"263e4985-f8a3-42ad-92fc-1f79f61dd4ae","resolution":{"observed_at":"2026-08-12T15:03:26.886416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04828","last_updated":"2024-11-05T02:32:06Z","snapshot_observed_at":"2026-08-12T22:49:27.929514Z","submitted_at":"2024-09-07T13:41:37Z","title":"POINTS: Improving Your Vision-language Model with Affordable Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04828","snapshot_observed_at":"2026-08-12T15:03:24.193907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.193907Z"},"links":{"cited_paper":"/paper/2409.04828","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:40f7a089340be5b0a2f73a04b086249e7acf3712b12f32e38f430b0e8afb3b9e","observation_id":"0edbedc9-203e-4399-ba68-21537ae5f149","resolution":{"observed_at":"2026-08-12T15:03:24.193907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-12T15:03:24.261105Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.261105Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:1fada224e062e7ac3529a8e3cce32eaa5111a5bda9038c0d9450fbd2a334f8a6","observation_id":"347de614-63f3-4d72-a2fb-a01538441053","resolution":{"observed_at":"2026-08-12T15:03:24.261105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-12T23:53:21.822871Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T15:03:24.301248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.301248Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:6a576539ba060b0e8cd06aa97f3cfdd7069462c7f89e1a492fdef6da8c92239e","observation_id":"2599b4e7-255d-4427-bf93-cc868e3785a3","resolution":{"observed_at":"2026-08-12T15:03:24.301248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-12T15:03:24.319323Z","title":"Masry, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.319323Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:4584fa6adad220f0c391e3c36ae1ecf2b123835a9c2e37039aec4aa845540783","observation_id":"0cec2fa3-9d64-4e00-bbf2-9a0d6e90c994","resolution":{"observed_at":"2026-08-12T15:03:24.319323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.862867Z","title":"Mathew, D","venue":null,"work_id":"59656e46-091e-4919-83f0-2b00e223135b","year":2021},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.324376Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:94456ac1637a0b6ea78ae3073815d36aa8a4eca58b4f607770d4568d1f7be52b","observation_id":"b7f4f425-487d-4f19-9e97-541f6085ab88","resolution":{"observed_at":"2026-08-12T15:03:26.868949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13826","last_updated":"2024-10-24T17:27:22Z","snapshot_observed_at":"2026-08-12T22:20:40.943270Z","submitted_at":"2024-10-17T17:51:40Z","title":"Unearthing Skill-Level Insights for Understanding Trade-Offs of Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13826","snapshot_observed_at":"2026-08-12T15:03:24.329453Z","title":"Moayeri, V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.329453Z"},"links":{"cited_paper":"/paper/2410.13826","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:74cf4635e06e05a4a7c468146ee0b2f105bd0346d64c7543e90d8fbd365409f3","observation_id":"bc9917e4-889c-470f-abda-c12dc38b9e3c","resolution":{"observed_at":"2026-08-12T15:03:24.329453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.841086Z","title":"Gptv system card, 2024","venue":null,"work_id":"ffc322d3-ecc6-41f6-bebe-631a7fd16b39","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.340481Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:b7223f61e33d9cd1b0989319a307b5b0c23cc866d8425cd0929467988d8f32ad","observation_id":"68d6272c-3291-41b4-a9df-6fe3b227fcde","resolution":{"observed_at":"2026-08-12T15:03:26.847137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T15:03:24.345745Z","title":"Oquab, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.345745Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:b10071cedbcaaca99bc06a4e64659bd5a8d8b3dcedcee7777ee2daad674d4ba2","observation_id":"0765cc2b-5eb3-474d-a2d0-b26d576bdb56","resolution":{"observed_at":"2026-08-12T15:03:24.345745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:24.351317Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.351317Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:0b4e728c35e2a460d32fdc7c513e0d23dc0c899761994ac84a6ce29404a704c9","observation_id":"1bc1e516-d884-49a6-a17c-5ee536a18e6c","resolution":{"observed_at":"2026-08-12T15:03:24.351317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:24.356784Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.356784Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:2440cb18021773d5b6fc6e5e04d2020256bb444f84f37d61f2af6c171c085979","observation_id":"e991f5d8-d7e9-4a40-9872-834a9dc98c8d","resolution":{"observed_at":"2026-08-12T15:03:24.356784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T15:03:24.362312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.362312Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:dad481fbafeb8d8b17b5924185c6e28c1ef16829988ec9bc2e6bd456c6e4902e","observation_id":"ceee076c-99d7-4175-8225-be5f4adbde4a","resolution":{"observed_at":"2026-08-12T15:03:24.362312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T15:03:24.367607Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.367607Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:61ed8938161ae7e2ddd0ca17c8cbae72526740e97f9a35be1892b2d21b29c1fc","observation_id":"caf8f6ce-7441-477c-8a97-eac1e07e505c","resolution":{"observed_at":"2026-08-12T15:03:24.367607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-13T19:11:36.872460Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-12T15:03:24.373327Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.373327Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:9873a6eeb5f8d33de96de44813cebaa4b3dd7780414e2214761ebafa629fa847","observation_id":"00d683b2-4ffb-4c06-b471-c4b5326f1ec2","resolution":{"observed_at":"2026-08-12T15:03:24.373327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T15:03:24.378871Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.378871Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:80c8faba7dad28b35173cf63a5dea473f4a5243e43c94df918a345992973ef93","observation_id":"a72697f6-6066-407f-bd7f-d8b07573fb79","resolution":{"observed_at":"2026-08-12T15:03:24.378871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13803","last_updated":"2024-03-20T17:59:16Z","snapshot_observed_at":"2026-08-13T12:06:30.562957Z","submitted_at":"2024-03-20T17:59:16Z","title":"Bounding Box Stability against Feature Dropout Reflects Detector Generalization across Environments","version":1},"cited_work":{"arxiv_id":"2403.13803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.13803","snapshot_observed_at":"2026-08-12T15:03:25.002289Z","title":"Bounding Box Stability against Feature Dropout Reflects Detector Generalization across Environments","venue":"cs.CV","work_id":"9e9120e4-cbb7-4626-9ec6-173b5e7c3f6d","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.384210Z"},"links":{"cited_paper":"/paper/2403.13803","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:6f9183f4c17112caf89dd93523ac83d67d17d00a5ac1cfe407ce768629d0438f","observation_id":"224732bf-b199-4101-8915-c6a23b8bba40","resolution":{"observed_at":"2026-08-12T15:03:25.023717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T15:03:24.389774Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.389774Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:148c9af78329aff958978efa5dcfca4b0d4c70f7a4dba553657fafacfb40cdff","observation_id":"1c421364-0ecb-4800-aa2c-120399cb8363","resolution":{"observed_at":"2026-08-12T15:03:24.389774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.629603Z","title":null,"venue":null,"work_id":"5e2b98da-6e6b-49e4-ab71-2c70e659fd74","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.395596Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:16844786e149aea386ea71e415ce7f34a914118d59aaffb914352e59bbafe25a","observation_id":"4a1c64b2-93a3-4586-846b-58f0c01c7b66","resolution":{"observed_at":"2026-08-12T15:03:26.679958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.611483Z","title":null,"venue":null,"work_id":"e99b1aa7-fc08-4163-ae15-98cd7bec4fbf","year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.415999Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:ca000b7988569bc28d97f54f3a4ffd48f6b6c3f1e2123196c96bb23fef702fd2","observation_id":"61c2b739-a403-4914-a3cd-718564c4f772","resolution":{"observed_at":"2026-08-12T15:03:26.618098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-12T15:03:24.449765Z","title":"Zhang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.449765Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:9f1f962d49c37809d75f2d537710d817e022e3ac421492e0944a92920a836202","observation_id":"624ae08f-463a-4c14-b7e6-c1c29655e177","resolution":{"observed_at":"2026-08-12T15:03:24.449765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14156","last_updated":"2024-10-06T09:51:25Z","snapshot_observed_at":"2026-08-13T00:01:00.777873Z","submitted_at":"2024-05-23T04:08:23Z","title":"Unveiling the Tapestry of Consistency in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14156","snapshot_observed_at":"2026-08-12T15:03:24.493884Z","title":"Zhang, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.493884Z"},"links":{"cited_paper":"/paper/2405.14156","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:d84e4ed712d40bcdc2e734896c772db06ef2c8be8923d584f0c1766d83773dce","observation_id":"07c16031-c15b-45eb-8a98-14b19ba41a23","resolution":{"observed_at":"2026-08-12T15:03:24.493884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12742","last_updated":"2024-06-18T16:02:18Z","snapshot_observed_at":"2026-08-12T23:39:56.903028Z","submitted_at":"2024-06-18T16:02:18Z","title":"Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12742","snapshot_observed_at":"2026-08-12T15:03:24.558647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.558647Z"},"links":{"cited_paper":"/paper/2406.12742","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:9630131af070dab40e615e6a808e860f5f5f4c6228e5d9b4ef1f523d77642115","observation_id":"d1ca39bc-2e83-4c11-a2d1-f441b52e5a69","resolution":{"observed_at":"2026-08-12T15:03:24.558647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.583014Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"2fee7b8c-ab61-4195-8d36-2ae9aece5548","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.636112Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:4b2eb0d66f737392fd20a2b5afed26bff4af52affa2ec6a792a221e21556cc4b","observation_id":"45ff90b9-7d09-4f1d-8fd9-6c536de9e14b","resolution":{"observed_at":"2026-08-12T15:03:26.598812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.415575Z","title":"Limitations","venue":null,"work_id":"b83bcf2b-6054-4c90-b50b-d141bf7c548c","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.658335Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:da42d76077d86ae559710ec7f944457f9dcccfcc5c80b90609e8fc589492b85e","observation_id":"f7916f18-88b2-4c1a-bc82-43740aec36d6","resolution":{"observed_at":"2026-08-12T15:03:26.526008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.397370Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"dea0acc6-887b-4b11-9947-195b40a4bf7e","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.684847Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:531077c09827b3016079d24a62dc9063ff4675727f78e414b3ca516fe0e9c1e6","observation_id":"e12fbe19-6997-4f7d-909e-b17297f5c9cf","resolution":{"observed_at":"2026-08-12T15:03:26.402925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.380039Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"7a3ed61c-0a39-4b39-b127-67387477e496","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.703238Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:459f0f17d3217e7c5af1c19452c0b02c88df8f72ec25586ad24331d8d4f8898f","observation_id":"20bebfd8-650d-49d4-ac7d-ae17e22fbe7f","resolution":{"observed_at":"2026-08-12T15:03:26.384883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.361068Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"6f0b0a51-dc2a-48ca-a753-3306a4b0b28f","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.722927Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:59743688c717be941496c6d98e8f6efb1073118b3c160bca2d88f935e5ed485e","observation_id":"64bf1c8a-3c2f-4701-b9c2-65e916ba274a","resolution":{"observed_at":"2026-08-12T15:03:26.367041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.319360Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"9b8e02cd-910d-4c8d-a48e-3e5676637004","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.742266Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:92f4177647bc3d3883eacc074c88af43baa0e7d6839120697a86ea380b3ebc72","observation_id":"f41e0017-36f1-4589-a6d3-7c23cf26867a","resolution":{"observed_at":"2026-08-12T15:03:26.347802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.146775Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"ffa7fd4c-b0e5-4163-9299-0b5ba16f537b","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.774916Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:3c8f48f1fac7654603b7860168bcb2244f493835df378798d3711dde64c52643","observation_id":"d627cf61-1a2a-44b5-b3d9-84ef68722d59","resolution":{"observed_at":"2026-08-12T15:03:26.201497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.124651Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"5b5ea299-0d00-496c-a97c-63bebee7a2ca","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.781282Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:24d6a2ec0044e306cd182e324f1f6e7991cd189e8aff12425edf85c3ba51fee6","observation_id":"908586c6-847a-490b-974e-25670ae78301","resolution":{"observed_at":"2026-08-12T15:03:26.130394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.054828Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"c3ffb7c9-0d12-4819-8546-cdda0b8aad35","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.788121Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:3c04631b68be283abf0c6a9552260c9691923b9da2852674067bb349e03d8b9a","observation_id":"d8408868-447e-4c1e-9f17-52ab8c050c08","resolution":{"observed_at":"2026-08-12T15:03:26.104548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.918994Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"9db4827a-2562-4dfa-968c-961f1ef23fc9","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.793680Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:3c0fd74ddf478735134c1cf065adce4fdc1f73703560b1214688d07473e57c1d","observation_id":"359ef756-7ca3-479b-b8e2-0173901c1f08","resolution":{"observed_at":"2026-08-12T15:03:25.979567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.872632Z","title":"Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":"749b2a76-1f67-4ae6-a3a6-76f825799de5","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.800239Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:4107a73a32f37750e03dd875364752b641fdd366eaf7c564a8ef1c9d775605d1","observation_id":"9b67f61e-c732-45a4-8ca9-4e1c04f7cc21","resolution":{"observed_at":"2026-08-12T15:03:25.879257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.849354Z","title":"We will elaborate on it on the Appendix","venue":null,"work_id":"913a471d-c491-42df-93eb-c0cb526d650b","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.806116Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:a34eae26f0118a1777f573c7249a270e998fe3fb8d8021a029d9abb90d540a1f","observation_id":"203b5458-eb86-4803-895f-f06ba7791d03","resolution":{"observed_at":"2026-08-12T15:03:25.856187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.818183Z","title":"Guidelines: • The answer NA means that the paper does not release new assets","venue":null,"work_id":"78a0ff5e-1062-4653-861c-78763040f6b3","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.812627Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:ead26cff23192d34181dbcbc7653645725da4b2b213fc729b59db0c0f465882c","observation_id":"a65abba1-5764-4268-b798-b0d52d976d09","resolution":{"observed_at":"2026-08-12T15:03:25.835417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.712072Z","title":null,"venue":null,"work_id":"01b6f1dc-257d-4826-9db4-4f4fb68d0d49","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.821604Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:b25a43166351d2f2240b36b52326bf3215c192ec08906a4dbca8110db6f1c7d2","observation_id":"f4685861-48c2-48e5-87dd-eb3e2c22db39","resolution":{"observed_at":"2026-08-12T15:03:25.780005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.660577Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"75c1e137-efdb-4050-8c8f-666badf0ecf0","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.829140Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:ac649e6262686cea94621fd39504bf7aa2373c7242ecb0581450606f0c2bfb23","observation_id":"634334d2-a7d1-4e3d-9c9c-61e4764e8d8b","resolution":{"observed_at":"2026-08-12T15:03:25.665905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.641764Z","title":"Answer: [NA] Justification: We use LLM for paper writing","venue":null,"work_id":"df38fa9e-aa85-4e7b-9aa5-5c6ac52aa2fb","year":2025},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.836356Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:2332fc84d1dd7ea2599e708805cc09e84147d4c7064a8fc0233c5616a43b1639","observation_id":"b6332e21-180d-40d5-93e2-f7353a5f43ba","resolution":{"observed_at":"2026-08-12T15:03:25.647440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T22:04:02.184750Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2411.14725."}