Pith. sign in

Paper Citation Record · LEDGER

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models

As of 20 August 2026, this Paper Citation Record lists 100 of 205 outbound references and 2 inbound Pith citation observations for arXiv:2506.12958.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.12958 v2

Coverage vector

measured 100 of 205 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T00:39:42.008599Z

measured 102 of 102 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-04T00:30:00.449270Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T00:39:16.515159Z

Reference resolution

100 of 205 outbound references displayed

  • verified exact3
  • verified fuzzy0
  • unresolved96
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 22e77fb1-afc9-447b-ad28-c2aa00bf703f · outbound

This paper cites GPT-4 Technical Report.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.615536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.615536Z digest=sha256:9381d9b73f63e1b32b7f957b3320bf658aab5cab0803d2f6a4192769fb934082

Observation 2a72d66f-913d-4913-b4fd-347fd990f34d · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.620839Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.620839Z digest=sha256:52f475c85d7e4707e004b213038b76b2920ecbaa8d921213b07114898e2f48e1

Observation fc12aaa7-ac0a-4015-9df2-edbde6fc0274 · outbound

This paper cites On the Opportunities and Risks of Foundation Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models On the Opportunities and Risks of Foundation Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.625249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.625249Z digest=sha256:f99e1bb2638cac5632b87b2901f3588c208bd76d3b389c38ba42df177b51a455

Observation 2713e6d7-e1c5-4ab0-8c91-1be92280ff06 · outbound

This paper cites The Llama 3 Herd of Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models The Llama 3 Herd of Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.629791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.629791Z digest=sha256:c572c5dde686a3d45a52f71167b3521908a128283632e2dbd6b6a294fc26a222

Observation dab422af-0405-4654-a183-5bb34a8b6071 · outbound

This paper cites Phi-4 Technical Report.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Phi-4 Technical Report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.634680Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.634680Z digest=sha256:68109b6462a89a8355e585b07935b2cd1ad90a1ccc741123c1be1b121c2e8aed

Observation 2d5ec7c9-4c18-4cc9-ac07-9ff8ff0158c0 · outbound

This paper cites Islam, A.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Islam, A

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.638742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.638742Z digest=sha256:f4a30cc8f46cd686cedba1cb5c454783a5106d077b5f162190c95e577a3431c8

Observation 2e1fe199-bb2d-41af-97c4-c0f839cd60d5 · outbound

This paper cites Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.642717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.642717Z digest=sha256:6f7ed2a23f68de4d534a8fb0dd2ea23193bf045cf08cc5b63d65d218b809a4a2

Observation 12671620-04e8-46cb-b642-1c477a68f677 · outbound

This paper cites MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.647061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.647061Z digest=sha256:7d45029f0cc616908a72d8b14d7bb61a582278aeb2fa6f829ee4fdbf9e6cbbe4

Observation 896f59b5-69ca-47b5-a9eb-80e6d851d4c7 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.651400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.651400Z digest=sha256:aa13b6a0b52b06742dae93cf9f20d3543a87fd21a395ce74ebdec0122f5fa294

Observation e5c6c6a6-9ccf-49b2-9f0d-8b1301c63d1e · outbound

This paper cites Kernan Freire, C.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Kernan Freire, C

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.655386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.655386Z digest=sha256:7b81319648041eed958108cfe289d3e188190ef6601e023763148ca3cb6ac85a

Observation dd1fd5f1-5b1b-4920-ae13-1bda3c35e56d · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.659215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.659215Z digest=sha256:32b7d7c962e1f66a725264e2bfc927a6c171353290307eaae607090b0b9ac1f7

Observation 73e3fb07-81fa-4fd3-b35a-81b054ecfbed · outbound

This paper cites FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.663250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.663250Z digest=sha256:b1bdec904994e491f961d5e59428a79b20e6dc5ca22bbe68b958725e27e96c13

Observation 9fdfcfdb-258b-47a6-8e08-62b3f0b30309 · outbound

This paper cites Fakih, R.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Fakih, R

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.667570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.667570Z digest=sha256:7ddcad95eec5ab81be7fd57aa3a17044ffb587b1652e5979208be5663d3ee29d

Observation 25ca9dca-1ffa-4aff-809b-27353d0b0d36 · outbound

This paper cites Tizaoui, R.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Tizaoui, R

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.671793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.671793Z digest=sha256:35344c7e47f8ef4bfbf493884a060a030051c5526b2360e8a13e6146cd91a69a

Observation 5a0e13cb-75f2-42cd-bfc2-6b2335e1a9d8 · outbound

This paper cites Incorporating Large Language Models into Production Systems for Enhanced Task Automation and Flexibility.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Incorporating Large Language Models into Production Systems for Enhanced Task Automation and Flexibility

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.676164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.676164Z digest=sha256:92a92a467487e2b69032f6dcea7fd53f97f6233a9daf37bd5298aa1b89ba95b6

Observation 05d52643-c9e0-42da-b3e9-9c86aff446f2 · outbound

This paper cites Ogundare, S.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Ogundare, S

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.679893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.679893Z digest=sha256:18993d3d772cddd968179914de0089870e596e06dd48e58b254189f1b85a6c09

Observation b9dafaaa-0960-46f5-9b17-3d146a08ea74 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.683409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.683409Z digest=sha256:8dea5e6c628c4f1ef8998dca67811c61a805b29be901e16840a4e4d326da1b87

Observation 7cb939d5-6d1e-4d3a-af26-a83d0ec9f842 · outbound

This paper cites Large Language Models for Supply Chain Optimization.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Large Language Models for Supply Chain Optimization

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.686873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.686873Z digest=sha256:7814df4717d8a40c24c18edd600df5e2aa6c192f50c96d7a7d46e3c01cb6b603

Observation 63640395-7108-44df-8b52-f090b168807f · outbound

This paper cites Raman, A.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Raman, A

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.690624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.690624Z digest=sha256:368ba11c74372e3d0c4c7311882ace62afb917d58891aea4ee65bedb36a66b84

Observation b424281b-a063-4232-949d-841fb688cb6f · outbound

This paper cites Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.693989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.693989Z digest=sha256:725daea0b61ed44aeb8ff9783b3539139b850f2be733fb3fd25eee4a6b142ca9

Observation 0c13e9a4-b54e-4bbd-97a8-2a3e11e63f50 · outbound

This paper cites bench authors, Beyond the imitation game: Quantify- ing and extrapolating the capabilities of language models, Transactions on Machine Learning Research (2023).

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models bench authors, Beyond the imitation game: Quantify- ing and extrapolating the capabilities of language models, Transactions on Machine Learning Research (2023)

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.697905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.697905Z digest=sha256:6a370d1f3a0557c795457d8e2b5cb01b69ce78d833bb97d6ba1092a75eee751d

Observation 47aa9c45-576d-4b16-8f9c-02610589c765 · outbound

This paper cites Tracking the Moving Target: A Framework for Continuous Evaluation of LLM Test Generation in Industry.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Tracking the Moving Target: A Framework for Continuous Evaluation of LLM Test Generation in Industry

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.701052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.701052Z digest=sha256:e43400024be32ff90e39339b52e20b2db81429cd785ca024131792e5bd24363c

Observation 45969fe8-4c72-4500-9457-8a31e174c01a · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.705145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.705145Z digest=sha256:c7bea79eb8160b31c2a9174b23c3ef6e37081a47819c5e1e945ebfd839dfce50

Observation 7b743598-c7ce-4dea-8175-0ada8e673ef5 · outbound

This paper cites A Survey on Large Language Models for Software Engineering.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models A Survey on Large Language Models for Software Engineering

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.708804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.708804Z digest=sha256:dbc1e025c7a44296ec551534e814f9051098bcaad08798e1c3b3935532c6e1b4

Observation cc39fc4f-2268-4700-b4e3-773a03027744 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.713136Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.713136Z digest=sha256:557a519c6079b90a17d9479eafc4cc21ed4bdcc5363bd9ec462686d2fca04e81

Observation 7ee961ce-1b53-4b12-a41e-1fa960769104 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.717289Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.717289Z digest=sha256:7b0a94079505d4fd0a2a083e6faea1401148bd51ca193a147047f6687c83bb43

Observation d35071e2-6a71-4045-afaa-bd7f04821575 · outbound

This paper cites Do Large Language Model Benchmarks Test Reliability?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Do Large Language Model Benchmarks Test Reliability?

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.721221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.721221Z digest=sha256:0606b388023340822aedda819ba03dd1b87849e8d722724ace579e851b51b408

Observation 17853490-1b3d-4947-a2fe-55801a832645 · outbound

This paper cites Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.725446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.725446Z digest=sha256:27a76699cb7839803b32e1860c33a473eb86ece9133c01e54a8c34ee3bf8d373

Observation bb7f8507-1658-4704-845c-110ed6a0b86d · outbound

This paper cites TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.729658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.729658Z digest=sha256:b5abc781c547783c50972e9e389998e3040008dd5b1a54791de6b1f6dbbde80f

Observation 17eb8b0d-4c3d-43df-a02b-1b633efb8d05 · outbound

This paper cites Xiong, F.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Xiong, F

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.733804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.733804Z digest=sha256:3c32d70b14c92f5c0ba51811a2467b6de40fc06cbb572981e59db6ddfe4a7833

Observation 6d95f1cf-d097-4862-953f-7717116ca134 · outbound

This paper cites Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.737914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.737914Z digest=sha256:a551be44b3abb882f07824026cd13ee1489dab49ec1e1e02a7b869c7d219e15a

Observation eeca5cda-ba16-4d8f-a648-34cd90fe1baf · outbound

This paper cites STBench: Assessing the Ability of Large Language Models in Spatio-Temporal Analysis.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models STBench: Assessing the Ability of Large Language Models in Spatio-Temporal Analysis

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.742261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.742261Z digest=sha256:fbbdaaabfecada4194fc9aefd4d77351264df4c27fb9cfe10d4e103f9b419151

Observation 5b9f2c1f-ef36-4b4d-b51d-6a480b1277d6 · outbound

This paper cites Sapkota, R.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Sapkota, R

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.746251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.746251Z digest=sha256:52a98a7f0d1459bbaa997a4b6691ec8de588159efdbe1103bc2eb777fc9b10c4

Observation cf07693c-673d-4c7d-b64e-d7774d47fbc0 · outbound

This paper cites GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.749497Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.749497Z digest=sha256:095275edc4aad1678678b53c9d8b40c8e21444beea8a405ef797b5c3d39bee3f

Observation 015b86be-6aba-4bcd-b163-d57f470b86b4 · outbound

This paper cites Roberts, T.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Roberts, T

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.753415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.753415Z digest=sha256:63f2f5a143847ffa9783f3ba6799921ed8192e7291fcc29b8ab16b6a88df1fdb

Observation 34c328bb-c4b8-44cc-a63f-6325c4738d5e · outbound

This paper cites RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.756940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.756940Z digest=sha256:a8cf11f021e5531957b9db040fc8a3ac6ac9be1e0f19d7167f7257795069f57d

Observation 0ae8ff29-4cde-422d-9dc3-fd203fb620dc · outbound

This paper cites INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.760849Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.760849Z digest=sha256:bb78583967c4b4dbcb03314161bebbbc2e827da9a828efa866760f2699d90712

Observation fd27debd-ccab-4ec9-92b2-ad2e80910fd5 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Measuring Massive Multitask Language Understanding

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.765231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.765231Z digest=sha256:edf57cbdf40fb200b63924f6641443f142aaa2b9a58017cd31a64816ee6909a8

Observation ac4b8cd4-8a23-424e-9d88-6719ffc816ec · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.769927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.769927Z digest=sha256:1caeb2bdf13ade61ffc4348166b9aa50c6164bb8ff6b1aa04deeb3ad70989977

Observation bfc5a169-50ce-4d1c-a3ec-7ea13cd751fe · outbound

This paper cites IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.773291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.773291Z digest=sha256:35f6722c575bbc19abfdff8cefc70aadda69dea5728132248551cb27e347a870

Observation baa06e3f-ace0-4e5d-a9bd-4ce2120fd3b3 · outbound

This paper cites VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.777416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.777416Z digest=sha256:b228a7a9437e40b92bb6abf99602854eca451c48eb01d161daba1bfdd82382da

Observation b036bad6-e0c1-4035-8597-db4a9a169700 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.781930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.781930Z digest=sha256:580b89244de0068032bd7032f5a9e0c23d141ac9da9e2bfad3618fa99cfbf722

Observation 662fbc80-6ba8-4a53-b9e9-fa7625348af0 · outbound

This paper cites Anand, J.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Anand, J

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.786215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.786215Z digest=sha256:2b1f07cb4f98f7f3a2e98a1511fb6259f53a099134522e06cfde3f877cfe9f3b

Observation 459e5491-99e7-4447-84c4-e24d25bb03ee · outbound

This paper cites Are large language models superhuman chemists?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Are large language models superhuman chemists?

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.790176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.790176Z digest=sha256:afc1c777e5509400e0c323628b3ce176b402816912ca3a54aa3b96eef03ea536

Observation 76e129ff-fae7-4056-b42c-d2b49e42a482 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.793728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.793728Z digest=sha256:2dcdef52c9179c24bdfaaab0a3ba3b41c764299c8e8616c9309c8e861da890b7

Observation 163d8c6b-3890-4bb6-996f-6c7ca2aeb36c · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.797220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.797220Z digest=sha256:b5dfd7c61187fd2a642fa74cbad6dc85c044cce6f40291c70a503be38939ef79

Observation 0575fa89-83cc-4a9d-93c6-9b3f9879ba57 · outbound

This paper cites LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.800506Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.800506Z digest=sha256:e696b94a44f5ed11ffd15cd6e6cf5d11552bd5b46ffb9479de8e1ad33d256ae9

Observation 2f3217dd-187c-45ef-a60f-244cc6f64d7f · outbound

This paper cites MaScQA: A Question Answering Dataset for Investigating Materials Science Knowledge of Large Language Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models MaScQA: A Question Answering Dataset for Investigating Materials Science Knowledge of Large Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.803960Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.803960Z digest=sha256:7edf4f4e35fdbc64befa829d7f4328944a049d47a68d04bc580a200a8060308e

Observation 876bb9b6-fd8a-4277-b1b4-f02d497effad · outbound

This paper cites LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.808360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.808360Z digest=sha256:af381e42a1b86e3aa2928d33479c01ea3d8bf82cc8bb83edf80da0e9d065cb94

Observation 406b8ac6-39e1-4b40-b5df-853c56e65809 · outbound

This paper cites PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.812250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.812250Z digest=sha256:1484f839cc66a04b0e1d570c31ea3e9b24eb5822e60f36b194fc63743d5e2f45

Observation d6541dfb-3b14-4440-bd58-ac9be06d78d7 · outbound

This paper cites DrugLLM: Open Large Language Model for Few-shot Molecule Generation.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models DrugLLM: Open Large Language Model for Few-shot Molecule Generation

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.816638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.816638Z digest=sha256:8857bc2f28310c86fbe620eb80adb336115cbb75344908969ce1452369f92788

Observation 3eb95384-25ce-4589-b119-8b09891e2168 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.820824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.820824Z digest=sha256:8fbeb28892c3c433df30835f0cb8e295e6163eacac0333c48fb1bcb550f8dc57

Observation 415390c2-1227-465c-a149-c8999ed55dd9 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.824182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.824182Z digest=sha256:57539fae2b83e8e2078e095ba796e48928949b9e3c8a79ba1b4950b8f8f38fad

Observation 93e70b19-314a-48b5-acf5-924ffa0a41da · outbound

This paper cites WeatherQA: Can Multimodal Language Models Reason about Severe Weather?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models WeatherQA: Can Multimodal Language Models Reason about Severe Weather?

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.827755Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.827755Z digest=sha256:724df27b2846ff5111831bf75e6dc5884ee9a8365964db3104e62209addb7f4d

Observation 41ddf636-1a72-4f42-96eb-c37e8d8960f4 · outbound

This paper cites CLLMate: A Multimodal Benchmark for Weather and Climate Events Forecasting.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models CLLMate: A Multimodal Benchmark for Weather and Climate Events Forecasting

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.831109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.831109Z digest=sha256:52fa592d5522a7d794a2ad0faf5b163c9221c88bce1a028c7ebc3e19000bc117

Observation 486c1bb9-f746-4797-84f8-7a75078d10f1 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.834875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.834875Z digest=sha256:1ea5eaccdf7bb1ae9dca22b2d875607eb4df8f0f00036db75b321ceb33317291

Observation 3f31b45e-c978-44a9-b2c7-21cf96fea40b · outbound

This paper cites DisasterQA: A Benchmark for Assessing the performance of LLMs in Disaster Response.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models DisasterQA: A Benchmark for Assessing the performance of LLMs in Disaster Response

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.838053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.838053Z digest=sha256:743bc5da28bb7bd99a660bef824d5226d76f8453dbb21ddbeb2e03d05bf44468

Observation 2cc6b699-4760-4877-b558-46206ff6317c · outbound

This paper cites VayuBuddy: an LLM-Powered Chatbot to Democratize Air Quality Insights.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models VayuBuddy: an LLM-Powered Chatbot to Democratize Air Quality Insights

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.842241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.842241Z digest=sha256:81e72b8d1de37e49b2a9c338d33b1b8ee958cf635eb53fa2b7b34df344fc6f94

Observation 6c9f8696-69cb-47b7-a1e1-b90cfe7cac76 · outbound

This paper cites Pafilis, S.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Pafilis, S

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.845914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.845914Z digest=sha256:ac56d32db0668a4c253319a507c595f7decb2a556716dfb7eab6028477ab043c

Observation 9eb06b2f-9f5f-4d75-85f6-9c591c69a61d · outbound

This paper cites Abdelmageed, F.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Abdelmageed, F

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.849964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.849964Z digest=sha256:da9bee73a2b30a1f65ee85dad9460d53d2b21ab83b148878bb9e4b29bf3fe94d

Observation 8b5a2ea4-e28b-4999-bdba-2db041a08b62 · outbound

This paper cites Are We Done with MMLU?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Are We Done with MMLU?

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.854056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.854056Z digest=sha256:97cb37c968e32ae94fdb6f5a2cfbf54ae0799adfdc45e48b2ce8c8a6478f932c

Observation 2152909a-75c5-43c6-a38a-7605a0e9bed3 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.858056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.858056Z digest=sha256:1a5991ac39d7465da59e06d83542ef72795a51dd82316b1a068da8b1a80fd008

Observation 69fbe33a-b4be-4c9f-805d-4e5daa08b57d · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.862211Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.862211Z digest=sha256:5addf55fb2e1fe0f60cdf5b746230147925067894cd1e63bd63a33f96e6ee157

Observation dcd02d8a-d1de-4d28-aacf-f6280cf63d25 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.866695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.866695Z digest=sha256:b93e2224875f0273e7623c93d515fe3399fbdbd1ecde0a0d36e51eca98f1bf12

Observation 8df08264-9de2-4a25-9421-78599b826a8a · outbound

This paper cites Edwards, C.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Edwards, C

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.871055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.871055Z digest=sha256:6316290911ae191485d8466c215fda52bf946d24e641d12eee6a8f04b821c24a

Observation c85c5585-2d02-4e62-83a8-08718fe9be40 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.874459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.874459Z digest=sha256:9ff418ac71869900d3f4960013f9ad511f7df8e3cd539dcbe4e5365755805ff0

Observation 29ea0a6b-e898-411e-ad3f-02daf9765111 · outbound

This paper cites Davies, M.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Davies, M

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.877742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.877742Z digest=sha256:ad7b31ce174dc517963656c6c6d5e27170b6e610270c068a9b3d2b190eb6cf6f

Observation d09c6ae9-ac48-4e4e-a5fc-94a52fb674a1 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.881368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.881368Z digest=sha256:e9c8bdb599a8d9af8c7a59e8dd57f7dc45ce196da2d44060e3249160064bf2ea

Observation f36fd6d9-a808-4022-af84-409d5deabdbc · outbound

This paper cites ClimateLLM: Efficient Weather Forecasting via Frequency-Aware Large Language Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models ClimateLLM: Efficient Weather Forecasting via Frequency-Aware Large Language Models

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.885548Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.885548Z digest=sha256:c17281e083ed9c732b048116cba8deb2c94e57c884ad0fa262184a2820ac6da7

Observation fcbc7896-1894-40fe-b9dd-46279ab48d66 · outbound

This paper cites Sachdeva, N.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Sachdeva, N

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.889997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.889997Z digest=sha256:bc728c9b4f82f19fbb49847b3b0efca1ed8b8abeca54229c0fa715454ac18d6c

Observation 583c3fae-d05a-4577-b23f-b0ebfb43c860 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.893920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.893920Z digest=sha256:7dc3a59a3c28f1227e5ce27d0652b2b491e712f2e91854a5d71da50082e2793d

Observation 87d2ce94-80e9-4f9f-84f4-36e3d86f93aa · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.898305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.898305Z digest=sha256:b463a5de556f345d5f10338b16dd3175cdb49ef126b1c618458db64ddf79f541

Observation 10caa8a0-72a9-4ec0-98a5-e370804464e0 · outbound

This paper cites Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.902404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.902404Z digest=sha256:a31d4cd43e840884460f2f29018b2cdd88fa06a71a5c07644da1a244c012d99c

Observation ec9c7d18-c642-40cc-8285-665c74826ec4 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.906598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.906598Z digest=sha256:060ff4094cd1bc366684e02ff082cd06fd9e7b198ddd421f174469971b83de1c

Observation 5455bd5c-2f4d-43bb-a23f-b15c5e66c49b · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.910567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.910567Z digest=sha256:11eee87a2dfe8d2a84339d73f2911c2db2b049fdabba6ab133855696510bc752

Observation baec2d01-64f0-431e-9c3b-1387ed1e70d7 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 76

Resolution
verified exact
doi, observed 2026-08-07T00:39:42.734627Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:39:41.914769Z digest=sha256:90b64cecd7dbac047d7d5a7ba01d173396bc66c49785a21b2c3052fc81d9c893

Observation 0caf4c69-bfbb-473c-a4b0-3963e0ca5858 · outbound

This paper cites Malla, C.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Malla, C

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.918902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.918902Z digest=sha256:e2c725837e7b2f0c95f0dca62aad3a6c4f4b1dcafd948b8487e77082ea663baf

Observation c9162ea3-2b41-4700-ba06-e3dfa2ae021f · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.923821Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.923821Z digest=sha256:21e31368c4bfa3d1428bff4c2d0f485bd2943b0cc888a158c0f9adeaae3ea4a6

Observation 63c4f861-85b8-434c-87bf-7574c59db5c1 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.927310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.927310Z digest=sha256:2be1eec773d04bd4873a048ea2cdede182616fd7b3a9c5cfb1dd2ba113d5f13a

Observation c4ab97bc-27da-4f8e-9709-5ffd9cff91f4 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.931577Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.931577Z digest=sha256:e1d3f6d3fd9906efba5e86b807b235fc54281dad59a9a1dfa64cef05c7a92cae

Observation 13e19500-827b-4e73-9199-aba13927bfa1 · outbound

This paper cites Language Prompt for Autonomous Driving.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Language Prompt for Autonomous Driving

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.935007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.935007Z digest=sha256:00f05640df0e367988c6cf487c6cd5763217d87d32bb4b1cb8ea0f7212c88102

Observation dd094b8a-70e8-4055-978a-0dea2ce54259 · outbound

This paper cites Logic Meets Magic: LLMs Cracking Smart Contract Vulnerabilities.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Logic Meets Magic: LLMs Cracking Smart Contract Vulnerabilities

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.938501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.938501Z digest=sha256:8ef9813a23d148632b496be38c74905c638c9f9cada27d7fe39a830c953dd92b

Observation 996de77b-5907-42c1-86da-fd6bac78b1a6 · outbound

This paper cites LLM-SmartAudit: Advanced Smart Contract Vulnerability Detection.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models LLM-SmartAudit: Advanced Smart Contract Vulnerability Detection

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.941957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.941957Z digest=sha256:edc02c392010a7a0e0108a4012329eb78f8a72507064d70c7611e3b7a6eec28e

Observation 7dd2f9f2-e621-41c1-a09b-05ad1de09f48 · outbound

This paper cites ACFIX: Guiding LLMs with Mined Common RBAC Practices for Context-Aware Repair of Access Control Vulnerabilities in Smart Contracts.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models ACFIX: Guiding LLMs with Mined Common RBAC Practices for Context-Aware Repair of Access Control Vulnerabilities in Smart Contracts

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.946070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.946070Z digest=sha256:101469e98656381c861efe9e370dd16e61f5b6462769b07422016b0de8208cae

Observation 1a3b0867-df9e-4ef7-9dcf-32fde5867a49 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 85

Resolution
malformed identifier
no resolver link, observed 2026-08-07T00:39:41.950892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.950892Z digest=sha256:445cb8eaebc7921f14fae88e53962fa1f3fec85349b54782bd536b1838d09522

Observation 2c5e8517-ba74-46e8-a590-7cff7c738c7b · outbound

This paper cites Ethereum Price Prediction Employing Large Language Models for Short-term and Few-shot Forecasting.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Ethereum Price Prediction Employing Large Language Models for Short-term and Few-shot Forecasting

Reference 86

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:39:43.674504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:39:41.955259Z digest=sha256:3620bdf57411f898daba5d2b929d6f4d5381da3c08b4bba9a54265eb7aec46f5

Observation e6879f06-fd77-45b5-a5d3-6705c5f77814 · outbound

This paper cites Exploring LLM Cryptocurrency Trading Through Fact-Subjectivity Aware Reasoning.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Exploring LLM Cryptocurrency Trading Through Fact-Subjectivity Aware Reasoning

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.958895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.958895Z digest=sha256:7a3e7df104c65e32535a2c3c66e91e380174dee8cb6ece788f43c2dd5dd97b6e

Observation bb59d99e-d90b-4048-864e-43c08836a429 · outbound

This paper cites Large Language Models for Blockchain Security: A Systematic Literature Review.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Large Language Models for Blockchain Security: A Systematic Literature Review

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.963490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.963490Z digest=sha256:a733b99c7dc79d536c8f64355446c2b4abc6ccba67d2d07d173ba90d25b274b6

Observation ff40ad15-0fd6-4ffb-b399-4d85b0dd2199 · outbound

This paper cites Large Language Models in Cryptocurrency Securities Cases: Can a GPT Model Meaningfully Assist Lawyers?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Large Language Models in Cryptocurrency Securities Cases: Can a GPT Model Meaningfully Assist Lawyers?

Reference 89

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:39:43.636560Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:39:41.967124Z digest=sha256:5f2c2088de5724f63dccd6b69c04e4816e935acb9031ac71538fb274e9ebcd7f

Observation 63d28df8-52ec-428a-852e-e42117a0f360 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.970780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.970780Z digest=sha256:768a15b63b59349a295522c8f1bec84af53de781715d206dfdf7918bea7e0e18

Observation 454c4815-e6e7-4b6b-a6d9-fcc3d40cc7c8 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.974138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.974138Z digest=sha256:2876706cbe4c6fdcf32a2a33a75c4ea1c978f91c78de6e4e9c250d678a625073

Observation 7d63b3f8-0a63-489c-8ce9-aebedf8a93a2 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.978237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.978237Z digest=sha256:761b0cc3c5fe5148f69bdb73fe5e6185a2aa649d4bcad7ad80134f33b415f607

Observation 756b38bf-bb3d-4f4e-bd0e-7aed0526441d · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.981737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.981737Z digest=sha256:2e94773038dedaea4ad4ef859dd2f3c9d1e2d53e70b452572b12e8b1f620ce1e

Observation ce57edaf-9138-4a1a-9e8a-22fb1fcea8b4 · outbound

This paper cites WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.985661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.985661Z digest=sha256:9058b23ef1681238a4ee14452b63b92f5cd43486d87a72d1646016a16ba9049b

Observation 3cbfd683-b20e-4fe3-9865-c3d859638272 · outbound

This paper cites LogLLM: Log-based Anomaly Detection Using Large Language Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models LogLLM: Log-based Anomaly Detection Using Large Language Models

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.989841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.989841Z digest=sha256:daf03a4ceda40088b6cc6919d5319d7c2703803ac9f15e793c03042e89121a9b

Observation 9b129a3a-eb73-4630-ac44-4989b94424b5 · outbound

This paper cites Real-Time Anomaly Detection and Reactive Planning with Large Language Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Real-Time Anomaly Detection and Reactive Planning with Large Language Models

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.994028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.994028Z digest=sha256:87c11f023b8f0de9dc6f71a643f051c12286917cb87187570ae2b31f3f4b1642

Observation 83ec3f38-6365-431b-9bab-001ec26a5cc6 · outbound

This paper cites Zhang, D.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Zhang, D

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.997779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.997779Z digest=sha256:f634a43918c5fbf49d279f03850ea762e46b027169d9c6ea7c2da5fdaa6aaaae

Observation ff885e08-d07b-475e-be47-43864ae90972 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:42.001073Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:42.001073Z digest=sha256:a75c0eb8ba01c5c1d09bc325d533652d1fe2ef40e337224dab7e141427cb2646

Observation 215976d9-09fb-4dac-9b96-68245e69699a · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:42.005109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:42.005109Z digest=sha256:a76792e2e93fa823e88b06ace113492d1d24f35c1359b0f87bdfd002f3a274ce

Observation d3d98513-624c-4268-8633-5f40cf866eda · outbound

This paper cites MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:42.008599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:42.008599Z digest=sha256:4ef73733d21a0f14ed1dafb71a56ba8eeaa519565d21fbf4661a31ccc4a09960

Pith citing papers

Observation 203daee5-81f4-4de5-b65e-c0cebffff883 · inbound

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research cites this paper.

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research Domain Specific Benchmarks for Evaluating Multimodal Large Language Models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:33:15.815319Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-06-29T08:24:42.412763Z digest=sha256:30d3d96a135295472a483b1c516c529c0f9f8b2d20388dacf738123e42d18609

Observation b41655b5-201e-41b0-9551-43758eaa1c12 · inbound

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research cites this paper.

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research Domain Specific Benchmarks for Evaluating Multimodal Large Language Models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:39:16.517228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-07-04T00:30:00.449270Z digest=sha256:dc7414f19d6b8a215a6883c98110e8b41459665bf58c92f74e61867618e4b469