{"as_of":"2026-08-15T21:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:90f9cc4feb2fbeb5e82b1da35cb696d5f23941a17a9c6cd040ff2ab81a6da113","coverage":[{"denominator":205,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:39:42.008599Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-04T00:30:00.449270Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:39:16.515159Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2506.12958","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12958","snapshot_observed_at":"2026-07-04T00:39:16.515159Z","title":"arXiv preprint arXiv:2506.12958 , year=","venue":null,"work_id":"b80d64c4-9365-49a2-9d79-e4a6dd45cd98","year":null},"citing_paper":{"arxiv_id":"2606.07591","last_updated":"2026-07-03T01:40:25Z","snapshot_observed_at":"2026-08-14T09:41:17.327665Z","submitted_at":"2026-05-28T16:27:40Z","title":"ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-29T08:24:42.412763Z"},"links":{"cited_paper":"/paper/2506.12958","citing_paper":"/paper/2606.07591"},"observation_digest":"sha256:81af7bcddeb7e251d87a15f2306c50dfab4b59eb86cdb8dc8b2220dd086f33f2","observation_id":"203daee5-81f4-4de5-b65e-c0cebffff883","resolution":{"observed_at":"2026-06-29T08:33:15.815319Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2506.12958","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12958","snapshot_observed_at":"2026-07-04T00:39:16.515159Z","title":"arXiv preprint arXiv:2506.12958 , year=","venue":null,"work_id":"b80d64c4-9365-49a2-9d79-e4a6dd45cd98","year":null},"citing_paper":{"arxiv_id":"2606.07591","last_updated":"2026-07-03T01:40:25Z","snapshot_observed_at":"2026-08-14T09:41:17.327665Z","submitted_at":"2026-05-28T16:27:40Z","title":"ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-04T00:30:00.449270Z"},"links":{"cited_paper":"/paper/2506.12958","citing_paper":"/paper/2606.07591"},"observation_digest":"sha256:8ee78c4eb103175a552602346ee8c8201e0fe1782da05d527544c0dfe07b5827","observation_id":"b41655b5-201e-41b0-9551-43758eaa1c12","resolution":{"observed_at":"2026-07-04T00:39:16.517228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12958/citation-record","integrity":"/paper/2506.12958/integrity","json":"/paper/2506.12958/citation-record.json","paper":"/paper/2506.12958"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:39:41.615536Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.615536Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:dd431d892a785a340963ae32d03cdf68736ab60c6ad7555445406f34f1983819","observation_id":"22e77fb1-afc9-447b-ad28-c2aa00bf703f","resolution":{"observed_at":"2026-08-07T00:39:41.615536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T00:39:41.620839Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.620839Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:c641e39125083cb12275363bfa0c618daaad90c9fa1c6bbe4003df0e0a61fe1c","observation_id":"2a72d66f-913d-4913-b4fd-347fd990f34d","resolution":{"observed_at":"2026-08-07T00:39:41.620839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T00:39:41.625249Z","title":"Bommasani, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.625249Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:59832a10a98f61baaa1292e73f9579f345e82269ebc49ab3fd6d8ba54e921627","observation_id":"fc12aaa7-ac0a-4015-9df2-edbde6fc0274","resolution":{"observed_at":"2026-08-07T00:39:41.625249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:39:41.629791Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.629791Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:fa5630b9dafb35db834b30d7c4355c40d84687f6be1b831b10ebd9f977b904fc","observation_id":"2713e6d7-e1c5-4ab0-8c91-1be92280ff06","resolution":{"observed_at":"2026-08-07T00:39:41.629791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-14T03:45:52.225630Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-07T00:39:41.634680Z","title":"Abdin, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.634680Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:582a633159edb4182af8431a17a8f1ea2e3a44aa0ef476774e5a767362091036","observation_id":"dab422af-0405-4654-a183-5bb34a8b6071","resolution":{"observed_at":"2026-08-07T00:39:41.634680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.638742Z","title":"Islam, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.638742Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:8c093a80a71f5c75f863228567b666be2a3ce2bd47125ade9a6bcc1256e440b2","observation_id":"2d5ec7c9-4c18-4cc9-ac07-9ff8ff0158c0","resolution":{"observed_at":"2026-08-07T00:39:41.638742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18573","last_updated":"2025-03-17T17:58:13Z","snapshot_observed_at":"2026-08-14T23:11:12.878076Z","submitted_at":"2024-12-24T17:56:08Z","title":"Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18573","snapshot_observed_at":"2026-08-07T00:39:41.642717Z","title":"Zheng, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.642717Z"},"links":{"cited_paper":"/paper/2412.18573","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:feea13e13f598183493909e98b3d3692d9183b73151fa66188bea93610fb7b5f","observation_id":"2e1fe199-bb2d-41af-97c4-c0f839cd60d5","resolution":{"observed_at":"2026-08-07T00:39:41.642717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19693","last_updated":"2024-06-28T07:09:06Z","snapshot_observed_at":"2026-08-12T23:33:04.396856Z","submitted_at":"2024-06-28T07:09:06Z","title":"MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19693","snapshot_observed_at":"2026-08-07T00:39:41.647061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.647061Z"},"links":{"cited_paper":"/paper/2406.19693","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:76d898092d59543194dad0d251a23d1b37d491b114ea4d67f3adeb32a1420cbe","observation_id":"12671620-04e8-46cb-b642-1c477a68f677","resolution":{"observed_at":"2026-08-07T00:39:41.647061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.651400Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.651400Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:9a685e3f5f8587cef750d9faf0fd7d26f1076306c66e537103b0a1e3c42b8e52","observation_id":"896f59b5-69ca-47b5-a9eb-80e6d851d4c7","resolution":{"observed_at":"2026-08-07T00:39:41.651400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.655386Z","title":"Kernan Freire, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.655386Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:047a69f38189a7df17016cfec4805706c03ebebbcf00a20d6e3309ccc4891c93","observation_id":"e5c6c6a6-9ccf-49b2-9f0d-8b1301c63d1e","resolution":{"observed_at":"2026-08-07T00:39:41.655386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.659215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.659215Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:aa697484c68b611d0c9c1cecac547c2d1a23c903a0a6d3edf35a55d4076970fd","observation_id":"dd1fd5f1-5b1b-4920-ae13-1bda3c35e56d","resolution":{"observed_at":"2026-08-07T00:39:41.659215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09819","last_updated":"2024-12-13T03:16:14Z","snapshot_observed_at":"2026-08-14T23:53:02.155451Z","submitted_at":"2024-12-13T03:16:14Z","title":"FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09819","snapshot_observed_at":"2026-08-07T00:39:41.663250Z","title":"Eslaminia, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.663250Z"},"links":{"cited_paper":"/paper/2412.09819","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d58e07db2b1134810f6c6f598fb46f01576f3247009865d6886d0e272236afce","observation_id":"73e3fb07-81fa-4fd3-b35a-81b054ecfbed","resolution":{"observed_at":"2026-08-07T00:39:41.663250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.667570Z","title":"Fakih, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.667570Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:ea561c6035314e26887af56710b6587b642c45309cd5defa4deee9e9ca1200cc","observation_id":"9fdfcfdb-258b-47a6-8e08-62b3f0b30309","resolution":{"observed_at":"2026-08-07T00:39:41.667570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.671793Z","title":"Tizaoui, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.671793Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:8559ebc21256a61934317518f0e1be16c406606260d9ac5321086ba93cbf62a3","observation_id":"25ca9dca-1ffa-4aff-809b-27353d0b0d36","resolution":{"observed_at":"2026-08-07T00:39:41.671793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08550","last_updated":"2024-07-11T14:34:43Z","snapshot_observed_at":"2026-08-12T23:24:09.230439Z","submitted_at":"2024-07-11T14:34:43Z","title":"Incorporating Large Language Models into Production Systems for Enhanced Task Automation and Flexibility","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08550","snapshot_observed_at":"2026-08-07T00:39:41.676164Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.676164Z"},"links":{"cited_paper":"/paper/2407.08550","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:39ff61be61ab45fa009402258ff8bd16aae758c7962a4901ee2cf2fef1d4d26e","observation_id":"5a0e13cb-75f2-42cd-bfc2-6b2335e1a9d8","resolution":{"observed_at":"2026-08-07T00:39:41.676164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.679893Z","title":"Ogundare, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.679893Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:58cc268665069e9cb8a8d21fcecbb7fb958b7ea36672be57cab0f643dcd38174","observation_id":"05d52643-c9e0-42da-b3e9-9c86aff446f2","resolution":{"observed_at":"2026-08-07T00:39:41.679893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.683409Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.683409Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:5eecd2aa1604c9f6c52a1f898716cd3657b15a1b0a4dd78c012695548b800416","observation_id":"b9dafaaa-0960-46f5-9b17-3d146a08ea74","resolution":{"observed_at":"2026-08-07T00:39:41.683409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03875","last_updated":"2023-07-13T17:29:48Z","snapshot_observed_at":"2026-08-15T17:05:16.897700Z","submitted_at":"2023-07-08T01:42:22Z","title":"Large Language Models for Supply Chain Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03875","snapshot_observed_at":"2026-08-07T00:39:41.686873Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.686873Z"},"links":{"cited_paper":"/paper/2307.03875","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:ba8aca25030c3fcaba853f9e0aed13cb8e5d102427bb5e9e009766aecf3b4edd","observation_id":"7cb939d5-6d1e-4d3a-af26-a83d0ec9f842","resolution":{"observed_at":"2026-08-07T00:39:41.686873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.690624Z","title":"Raman, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.690624Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:20789237243dae147079fcfc5241c42ff20afa2e7b44e105baff10949f78e226","observation_id":"63640395-7108-44df-8b52-f090b168807f","resolution":{"observed_at":"2026-08-07T00:39:41.690624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16622","last_updated":"2023-08-31T10:31:19Z","snapshot_observed_at":"2026-08-13T10:23:34.094152Z","submitted_at":"2023-08-31T10:31:19Z","title":"Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16622","snapshot_observed_at":"2026-08-07T00:39:41.693989Z","title":"Meyer, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.693989Z"},"links":{"cited_paper":"/paper/2308.16622","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:11cddbde9f7cb8acaffd165eeaec0a9075128f3636d29ee951fa0dc6e709d07f","observation_id":"b424281b-a063-4232-949d-841fb688cb6f","resolution":{"observed_at":"2026-08-07T00:39:41.693989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.697905Z","title":"bench authors, Beyond the imitation game: Quantify- ing and extrapolating the capabilities of language models, Transactions on Machine Learning Research (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.697905Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:046e52a3be4a36f084dccaaab3d961ee1123275085aff33310929c272575d69f","observation_id":"0c13e9a4-b54e-4bbd-97a8-2a3e11e63f50","resolution":{"observed_at":"2026-08-07T00:39:41.697905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18985","last_updated":"2025-04-26T18:08:13Z","snapshot_observed_at":"2026-08-14T03:09:21.819685Z","submitted_at":"2025-04-26T18:08:13Z","title":"Tracking the Moving Target: A Framework for Continuous Evaluation of LLM Test Generation in Industry","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18985","snapshot_observed_at":"2026-08-07T00:39:41.701052Z","title":"Azanza, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.701052Z"},"links":{"cited_paper":"/paper/2504.18985","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:bca70382e86c2bc43b23f159161e34f5ae72b472ead833af3e4a4ce1b55afeca","observation_id":"47aa9c45-576d-4b16-8f9c-02610589c765","resolution":{"observed_at":"2026-08-07T00:39:41.701052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.705145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.705145Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:489deaf749253536cc8f76c8ed28ca75bab4e72aabf1b3513c0ddccd6f4edbd4","observation_id":"45969fe8-4c72-4500-9457-8a31e174c01a","resolution":{"observed_at":"2026-08-07T00:39:41.705145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15223","last_updated":"2024-09-08T14:29:38Z","snapshot_observed_at":"2026-08-15T12:38:34.542153Z","submitted_at":"2023-12-23T11:09:40Z","title":"A Survey on Large Language Models for Software Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15223","snapshot_observed_at":"2026-08-07T00:39:41.708804Z","title":"Zhang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.708804Z"},"links":{"cited_paper":"/paper/2312.15223","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:2648df38e11a6dad1e1e5a0a69c2f29cceae21aad49f0adf3859175ad613f699","observation_id":"7b743598-c7ce-4dea-8175-0ada8e673ef5","resolution":{"observed_at":"2026-08-07T00:39:41.708804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.713136Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.713136Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:4de0481281e4c19bd834ad3389cf9007da3ba998641b81eab914bfdc8f00c86d","observation_id":"cc39fc4f-2268-4700-b4e3-773a03027744","resolution":{"observed_at":"2026-08-07T00:39:41.713136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.717289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.717289Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:685f15e8b71e9c5086733fc11dc3744b6d4a5658d62edb4be7c003ef731a3078","observation_id":"7ee961ce-1b53-4b12-a41e-1fa960769104","resolution":{"observed_at":"2026-08-07T00:39:41.717289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-10T16:22:07.766175Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-07T00:39:41.721221Z","title":"Vendrow, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.721221Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:911b366349a7ee6791e52fcc6f3f44ed72dd2802998f7af61b93ccb04c865374","observation_id":"d35071e2-6a71-4045-afaa-bd7f04821575","resolution":{"observed_at":"2026-08-07T00:39:41.721221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-07T00:39:41.725446Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.725446Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:dbe3012e13728d18822bfd90c9027d219bb959301c2f14cd94e9976d446f02b7","observation_id":"17853490-1b3d-4947-a2fe-55801a832645","resolution":{"observed_at":"2026-08-07T00:39:41.725446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06234","last_updated":"2025-01-27T01:45:15Z","snapshot_observed_at":"2026-08-12T22:27:57.483365Z","submitted_at":"2024-10-08T17:45:51Z","title":"TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06234","snapshot_observed_at":"2026-08-07T00:39:41.729658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.729658Z"},"links":{"cited_paper":"/paper/2410.06234","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:14884d5c8da77086f846a210d8f45103d13ebc84d32f4783fcd6aca06913855a","observation_id":"bb7f8507-1658-4704-845c-110ed6a0b86d","resolution":{"observed_at":"2026-08-07T00:39:41.729658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.733804Z","title":"Xiong, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.733804Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:21d96084f230860e70585c2b3a8e67ff598d62b537b9c29f86d46c17c16b9b69","observation_id":"17eb8b0d-4c3d-43df-a02b-1b633efb8d05","resolution":{"observed_at":"2026-08-07T00:39:41.733804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17600","last_updated":"2024-01-31T04:57:12Z","snapshot_observed_at":"2026-08-14T02:28:14.644089Z","submitted_at":"2024-01-31T04:57:12Z","title":"Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17600","snapshot_observed_at":"2026-08-07T00:39:41.737914Z","title":"Zhang, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.737914Z"},"links":{"cited_paper":"/paper/2401.17600","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:0337cdb6611e421fa8e80e707cd0d8e1fbd1dace7686116cb58f2be98ccbe518","observation_id":"6d95f1cf-d097-4862-953f-7717116ca134","resolution":{"observed_at":"2026-08-07T00:39:41.737914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19065","last_updated":"2024-06-27T10:34:02Z","snapshot_observed_at":"2026-08-13T20:58:39.886999Z","submitted_at":"2024-06-27T10:34:02Z","title":"STBench: Assessing the Ability of Large Language Models in Spatio-Temporal Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19065","snapshot_observed_at":"2026-08-07T00:39:41.742261Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.742261Z"},"links":{"cited_paper":"/paper/2406.19065","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:375807e30c3e7f19e5a982a5233f31bf152e572518f431630d44699fc4ab7a60","observation_id":"eeca5cda-ba16-4d8f-a648-34cd90fe1baf","resolution":{"observed_at":"2026-08-07T00:39:41.742261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.746251Z","title":"Sapkota, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.746251Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:f00625142566c1fa7d19d458041983dfc6b0a6dfb5d71969b43a2cea3a4d8099","observation_id":"5b9f2c1f-ef36-4b4d-b51d-6a480b1277d6","resolution":{"observed_at":"2026-08-07T00:39:41.746251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19325","last_updated":"2025-03-12T19:28:05Z","snapshot_observed_at":"2026-08-12T10:15:33.525314Z","submitted_at":"2024-11-28T18:59:56Z","title":"GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19325","snapshot_observed_at":"2026-08-07T00:39:41.749497Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.749497Z"},"links":{"cited_paper":"/paper/2411.19325","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:927f7ccc30a467972dd67c95c387e4f7c09aa20fc89135026a7c17a6e5f2e700","observation_id":"cf07693c-673d-4c7d-b64e-d7774d47fbc0","resolution":{"observed_at":"2026-08-07T00:39:41.749497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.753415Z","title":"Roberts, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.753415Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:c8d952c6df405a23cf6debd13f031256df16e95dc9a4d2b4bc76a364ccb00ee0","observation_id":"015b86be-6aba-4bcd-b163-d57f470b86b4","resolution":{"observed_at":"2026-08-07T00:39:41.753415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05679","last_updated":"2024-12-10T02:23:30Z","snapshot_observed_at":"2026-08-15T18:52:04.714439Z","submitted_at":"2024-12-07T15:11:21Z","title":"RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05679","snapshot_observed_at":"2026-08-07T00:39:41.756940Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.756940Z"},"links":{"cited_paper":"/paper/2412.05679","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d46869e3fdc70378d69f453b74f45822f4c8ced51bd1f8bde000eabf2f68f2d3","observation_id":"34c328bb-c4b8-44cc-a63f-6325c4738d5e","resolution":{"observed_at":"2026-08-07T00:39:41.756940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09105","last_updated":"2025-08-07T20:56:50Z","snapshot_observed_at":"2026-08-15T01:42:09.787818Z","submitted_at":"2024-06-13T13:31:49Z","title":"INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09105","snapshot_observed_at":"2026-08-07T00:39:41.760849Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.760849Z"},"links":{"cited_paper":"/paper/2406.09105","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:3f1928a0b41e74829189c8aec8ff7c7caf83bfb1f3e8785372e963f2a88b91cf","observation_id":"0ae8ff29-4cde-422d-9dc3-fd203fb620dc","resolution":{"observed_at":"2026-08-07T00:39:41.760849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T00:39:41.765231Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.765231Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:a2e132d0198045d07f4523b3ad42c876f1405a709f68626b05c20c557c9817ef","observation_id":"fd27debd-ccab-4ec9-92b2-ad2e80910fd5","resolution":{"observed_at":"2026-08-07T00:39:41.765231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.769927Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.769927Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:eb20417e492276a8c395ce99c0cd56603b8852ae53e25bd761624d7fc9c0f7ea","observation_id":"ac4b8cd4-8a23-424e-9d88-6719ffc816ec","resolution":{"observed_at":"2026-08-07T00:39:41.769927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01266","last_updated":"2024-08-18T23:48:44Z","snapshot_observed_at":"2026-08-15T03:27:33.374626Z","submitted_at":"2024-04-01T17:43:27Z","title":"IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01266","snapshot_observed_at":"2026-08-07T00:39:41.773291Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.773291Z"},"links":{"cited_paper":"/paper/2404.01266","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:a6fac9aefd202d2dab3fc0c2ff07d11eccaf5806d59a81be2b0da79619398c70","observation_id":"bfc5a169-50ce-4d1c-a3ec-7ea13cd751fe","resolution":{"observed_at":"2026-08-07T00:39:41.773291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13730","last_updated":"2024-12-02T15:11:23Z","snapshot_observed_at":"2026-08-12T22:48:08.313110Z","submitted_at":"2024-09-10T01:20:26Z","title":"VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13730","snapshot_observed_at":"2026-08-07T00:39:41.777416Z","title":"Jiang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.777416Z"},"links":{"cited_paper":"/paper/2409.13730","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:51d73fe1af597dab7007a87ed2a22d6069a94e610471e716c6a8e5006599ffe6","observation_id":"baa06e3f-ace0-4e5d-a9bd-4ce2120fd3b3","resolution":{"observed_at":"2026-08-07T00:39:41.777416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.781930Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.781930Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:11e5fb8bf9e009a8a0a9cd90a7c516a67eefb4e945b14fecdf04f5e92bda629d","observation_id":"b036bad6-e0c1-4035-8597-db4a9a169700","resolution":{"observed_at":"2026-08-07T00:39:41.781930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.786215Z","title":"Anand, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.786215Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:bdd9b75031458ade9397b24185a9afe134c6b2a777e6c4c6299018a2e23625ba","observation_id":"662fbc80-6ba8-4a53-b9e9-fa7625348af0","resolution":{"observed_at":"2026-08-07T00:39:41.786215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01475","last_updated":"2024-11-01T07:05:33Z","snapshot_observed_at":"2026-08-13T00:39:47.330399Z","submitted_at":"2024-04-01T20:56:25Z","title":"Are large language models superhuman chemists?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01475","snapshot_observed_at":"2026-08-07T00:39:41.790176Z","title":"Mirza, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.790176Z"},"links":{"cited_paper":"/paper/2404.01475","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:fe45d875304d0108e8625ec7d9e847624c650c8f6bbd7a62a4fa14f911294729","observation_id":"459e5491-99e7-4447-84c4-e24d25bb03ee","resolution":{"observed_at":"2026-08-07T00:39:41.790176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.793728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.793728Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:33950df2cedde7ba15426085796f75c3c8c3baba5c5c7db87da00510269e53e1","observation_id":"76e129ff-fae7-4056-b42c-d2b49e42a482","resolution":{"observed_at":"2026-08-07T00:39:41.793728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.797220Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.797220Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:fd7b363085861ec91a94a03245662bd7675fc0eddb9bc2b6978077da10b0364c","observation_id":"163d8c6b-3890-4bb6-996f-6c7ca2aeb36c","resolution":{"observed_at":"2026-08-07T00:39:41.797220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09391","last_updated":"2024-08-10T13:28:11Z","snapshot_observed_at":"2026-08-15T19:51:48.339368Z","submitted_at":"2024-02-14T18:42:25Z","title":"LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09391","snapshot_observed_at":"2026-08-07T00:39:41.800506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.800506Z"},"links":{"cited_paper":"/paper/2402.09391","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:2d05fbeee52a08854a64791e11f1b9dd7cdeb2437bebb7e181a77a887698e76f","observation_id":"0575fa89-83cc-4a9d-93c6-9b3f9879ba57","resolution":{"observed_at":"2026-08-07T00:39:41.800506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09115","last_updated":"2023-08-17T17:51:05Z","snapshot_observed_at":"2026-08-13T10:32:52.592579Z","submitted_at":"2023-08-17T17:51:05Z","title":"MaScQA: A Question Answering Dataset for Investigating Materials Science Knowledge of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09115","snapshot_observed_at":"2026-08-07T00:39:41.803960Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.803960Z"},"links":{"cited_paper":"/paper/2308.09115","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d01d631bbe87f13ae403a8f5195d7807d262ffe55e8021e55c3241f65888becd","observation_id":"2f3217dd-187c-45ef-a60f-244cc6f64d7f","resolution":{"observed_at":"2026-08-07T00:39:41.803960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00177","last_updated":"2024-11-30T14:01:56Z","snapshot_observed_at":"2026-08-12T22:10:12.283731Z","submitted_at":"2024-10-31T19:48:12Z","title":"LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00177","snapshot_observed_at":"2026-08-07T00:39:41.808360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.808360Z"},"links":{"cited_paper":"/paper/2411.00177","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:5b671f32eec71f4a1875c86a6f6c3e0c89180693c21b6bcb03b47f5676f49929","observation_id":"876bb9b6-fd8a-4277-b1b4-f02d497effad","resolution":{"observed_at":"2026-08-07T00:39:41.808360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13193","last_updated":"2024-06-19T03:59:46Z","snapshot_observed_at":"2026-08-12T23:39:35.199001Z","submitted_at":"2024-06-19T03:59:46Z","title":"PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13193","snapshot_observed_at":"2026-08-07T00:39:41.812250Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.812250Z"},"links":{"cited_paper":"/paper/2406.13193","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:5959c8317632eee049814d91d59e9d90a6d90ae62c7b7aa2b376bc6f44dd8502","observation_id":"406b8ac6-39e1-4b40-b5df-853c56e65809","resolution":{"observed_at":"2026-08-07T00:39:41.812250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06690","last_updated":"2024-05-07T09:18:13Z","snapshot_observed_at":"2026-08-15T05:31:02.142884Z","submitted_at":"2024-05-07T09:18:13Z","title":"DrugLLM: Open Large Language Model for Few-shot Molecule Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06690","snapshot_observed_at":"2026-08-07T00:39:41.816638Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.816638Z"},"links":{"cited_paper":"/paper/2405.06690","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:726d324b4c6ec3e9b8a71d5a1d7a2e6a28e0fccef2929bea414b150dbb96c266","observation_id":"d6541dfb-3b14-4440-bd58-ac9be06d78d7","resolution":{"observed_at":"2026-08-07T00:39:41.816638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.820824Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.820824Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:e82f316ffc0380d47fae5c2a85cb32683d91175d270f1d611f255a0843e18ceb","observation_id":"3eb95384-25ce-4589-b119-8b09891e2168","resolution":{"observed_at":"2026-08-07T00:39:41.820824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.824182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.824182Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:def2cf90abeb87901ac0eac95a615285598e5c1d81ac6783e68bf1c9de87230f","observation_id":"415390c2-1227-465c-a149-c8999ed55dd9","resolution":{"observed_at":"2026-08-07T00:39:41.824182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11217","last_updated":"2024-06-24T03:55:30Z","snapshot_observed_at":"2026-08-14T07:06:33.426095Z","submitted_at":"2024-06-17T05:23:18Z","title":"WeatherQA: Can Multimodal Language Models Reason about Severe Weather?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11217","snapshot_observed_at":"2026-08-07T00:39:41.827755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.827755Z"},"links":{"cited_paper":"/paper/2406.11217","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:8e22265438a28ce222f00212dc0b9d7f9c904666d66a0c364c224982d4a9803f","observation_id":"93e70b19-314a-48b5-acf5-924ffa0a41da","resolution":{"observed_at":"2026-08-07T00:39:41.827755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19058","last_updated":"2025-02-16T10:05:11Z","snapshot_observed_at":"2026-08-14T13:45:09.629425Z","submitted_at":"2024-09-27T18:00:13Z","title":"CLLMate: A Multimodal Benchmark for Weather and Climate Events Forecasting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19058","snapshot_observed_at":"2026-08-07T00:39:41.831109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.831109Z"},"links":{"cited_paper":"/paper/2409.19058","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:2d90469ba618a5e2aa5e71c6c4079dc7a03120a856bc16f0c794d6b2305bf562","observation_id":"41ddf636-1a72-4f42-96eb-c37e8d8960f4","resolution":{"observed_at":"2026-08-07T00:39:41.831109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.834875Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.834875Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:25f1c334675546fe0004fac638a383802c53c744b7beb4871fcfc18ae36dc4b0","observation_id":"486c1bb9-f746-4797-84f8-7a75078d10f1","resolution":{"observed_at":"2026-08-07T00:39:41.834875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20707","last_updated":"2024-10-09T00:13:06Z","snapshot_observed_at":"2026-08-12T22:27:44.760430Z","submitted_at":"2024-10-09T00:13:06Z","title":"DisasterQA: A Benchmark for Assessing the performance of LLMs in Disaster Response","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20707","snapshot_observed_at":"2026-08-07T00:39:41.838053Z","title":"Rawat, Disasterqa: A benchmark for assessing the performance of llms in disaster response, arXiv preprint arXiv:2410.20707 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.838053Z"},"links":{"cited_paper":"/paper/2410.20707","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:9d7dc8db21844d706a05c9110f305467f60755e0827d724abaf8ba614a70e524","observation_id":"3f31b45e-c978-44a9-b2c7-21cf96fea40b","resolution":{"observed_at":"2026-08-07T00:39:41.838053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12760","last_updated":"2024-11-16T08:02:35Z","snapshot_observed_at":"2026-08-14T04:33:13.540752Z","submitted_at":"2024-11-16T08:02:35Z","title":"VayuBuddy: an LLM-Powered Chatbot to Democratize Air Quality Insights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12760","snapshot_observed_at":"2026-08-07T00:39:41.842241Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.842241Z"},"links":{"cited_paper":"/paper/2411.12760","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:13e329e0e3fba59f3d26908e6fcc6b77ccb12f525ad5590e7363bfff8d19c4f8","observation_id":"2cc6b699-4760-4877-b558-46206ff6317c","resolution":{"observed_at":"2026-08-07T00:39:41.842241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.845914Z","title":"Pafilis, S","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.845914Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:16cb02033c88302cff76b74f18c6f5d350ecc1f97ec0aed7e51f2cd1419417dc","observation_id":"6c9f8696-69cb-47b7-a1e1-b90cfe7cac76","resolution":{"observed_at":"2026-08-07T00:39:41.845914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.849964Z","title":"Abdelmageed, F","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.849964Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:74c6e74d9f3b7eefaf604ff7b6074dcfb86cfd904021c17b5a5b2bf0e71b1c19","observation_id":"9eb06b2f-9f5f-4d75-85f6-9c591c69a61d","resolution":{"observed_at":"2026-08-07T00:39:41.849964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04127","last_updated":"2025-01-10T14:31:21Z","snapshot_observed_at":"2026-08-12T23:48:42.921391Z","submitted_at":"2024-06-06T14:49:06Z","title":"Are We Done with MMLU?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04127","snapshot_observed_at":"2026-08-07T00:39:41.854056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.854056Z"},"links":{"cited_paper":"/paper/2406.04127","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:8cf374ec88f4143da29d43325a4744e20ea60094e65fd9feab59a5408aa24079","observation_id":"8b5a2ea4-e28b-4999-bdba-2db041a08b62","resolution":{"observed_at":"2026-08-07T00:39:41.854056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.858056Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.858056Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:42cf78854c089258746ee187afcdfb07896ff6ef78ec49487010578cd210c350","observation_id":"2152909a-75c5-43c6-a38a-7605a0e9bed3","resolution":{"observed_at":"2026-08-07T00:39:41.858056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.862211Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.862211Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:709a09761426404fc7a1cd60a4d1e88bcea5c47a3d865866d245fa60c8acf8b5","observation_id":"69fbe33a-b4be-4c9f-805d-4e5daa08b57d","resolution":{"observed_at":"2026-08-07T00:39:41.862211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.866695Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.866695Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:b549b1e2c6dc9d629d358d51c3c9379486f9c87052244859782f77de7016bda5","observation_id":"dcd02d8a-d1de-4d28-aacf-f6280cf63d25","resolution":{"observed_at":"2026-08-07T00:39:41.866695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.871055Z","title":"Edwards, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.871055Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:adbee07f70075c2a65fcde6e53504c3fe72278126e4a257b048bfcc0df340285","observation_id":"8df08264-9de2-4a25-9421-78599b826a8a","resolution":{"observed_at":"2026-08-07T00:39:41.871055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.874459Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.874459Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:54e8e313adf146644c1dd22688ca772d867d14bef4b1f0fa4167b617f63e222c","observation_id":"c85c5585-2d02-4e62-83a8-08718fe9be40","resolution":{"observed_at":"2026-08-07T00:39:41.874459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.877742Z","title":"Davies, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.877742Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:5fbfc3d786d0db4eb8293bfc5fc5342000c4b6e618b7b8da09f0f35afc896445","observation_id":"29ea0a6b-e898-411e-ad3f-02daf9765111","resolution":{"observed_at":"2026-08-07T00:39:41.877742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.881368Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.881368Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:8c43b0cb447c0ce859643bc439bfe51978efdd7363b09860cf22560a6d7d8057","observation_id":"d09c6ae9-ac48-4e4e-a5fc-94a52fb674a1","resolution":{"observed_at":"2026-08-07T00:39:41.881368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11059","last_updated":"2025-02-16T09:57:50Z","snapshot_observed_at":"2026-08-09T23:03:46.739863Z","submitted_at":"2025-02-16T09:57:50Z","title":"ClimateLLM: Efficient Weather Forecasting via Frequency-Aware Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11059","snapshot_observed_at":"2026-08-07T00:39:41.885548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.885548Z"},"links":{"cited_paper":"/paper/2502.11059","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:6c20042aee0ea9cb4a5e1f2d38169677bab11950784532458c64339579811210","observation_id":"f36fd6d9-a808-4022-af84-409d5deabdbc","resolution":{"observed_at":"2026-08-07T00:39:41.885548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.889997Z","title":"Sachdeva, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.889997Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:0cbcf84e019158c0cdc34198910c60e869151059a01a300b21f50e98d277f00b","observation_id":"fcbc7896-1894-40fe-b9dd-46279ab48d66","resolution":{"observed_at":"2026-08-07T00:39:41.889997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.893920Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.893920Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:47b8aa2d382ad547cce3d8596601359125ebe2da813a045d456d2ca1fe22f45b","observation_id":"583c3fae-d05a-4577-b23f-b0ebfb43c860","resolution":{"observed_at":"2026-08-07T00:39:41.893920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.898305Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.898305Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:259eee535076d3ac1b83a9b79e95dc44887a524c18cd8f1619cdc6455203cc4a","observation_id":"87d2ce94-80e9-4f9f-84f4-36e3d86f93aa","resolution":{"observed_at":"2026-08-07T00:39:41.898305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T00:39:41.902404Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.902404Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:81dfc97580c93564932c12bc9da8e0f65fb38415af7b0a1665a62e2bb24152e0","observation_id":"10caa8a0-72a9-4ec0-98a5-e370804464e0","resolution":{"observed_at":"2026-08-07T00:39:41.902404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.906598Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.906598Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:cef5cf29745f391ad174ee2d126c3c774a23eb2688950bae877974bb4e3c3fbf","observation_id":"ec9c7d18-c642-40cc-8285-665c74826ec4","resolution":{"observed_at":"2026-08-07T00:39:41.906598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.910567Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.910567Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:1fe4a530b654b182dfbfe097e6e2fae1b4e922d3682164e8d57df95e6a68c380","observation_id":"5455bd5c-2f4d-43bb-a23f-b15c5e66c49b","resolution":{"observed_at":"2026-08-07T00:39:41.910567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73116-7_","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:42.730569Z","title":null,"venue":null,"work_id":"20ebcc2d-ad21-4bf4-aaf0-e89d01b11ae8","year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.914769Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:fa4b1730928764585dde4ac1b9e8deeebd003978492fe5f9848be43a344ed471","observation_id":"baec2d01-64f0-431e-9c3b-1387ed1e70d7","resolution":{"observed_at":"2026-08-07T00:39:42.734627Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.918902Z","title":"Malla, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.918902Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:36b5df0fa978909aa3a78d82f0aa9f2cf12787d9e21dc42a7196c42710225072","observation_id":"0caf4c69-bfbb-473c-a4b0-3963e0ca5858","resolution":{"observed_at":"2026-08-07T00:39:41.918902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.923821Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.923821Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:46ed131099354e78c135f81c0f04d01dda60b93002c63af01f027d8908b6d4ef","observation_id":"c9162ea3-2b41-4700-ba06-e3dfa2ae021f","resolution":{"observed_at":"2026-08-07T00:39:41.923821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.927310Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.927310Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d582a976f55ff2c56f48a3ddc35521bb43284a73934daf494d09f7f5f0a070fc","observation_id":"63c4f861-85b8-434c-87bf-7574c59db5c1","resolution":{"observed_at":"2026-08-07T00:39:41.927310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.931577Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.931577Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:ef7b0c25fe35122db9e6ea5f5b6a93c4686bb69cdcac80b4846be371ec627106","observation_id":"c4ab97bc-27da-4f8e-9709-5ffd9cff91f4","resolution":{"observed_at":"2026-08-07T00:39:41.931577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04379","last_updated":"2025-03-30T15:11:24Z","snapshot_observed_at":"2026-08-13T10:17:49.877034Z","submitted_at":"2023-09-08T15:21:07Z","title":"Language Prompt for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04379","snapshot_observed_at":"2026-08-07T00:39:41.935007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.935007Z"},"links":{"cited_paper":"/paper/2309.04379","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:56242ca9291ad0be82ab1f483a5a5ed3b0482a5ee227ed2b81ae85d2be0d368a","observation_id":"13e19500-827b-4e73-9199-aba13927bfa1","resolution":{"observed_at":"2026-08-07T00:39:41.935007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07058","last_updated":"2025-01-13T04:42:45Z","snapshot_observed_at":"2026-08-14T16:03:36.435865Z","submitted_at":"2025-01-13T04:42:45Z","title":"Logic Meets Magic: LLMs Cracking Smart Contract Vulnerabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07058","snapshot_observed_at":"2026-08-07T00:39:41.938501Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.938501Z"},"links":{"cited_paper":"/paper/2501.07058","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:2aab54bc76c7e1d6eb52bd7035ccbaea85c7c79285b634c83e6d1bcb3ed22d93","observation_id":"dd094b8a-70e8-4055-978a-0dea2ce54259","resolution":{"observed_at":"2026-08-07T00:39:41.938501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09381","last_updated":"2024-11-04T09:11:18Z","snapshot_observed_at":"2026-08-15T19:07:59.877481Z","submitted_at":"2024-10-12T06:24:21Z","title":"LLM-SmartAudit: Advanced Smart Contract Vulnerability Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09381","snapshot_observed_at":"2026-08-07T00:39:41.941957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.941957Z"},"links":{"cited_paper":"/paper/2410.09381","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:3a3a01435b9f5bb5605c4afddd1959f3090b04fe6057f332c3911e3d1dd34aeb","observation_id":"996de77b-5907-42c1-86da-fd6bac78b1a6","resolution":{"observed_at":"2026-08-07T00:39:41.941957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06838","last_updated":"2025-07-21T05:24:59Z","snapshot_observed_at":"2026-08-13T00:57:31.046349Z","submitted_at":"2024-03-11T15:59:59Z","title":"ACFIX: Guiding LLMs with Mined Common RBAC Practices for Context-Aware Repair of Access Control Vulnerabilities in Smart Contracts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06838","snapshot_observed_at":"2026-08-07T00:39:41.946070Z","title":"Zhang, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.946070Z"},"links":{"cited_paper":"/paper/2403.06838","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:ff61212ecc06f83af021b18a2d0306fc8e6e342e07f779a7d90c733cb0a2181b","observation_id":"7dd2f9f2-e621-41c1-a09b-05ad1de09f48","resolution":{"observed_at":"2026-08-07T00:39:41.946070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.950892Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.950892Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:dfa06fe46496cde6de7217803d1c5b18878db24d2c81547c8b09c22add856c36","observation_id":"1a3b0867-df9e-4ef7-9dcf-32fde5867a49","resolution":{"observed_at":"2026-08-07T00:39:41.950892Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23190","last_updated":"2025-03-29T19:04:28Z","snapshot_observed_at":"2026-08-07T16:28:13.835295Z","submitted_at":"2025-03-29T19:04:28Z","title":"Ethereum Price Prediction Employing Large Language Models for Short-term and Few-shot Forecasting","version":1},"cited_work":{"arxiv_id":"2503.23190","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.23190","snapshot_observed_at":"2026-08-07T00:39:43.669913Z","title":"Ethereum Price Prediction Employing Large Language Models for Short-term and Few-shot Forecasting","venue":"cs.AI","work_id":"91907e4b-2dcc-4e64-806e-308abde2c50f","year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.955259Z"},"links":{"cited_paper":"/paper/2503.23190","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:e2f8f319133cdc8f6bea1ce502c55787a19b992801d78d597da574ca7d40e6c5","observation_id":"2c5e8517-ba74-46e8-a590-7cff7c738c7b","resolution":{"observed_at":"2026-08-07T00:39:43.674504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12464","last_updated":"2025-03-12T12:50:00Z","snapshot_observed_at":"2026-08-13T17:12:27.416095Z","submitted_at":"2024-10-16T11:25:13Z","title":"Exploring LLM Cryptocurrency Trading Through Fact-Subjectivity Aware Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12464","snapshot_observed_at":"2026-08-07T00:39:41.958895Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.958895Z"},"links":{"cited_paper":"/paper/2410.12464","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:17719695c2fb298d905ba8ae861b5b820ab32f74089d6dac6c6e62bbbe39e032","observation_id":"e6879f06-fd77-45b5-a5d3-6705c5f77814","resolution":{"observed_at":"2026-08-07T00:39:41.958895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14280","last_updated":"2025-03-24T12:14:43Z","snapshot_observed_at":"2026-08-14T19:39:57.116043Z","submitted_at":"2024-03-21T10:39:44Z","title":"Large Language Models for Blockchain Security: A Systematic Literature Review","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14280","snapshot_observed_at":"2026-08-07T00:39:41.963490Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.963490Z"},"links":{"cited_paper":"/paper/2403.14280","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:3c8cda490d1c9dc54ad1f81d5276fd9a5d9f6a63cb5397c580f2a47c96ebfbba","observation_id":"bb59d99e-d90b-4048-864e-43c08836a429","resolution":{"observed_at":"2026-08-07T00:39:41.963490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06032","last_updated":"2024-02-22T16:21:51Z","snapshot_observed_at":"2026-08-15T10:10:46.129622Z","submitted_at":"2023-08-11T09:23:11Z","title":"Large Language Models in Cryptocurrency Securities Cases: Can a GPT Model Meaningfully Assist Lawyers?","version":4},"cited_work":{"arxiv_id":"2308.06032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06032","snapshot_observed_at":"2026-08-07T00:39:43.631395Z","title":"Large Language Models in Cryptocurrency Securities Cases: Can a GPT Model Meaningfully Assist Lawyers?","venue":"cs.AI","work_id":"46ca289f-4ccd-48ce-b17a-7e63c6c945a5","year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.967124Z"},"links":{"cited_paper":"/paper/2308.06032","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:8827f83bea5f6b8458df5604ab221b4a05129d3aff0531101a7e9f135cab8ff4","observation_id":"ff40ad15-0fd6-4ffb-b399-4d85b0dd2199","resolution":{"observed_at":"2026-08-07T00:39:43.636560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.970780Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.970780Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:b17f610b9f03ce55989ae42e86fc5f76f4c631383c82c0a041f452f05d339278","observation_id":"63d28df8-52ec-428a-852e-e42117a0f360","resolution":{"observed_at":"2026-08-07T00:39:41.970780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.974138Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.974138Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:a8222453d6adc289c70a3a0117fb8d2e5a3007584678043dd8ef11d174b0674a","observation_id":"454c4815-e6e7-4b6b-a6d9-fcc3d40cc7c8","resolution":{"observed_at":"2026-08-07T00:39:41.974138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.978237Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.978237Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:dbae54301719a408f431aec31a98f0104e6115aaf935d4b53d8dd4a226b07847","observation_id":"7d63b3f8-0a63-489c-8ce9-aebedf8a93a2","resolution":{"observed_at":"2026-08-07T00:39:41.978237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.981737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.981737Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:37f8640a1f402cc4cb580947c9194f303b8109fbc337b9d59e86b08c86d95a34","observation_id":"756b38bf-bb3d-4f4e-bd0e-7aed0526441d","resolution":{"observed_at":"2026-08-07T00:39:41.981737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00083","last_updated":"2022-10-31T18:35:18Z","snapshot_observed_at":"2026-08-14T18:26:56.513265Z","submitted_at":"2022-10-31T18:35:18Z","title":"WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00083","snapshot_observed_at":"2026-08-07T00:39:41.985661Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.985661Z"},"links":{"cited_paper":"/paper/2211.00083","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:c041fc2cda0900e3405179835fb3b05aebef627a035154478a08fcdc78845285","observation_id":"ce57edaf-9138-4a1a-9e8a-22fb1fcea8b4","resolution":{"observed_at":"2026-08-07T00:39:41.985661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08561","last_updated":"2025-04-14T02:52:50Z","snapshot_observed_at":"2026-08-12T21:29:27.055176Z","submitted_at":"2024-11-13T12:18:00Z","title":"LogLLM: Log-based Anomaly Detection Using Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08561","snapshot_observed_at":"2026-08-07T00:39:41.989841Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.989841Z"},"links":{"cited_paper":"/paper/2411.08561","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:0adc4909aed7c7c345f6845566f853a8904a9c889721861dff842b6930314b6d","observation_id":"3cbfd683-b20e-4fe3-9865-c3d859638272","resolution":{"observed_at":"2026-08-07T00:39:41.989841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08735","last_updated":"2024-07-11T17:59:22Z","snapshot_observed_at":"2026-08-12T23:23:58.789490Z","submitted_at":"2024-07-11T17:59:22Z","title":"Real-Time Anomaly Detection and Reactive Planning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08735","snapshot_observed_at":"2026-08-07T00:39:41.994028Z","title":"Sinha, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.994028Z"},"links":{"cited_paper":"/paper/2407.08735","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:e3aa3ab3d7ca89c4aed549b892e0430ee6749b6af813ec7b197c2da7219df885","observation_id":"9b129a3a-eb73-4630-ac44-4989b94424b5","resolution":{"observed_at":"2026-08-07T00:39:41.994028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.997779Z","title":"Zhang, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.997779Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:3cb769133c6a0e9bb4e102d2b12c4ccdda8fd3e7c6ae979b2a65725445fd140a","observation_id":"83ec3f38-6365-431b-9bab-001ec26a5cc6","resolution":{"observed_at":"2026-08-07T00:39:41.997779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:42.001073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:42.001073Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:da9857b625885d181d3ae9d11610c67c77c9ea6c29664ba993936a392de827ad","observation_id":"ff885e08-d07b-475e-be47-43864ae90972","resolution":{"observed_at":"2026-08-07T00:39:42.001073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:42.005109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:42.005109Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d831c92b34eafa11825297e2ab9e820a1f9dab57b209180a17b1a93519a64521","observation_id":"215976d9-09fb-4dac-9b96-68245e69699a","resolution":{"observed_at":"2026-08-07T00:39:42.005109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19444","last_updated":"2024-05-29T18:45:55Z","snapshot_observed_at":"2026-08-13T14:45:36.775722Z","submitted_at":"2024-05-29T18:45:55Z","title":"MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19444","snapshot_observed_at":"2026-08-07T00:39:42.008599Z","title":"Liang, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:42.008599Z"},"links":{"cited_paper":"/paper/2405.19444","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:9c7b8fab67e91bdca01d15b5648c5e06bb78144df7016c6bfb1865e91faf536b","observation_id":"d3d98513-624c-4268-8633-5f40cf866eda","resolution":{"observed_at":"2026-08-07T00:39:42.008599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T16:54:29.059569Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":205},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 205 outbound references and 2 inbound Pith citation observations for arXiv:2506.12958."}