{"as_of":"2026-08-19T16:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:351e0cef0a7b3a71e1ddc0b713a551b62ac07ab13ed185bf6781d590507c43c4","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:44:43.776033Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:31:35.967550Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T22:34:01.406814Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"cited_work":{"arxiv_id":"2505.12207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12207","snapshot_observed_at":"2026-06-29T22:34:01.406814Z","title":"Can large multimodal models understand agricultural scenes? benchmarking with agromind","venue":null,"work_id":"1b80af65-9017-49a0-afb7-eda946d37088","year":2025},"citing_paper":{"arxiv_id":"2511.23253","last_updated":"2026-05-17T14:28:57Z","snapshot_observed_at":"2026-08-14T11:58:54.558459Z","submitted_at":"2025-11-28T15:02:19Z","title":"AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:42.921867Z"},"links":{"cited_paper":"/paper/2505.12207","citing_paper":"/paper/2511.23253"},"observation_digest":"sha256:4cc5301a993f9819faeb1884d51926bedb8cc41ca0d4f3b2feef9368b2e7a379","observation_id":"bb39dfde-fb40-4cd6-a7db-b6b77dc19a05","resolution":{"observed_at":"2026-05-21T18:00:26.927424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"cited_work":{"arxiv_id":"2505.12207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12207","snapshot_observed_at":"2026-06-29T22:34:01.406814Z","title":"Can large multimodal models understand agricultural scenes? benchmarking with agromind","venue":null,"work_id":"1b80af65-9017-49a0-afb7-eda946d37088","year":2025},"citing_paper":{"arxiv_id":"2604.08884","last_updated":"2026-04-10T02:47:32Z","snapshot_observed_at":"2026-08-10T22:18:32.055450Z","submitted_at":"2026-04-10T02:47:32Z","title":"HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:49.114269Z"},"links":{"cited_paper":"/paper/2505.12207","citing_paper":"/paper/2604.08884"},"observation_digest":"sha256:5ac1c87527da10b5d470f118996d91d63b9f1f01eec6b9c753847f768f071b1d","observation_id":"8ab42fb7-eae2-4e35-a89d-faba5bb31b6f","resolution":{"observed_at":"2026-05-11T05:30:57.695458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"cited_work":{"arxiv_id":"2505.12207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12207","snapshot_observed_at":"2026-06-29T22:34:01.406814Z","title":"Can large multimodal models understand agricultural scenes? benchmarking with agromind","venue":null,"work_id":"1b80af65-9017-49a0-afb7-eda946d37088","year":2025},"citing_paper":{"arxiv_id":"2605.22366","last_updated":"2026-05-21T11:58:54Z","snapshot_observed_at":"2026-08-16T10:59:15.279491Z","submitted_at":"2026-05-21T11:58:54Z","title":"AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:50.161097Z"},"links":{"cited_paper":"/paper/2505.12207","citing_paper":"/paper/2605.22366"},"observation_digest":"sha256:dcaf045d8cc526c9d0cdaf4fadc0f103c79912dd79d8b93c683f3aa019807093","observation_id":"eecb98c2-802f-4748-9c77-08aac7d822ef","resolution":{"observed_at":"2026-05-22T07:51:16.383604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"cited_work":{"arxiv_id":"2505.12207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12207","snapshot_observed_at":"2026-06-29T22:34:01.406814Z","title":"Can large multimodal models understand agricultural scenes? benchmarking with agromind","venue":null,"work_id":"1b80af65-9017-49a0-afb7-eda946d37088","year":2025},"citing_paper":{"arxiv_id":"2605.25784","last_updated":"2026-05-25T12:30:33Z","snapshot_observed_at":"2026-08-13T15:50:32.401014Z","submitted_at":"2026-05-25T12:30:33Z","title":"VertiCue-Bench: Diagnosing Whether MLLMs Use Height Cues to Resolve 2D Ambiguity in Remote Sensing Natural Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T22:31:35.967550Z"},"links":{"cited_paper":"/paper/2505.12207","citing_paper":"/paper/2605.25784"},"observation_digest":"sha256:0456b15b4d0f84d4bfc137bef3d6ad45b87fbf8fbc1c0b1d0d29bd90c71f1963","observation_id":"55f06c66-96e7-41a9-8ace-4dffebf7d04b","resolution":{"observed_at":"2026-06-29T22:34:01.409852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12207/citation-record","integrity":"/paper/2505.12207/integrity","json":"/paper/2505.12207/citation-record.json","paper":"/paper/2505.12207"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.607020Z","title":"Remote sensing for agricultural applications: A meta-review,","venue":null,"work_id":"f91eafbb-bd21-49ab-b229-f5d892ba78b7","year":2020},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.538863Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:db2f3144b31bd39e095f0e5002c7cb06c23c86c098df69516acd1ee7e8061cc8","observation_id":"f697720b-3c3c-4df7-9cc0-2b23183cb246","resolution":{"observed_at":"2026-08-15T20:44:44.610919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.596705Z","title":"Zero hunger: future challenges and the way forward towards the achievement of sustainable development goal 2,","venue":null,"work_id":"3d739394-4527-498c-aa6d-1d4f88923505","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.543318Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:fc45c4187dd244e3350c50e68da4694f50d0919714732631bbb3cec2ffbbd06a","observation_id":"692f37c2-e072-4b68-a99e-af2c448d4b98","resolution":{"observed_at":"2026-08-15T20:44:44.600406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.586443Z","title":"Wheat growth monitoring and yield estimation based on remote sensing data assimilation into the safy crop growth model,","venue":null,"work_id":"51f464bb-d379-40f8-b170-f7133108bac9","year":2022},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.547224Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:e0e0073c8908f11d355ba4389c74184c5add003e48257729d72f1f8a91fc8002","observation_id":"125c0312-45dc-4605-9420-5da7e8cc189c","resolution":{"observed_at":"2026-08-15T20:44:44.590362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.576383Z","title":"Challenges and opportunities in remote sensing-based crop monitoring: A review,","venue":null,"work_id":"490176fd-2bc8-4d26-bdae-fdc8cdee7ce8","year":2023},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.551042Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:b5a12a5781a693ef98fffab491c94d0e65fa32e580d2565eaa58a904efc87459","observation_id":"ef43612f-ae2d-455c-80b9-868801ec410f","resolution":{"observed_at":"2026-08-15T20:44:44.579843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.565407Z","title":"A review of individual tree crown detection and delineation from optical remote sensing images: Current progress and future,","venue":null,"work_id":"ed5032a6-6f5d-4df0-98b9-60dcc4b9d96c","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.554280Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:f223018f6fc8381e786c892caf3f96050ca5438b1f3318dc23a6f7d1daf10e2b","observation_id":"82f1b7cd-e549-4f53-acbb-04b638b80670","resolution":{"observed_at":"2026-08-15T20:44:44.569688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.554435Z","title":"Progress and prospects of crop diseases and pests monitoring by remote sensing,","venue":null,"work_id":"6eff096f-6a29-4fc3-abb7-3bed8ab72a61","year":2019},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.557564Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:920498319f4f42f2939276308a2cae54cf9a99553cdc2c61d6a446198c02541f","observation_id":"258540a6-d650-44f6-bd21-bc559b2efae6","resolution":{"observed_at":"2026-08-15T20:44:44.558105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.544020Z","title":"Advances in deep learning applications for plant disease and pest detection: A review,","venue":null,"work_id":"6ed47c48-3ac4-4a05-a5e9-d66ef7790b09","year":2025},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.560988Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:6904d4db89332e8e4d68e25757056b011c8c6545c26b9ec4be867b29007bb6aa","observation_id":"845e2d05-b4ed-4664-8551-09a4b1e7c4d2","resolution":{"observed_at":"2026-08-15T20:44:44.547719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.533554Z","title":"Evaluation of survey and remote sensing data products used to estimate land use change in the united states: Evolving issues and emerging opportunities,","venue":null,"work_id":"8a121a2e-5f77-4edc-ab81-9aaddd71df4c","year":2022},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.563859Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:1ad054cad3c3c1f9ecc281bedfd41871ff0af091c89e1ba2ef1acf175c00f94a","observation_id":"ac73e645-33da-40bc-84a7-9ed5c69de8f6","resolution":{"observed_at":"2026-08-15T20:44:44.537537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19055","last_updated":"2024-06-07T03:03:41Z","snapshot_observed_at":"2026-08-16T13:48:14.630704Z","submitted_at":"2024-05-29T12:56:11Z","title":"FUSU: A Multi-temporal-source Land Use Change Segmentation Dataset for Fine-grained Urban Semantic Understanding","version":3},"cited_work":{"arxiv_id":"2405.19055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.19055","snapshot_observed_at":"2026-08-15T20:44:44.192394Z","title":"FUSU: A Multi-temporal-source Land Use Change Segmentation Dataset for Fine-grained Urban Semantic Understanding","venue":"cs.CV","work_id":"24f13e43-f2c9-44f9-aee8-a2b773e2d7a9","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.567092Z"},"links":{"cited_paper":"/paper/2405.19055","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:86ffe1d38092b3ae5bcc27016940a01e8cdc53a18a9d378498726aedf9311521","observation_id":"72b681ce-6be8-4ce0-8486-400fd17caa30","resolution":{"observed_at":"2026-08-15T20:44:44.195809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.523561Z","title":"Multimodality helps unimodality: Cross-modal few-shot learning with multimodal models,","venue":null,"work_id":"28d10bad-0d17-484f-9e51-73dd6dedb5e4","year":2023},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.570686Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:784de86cf313f202f803bb1d7b6e0828740e27dc244556ce6426cdc5d93024f0","observation_id":"a680ae04-b908-4e2d-a8c6-236359a0473a","resolution":{"observed_at":"2026-08-15T20:44:44.527176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.513319Z","title":"Hello gpt-4o,","venue":null,"work_id":"bb067fd8-637d-4353-a061-0f182bdffa48","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.574271Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:b173ff7d17044c77832f633920f8f395a70b3d08aca3a3beabd0859be661d00f","observation_id":"ba0563c7-05cc-4e4d-8e45-f4b895bca199","resolution":{"observed_at":"2026-08-15T20:44:44.516864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T20:44:43.577705Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.577705Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:54c9a1c5cfb2ffefe223e26aceb2397d086e670f9e0b564341045baa16163698","observation_id":"5cc661c1-fbec-4fbd-8a8e-6110a841c4cb","resolution":{"observed_at":"2026-08-15T20:44:43.577705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T20:44:43.581411Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.581411Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:c4c2c1b6389b4ddec9713c3cbb8ca689c70a4a8ea20ebfc7dba5ccfad2ac3d9e","observation_id":"95bbac99-1bc3-4569-bf73-1e39a6a70bfa","resolution":{"observed_at":"2026-08-15T20:44:43.581411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T20:44:43.584689Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.584689Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:ead52e6b8fdbae8f81e03d8546a7aa33d162b8c229bcbe043bf2af6eb504ac1f","observation_id":"a15df018-ae5a-4abb-b778-97e508df4085","resolution":{"observed_at":"2026-08-15T20:44:43.584689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.588318Z","title":"H2rsvlm: Towards helpful and honest remote sensing large vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.588318Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:1454ea473be338bf5c0a713f2a3486216d5ef30a5cff6352de7fb8e15f601b1c","observation_id":"cec67af7-7727-4142-9644-e13d45039cda","resolution":{"observed_at":"2026-08-15T20:44:43.588318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.592136Z","title":"Vision-language models in remote sensing: Current progress and future trends,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.592136Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:f8337816cb4de59d62baa0a03acaaa00adcff66dd0cc347ccca6b66aa83fc708","observation_id":"de2fc18f-1661-4ada-a68c-8f7a47edd58c","resolution":{"observed_at":"2026-08-15T20:44:43.592136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.490025Z","title":"Urbench: A comprehensive benchmark for evaluating large multimodal models in multi-view urban scenarios,","venue":null,"work_id":"71f1dc66-ba55-49eb-b5d3-bfdae14418fb","year":2025},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.595638Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:13179c7b740dd038e28689faeb4bfe9133836117533be3571f009ff9010de970","observation_id":"e77b66b9-093a-414e-bddd-11e6d4fbdffd","resolution":{"observed_at":"2026-08-15T20:44:44.493775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23771","last_updated":"2025-03-31T06:41:18Z","snapshot_observed_at":"2026-08-16T12:45:28.221483Z","submitted_at":"2025-03-31T06:41:18Z","title":"XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23771","snapshot_observed_at":"2026-08-15T20:44:43.599067Z","title":"Xlrs-bench: Could your multimodal llms understand extremely large ultra-high-resolution remote sensing imagery?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.599067Z"},"links":{"cited_paper":"/paper/2503.23771","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:8a1f1c238e67757e90afc93be24d92a15370923131436570dbfbb274f80e8084","observation_id":"8fd26173-5223-4deb-a2b0-7700721627cd","resolution":{"observed_at":"2026-08-15T20:44:43.599067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.478220Z","title":"Vrsbench: A versatile vision-language benchmark dataset for remote sensing image understanding,","venue":null,"work_id":"80dc353a-d6ba-47c5-a729-61186dd509f1","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.603009Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:0decf1e270b3f8085bd1240e2bad423c29b32157cb57cdfd125cfea7894b3979","observation_id":"51132c66-6bae-46bb-b6d9-f6837c600f03","resolution":{"observed_at":"2026-08-15T20:44:44.482146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.467226Z","title":"A multimodal benchmark dataset and model for crop disease diagnosis,","venue":null,"work_id":"1baf373a-1b97-4574-b111-b24a0ec8b736","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.606428Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:9369ca3b28d83ddf3f09fdc2bd264dc4cb24172d4e0df7f82e49cb72819a18db","observation_id":"935dba89-3363-4a0f-8481-c9873d081115","resolution":{"observed_at":"2026-08-15T20:44:44.470949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.456576Z","title":"Visual question answering model for fruit tree disease decision-making based on multimodal deep learning,","venue":null,"work_id":"585adb91-148e-44ea-8198-e373d50fce57","year":2023},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.610828Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:9229272e87cffab4c5c510cb48bef89e8b42cbe1e112170170d72c76870ac2e7","observation_id":"81f7c205-0497-4748-9ec4-3d6cffd92d0a","resolution":{"observed_at":"2026-08-15T20:44:44.460357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02158","last_updated":"2024-12-04T08:34:49Z","snapshot_observed_at":"2026-08-12T14:25:50.767875Z","submitted_at":"2024-12-03T04:34:23Z","title":"Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02158","snapshot_observed_at":"2026-08-15T20:44:43.614271Z","title":"Agri-llava: Knowledge-infused large multimodal assistant on agricultural pests and diseases,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.614271Z"},"links":{"cited_paper":"/paper/2412.02158","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:f3b9afc0295459fb6cd6a7fc603c11620431a2ed63d704d0ec9ea6878d187fde","observation_id":"00bd4ed4-d206-42f4-8312-e759867a65b3","resolution":{"observed_at":"2026-08-15T20:44:43.614271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10568","last_updated":"2025-07-24T18:03:59Z","snapshot_observed_at":"2026-08-19T03:38:40.587137Z","submitted_at":"2025-04-14T17:59:45Z","title":"AgMMU: A Comprehensive Agricultural Multimodal Understanding Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10568","snapshot_observed_at":"2026-08-15T20:44:43.617655Z","title":"Agmmu: A comprehensive agri- cultural multimodal understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.617655Z"},"links":{"cited_paper":"/paper/2504.10568","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:b4900943fdd650428e45bcfab17bf9b0cc598963bbdcf2d7bddc3ea14499fbe2","observation_id":"981620e5-732a-46bf-897c-d5924e384ec9","resolution":{"observed_at":"2026-08-15T20:44:43.617655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00465","last_updated":"2024-12-21T16:18:42Z","snapshot_observed_at":"2026-08-14T14:44:08.360098Z","submitted_at":"2024-11-30T12:59:03Z","title":"AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00465","snapshot_observed_at":"2026-08-15T20:44:43.621024Z","title":"Agribench: A hierarchical agriculture benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.621024Z"},"links":{"cited_paper":"/paper/2412.00465","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:c6f1664a5cb15b00e3a7d3daf8b053daf039399ce0d8bc944c67121821ff6edd","observation_id":"cda08dd6-a405-4de8-be9e-add82bd7609c","resolution":{"observed_at":"2026-08-15T20:44:43.621024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.444845Z","title":"Rsgpt: A remote sensing vision language model and benchmark,","venue":null,"work_id":"80409d2f-db00-4e52-87df-73215fff703c","year":2025},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.624850Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:76d31ca7781c47c7cb7e3fdaa586d83f5b37bd34c3b48367640e543620a1abc9","observation_id":"9d1b3ede-d2f8-4672-ae20-fc0d76d86b99","resolution":{"observed_at":"2026-08-15T20:44:44.448837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.803482Z","title":"Earthvqa: towards queryable earth via relational reasoning-based remote sensing visual question answering,","venue":null,"work_id":"f25e938e-300f-40e9-9f45-31ae56015999","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.628339Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:56170374ccff38bc34e0522eb1a438063abb661c1c84be526f5b0578ebad749b","observation_id":"d441f3d2-dfc6-4911-a1bc-689d5a486c6b","resolution":{"observed_at":"2026-08-15T20:44:43.808993Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.434075Z","title":"Lhrs-bot: Empowering remote sensing with vgi- enhanced large multimodal language model,","venue":null,"work_id":"24846fe9-614b-4974-827b-6ba1bad232d8","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.632113Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:18752d5b993160897c142448b64d31f6cce7b04ce2d222086b420a9660c76708","observation_id":"9fb18c08-e19b-4ce0-8227-e428771df438","resolution":{"observed_at":"2026-08-15T20:44:44.437918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.422636Z","title":"Agrogpt : Efficient agricultural vision-language model with expert tuning,","venue":null,"work_id":"b6324731-4463-405e-b0f4-1567647dad47","year":2025},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.635625Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:d0f537cb186fbdbb9dc15d0f0b55d1e969f8726a836d592e90fa73b5b28ea389","observation_id":"0dc43abb-5a36-4fee-8687-0f762dd172de","resolution":{"observed_at":"2026-08-15T20:44:44.426907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:44:43.639089Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.639089Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:d62af07b6a3dca45ede029576d512cf596587413b33ddcf862cd2d37f5e7ab94","observation_id":"85f9deaf-7583-4036-9b6c-fd3f5f4378da","resolution":{"observed_at":"2026-08-15T20:44:43.639089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.642389Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.642389Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:4f2f5efc2a5a5721db1ceaac3717e618b82788bf7ff58e33dfe4601caeb16f59","observation_id":"af598bc1-6abb-416b-ab0b-714e20ae000b","resolution":{"observed_at":"2026-08-15T20:44:43.642389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-15T20:44:43.645653Z","title":"Llava-next-interleave: Tack- ling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.645653Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:8b0e7dc91398a025ecc4d031209be44bbc4a1ae8d7f09ad7ee87e9ae9cc9b39a","observation_id":"151b7615-1d8f-4729-85b3-97bca6c70690","resolution":{"observed_at":"2026-08-15T20:44:43.645653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.649504Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.649504Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:56454d293d6f5541fdf1c9cb35a25c8fdd481c48ab9039c47b24d7ad57554e57","observation_id":"e2c2b996-2e3e-439d-971d-ea60266a18fc","resolution":{"observed_at":"2026-08-15T20:44:43.649504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.653014Z","title":"Vila: On pre-training for visual language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.653014Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:788c17c33ecf9bbc47ff2ab0a2083d6b09092b2f3112c3e73f4d097774112f95","observation_id":"65cb4ec1-1960-4e1b-a267-031b63af15a9","resolution":{"observed_at":"2026-08-15T20:44:43.653014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.392015Z","title":"Efficient prompt tuning of large vision- language model for fine-grained ship classification,","venue":null,"work_id":"67b7eee2-b1c6-4906-bc20-a2cdbda9ab59","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.656459Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:f911f859d201ac169e1f7058cec8b97591a2930010f1c2c567661bde85cbee9d","observation_id":"b62de6e2-b00a-4a70-a33f-d0509cacfb82","resolution":{"observed_at":"2026-08-15T20:44:44.395774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.381518Z","title":"Lhrs-bot: Empowering remote sensing with vgi-enhanced large multimodal language model,","venue":null,"work_id":"3f1bb72c-23b1-4b87-9258-ab429639cd7b","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.660165Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:31354d01de5d81d31fa1e888a3f5b663189a1dbba8bbd53eb0b5c7f19345cecc","observation_id":"2aeed79d-edfe-417f-9f86-7a20cd24b4a1","resolution":{"observed_at":"2026-08-15T20:44:44.385068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.663669Z","title":"Geochat: Grounded large vision-language model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.663669Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:ffb41cfb6990add72dd0b3c50e725a1f2867e52147767d87cec8852c18309e7b","observation_id":"d7f63bc7-3c74-4711-90f2-5424333363cc","resolution":{"observed_at":"2026-08-15T20:44:43.663669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.667182Z","title":"Earthgpt: A universal multi-modal large language model for multi-sensor image comprehension in remote sensing domain,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.667182Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:9943ee82752dfce754b7714050992b3f3cd093d482977526bb659a1f5e3ba783","observation_id":"d90df507-686f-4e43-91f9-4eb9995c5d11","resolution":{"observed_at":"2026-08-15T20:44:43.667182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.359330Z","title":"Integrating deep learning for visual question answering in agricultural disease diagnostics: Case study of wheat rust,","venue":null,"work_id":"841445af-0036-4d12-9aba-39c13e9b8ae8","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.670821Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:d598280d93af0ffe882ab464eb618bfbdd2d2bada0a131bdbebf91b5f1929796","observation_id":"6bd7efa1-10d3-4b2a-a952-fb0dc4605ef4","resolution":{"observed_at":"2026-08-15T20:44:44.363185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.674409Z","title":"Nocaps: Novel object captioning at scale,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.674409Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:9cf5210d62f3cc7a06ffdce36bd3e9c68fdd38d50fc1387072b91f32a3957c1f","observation_id":"f4845ac9-d104-45ac-a635-50044e3bb5c3","resolution":{"observed_at":"2026-08-15T20:44:43.674409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.678061Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.678061Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:5c5605dbec4555873da1d6ba7919a8c4a72e73eeb1a95877e49c09a0f3a564f9","observation_id":"0dc5f878-943b-4dae-97fb-b276b61b4ebe","resolution":{"observed_at":"2026-08-15T20:44:43.678061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.335854Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":"44fdf923-d9eb-45b0-be34-c73198823543","year":2017},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.681654Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:74ccdb842d2763f87d200a949c36b4ebf21332d9278fa9b46dfb06d6be169178","observation_id":"b00d41fc-6530-48da-a56d-dd20f5b10df5","resolution":{"observed_at":"2026-08-15T20:44:44.339636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.324816Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":"2785e496-4f1d-4fd2-b393-7e6201f9c70d","year":2019},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.684986Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:fd8b44087bc748fa03ff051814ab798798f6b79d956fba170f3bf73f0e9b3489","observation_id":"b49fbbca-a4f8-4856-8b0d-89237b656308","resolution":{"observed_at":"2026-08-15T20:44:44.328785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.314255Z","title":"Tap: Text-aware pre-training for text-vqa and text-caption,","venue":null,"work_id":"d7a5a9cb-53fb-462a-a842-9513aa681a5b","year":2021},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.688706Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:a050d1e2980fbd3d3e00cac3fd36e5a949b714ead7c31274ce48ae616af3d736","observation_id":"151723f3-09df-42dd-bb9a-9149810740ec","resolution":{"observed_at":"2026-08-15T20:44:44.317892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.692226Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.692226Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:7974c31ebb7d4d97364ecb8d106164ff7fca39dd02b15283bc54257f95fc7426","observation_id":"0f4016df-612b-45c7-a68f-52145a216021","resolution":{"observed_at":"2026-08-15T20:44:43.692226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.297301Z","title":"Seed-bench: Benchmarking multimodal large language models,","venue":null,"work_id":"152a074b-9691-47ac-a6f7-5b9cde6567bf","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.695654Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:d7d52bc7a982972dc9b53119ad66c9701e29fd6c429ffc0abad63fa8132a0f84","observation_id":"15ccb13b-1065-4b47-8a84-b390ece03a39","resolution":{"observed_at":"2026-08-15T20:44:44.301002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-08-18T11:38:20.286256Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-15T20:44:43.699366Z","title":"Mmt-bench: A comprehensive multimodal benchmark for evaluating large vision-language models towards multitask agi,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.699366Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:db3548cd78ee4f9c02ed90cfbd89f8c7281a23ad96e7978a896ca5e92e4bc489","observation_id":"05d5a28d-78ef-46e4-87e7-9f579b2fc602","resolution":{"observed_at":"2026-08-15T20:44:43.699366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-08-13T00:35:03.634903Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-15T20:44:43.702648Z","title":"Mme-realworld: Could your multimodal llm challenge high-resolution real-world scenarios that are difficult for humans?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.702648Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:ee140f6dbcd26d7f95968d4f18470cf4340d975f4b6ab688e009ce536a7914f7","observation_id":"11f515d5-fa07-4429-9bc2-c9ee9a943814","resolution":{"observed_at":"2026-08-15T20:44:43.702648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11743","last_updated":"2024-07-16T14:11:29Z","snapshot_observed_at":"2026-08-17T14:54:40.811329Z","submitted_at":"2024-07-16T14:11:29Z","title":"OAM-TCD: A globally diverse dataset of high-resolution tree cover maps","version":1},"cited_work":{"arxiv_id":"2407.11743","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.11743","snapshot_observed_at":"2026-08-15T20:44:44.083738Z","title":"OAM-TCD: A globally diverse dataset of high-resolution tree cover maps","venue":"cs.CV","work_id":"c412c79e-ae27-41e5-aa29-8fa36cf581d5","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.705786Z"},"links":{"cited_paper":"/paper/2407.11743","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:2a5ef605e0d8584db3b24d6883c61286797d4e4f396b4322d60422b64bb149ff","observation_id":"569fbe55-d8de-4efe-a032-48c380ea04cc","resolution":{"observed_at":"2026-08-15T20:44:44.087748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.285792Z","title":"Growing status observation for oil palm trees using unmanned aerial vehicle (uav) images,","venue":null,"work_id":"f08218e5-89a3-488e-9646-a807226e0909","year":2021},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.709332Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:88ae1608527d1902fec2634cd390ce892c709c9005e8928d41bfd9c3846cd6e7","observation_id":"64538cee-8b6a-4d3b-b1ce-8d6863d232cc","resolution":{"observed_at":"2026-08-15T20:44:44.290108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.274318Z","title":"Agriculture- vision: A large aerial image database for agricultural pattern analysis,","venue":null,"work_id":"474abd49-4a34-4df4-8f57-4b610779d047","year":2020},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.712944Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:1df0fd8b5ae88f922320d12de3e48c7bb3413dac85204d28adf06059af536bfe","observation_id":"2d940f55-35de-49d8-8a91-0718809a857c","resolution":{"observed_at":"2026-08-15T20:44:44.278199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.263446Z","title":"PhenoBench — A Large Dataset and Benchmarks for Semantic Image Interpretation in the Agricultural Domain,","venue":null,"work_id":"bb3488a5-b062-475c-8cc5-545f9e57814d","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.716921Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:7c812f3c54a59f3c61c1987646e59fb17abf71c1bbbfe58109cabd344564da27","observation_id":"aec19df8-a4c2-4c30-9c23-3404eec3dacb","resolution":{"observed_at":"2026-08-15T20:44:44.267370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.252595Z","title":"Ip102: A large-scale benchmark dataset for insect pest recognition,","venue":null,"work_id":"8228fca9-482a-415d-9add-823807b91445","year":2019},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.720263Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:217a41052dc2446722a0cd8a998e1dd12f2ac73237e9b50a53808dbe9562f2f2","observation_id":"27d544a8-7844-4f5a-84a0-ae46cebb5ecf","resolution":{"observed_at":"2026-08-15T20:44:44.256424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.03677","last_updated":"2017-09-18T01:03:55Z","snapshot_observed_at":"2026-08-14T21:35:35.351104Z","submitted_at":"2016-10-12T11:40:24Z","title":"Deep Fruit Detection in Orchards","version":2},"cited_work":{"arxiv_id":"1610.03677","doi":null,"metadata_source":"pith","pith_arxiv_id":"1610.03677","snapshot_observed_at":"2026-08-15T20:44:44.068792Z","title":"Deep Fruit Detection in Orchards","venue":"cs.RO","work_id":"5c99713f-7cdc-4f9f-8675-2b7f1cc977cd","year":2016},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.723781Z"},"links":{"cited_paper":"/paper/1610.03677","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:3d05d340e09b16ca1d06859bf36d1138a945464a836ee55a801d7c80c73f8bef","observation_id":"9363bcde-7669-406c-bbe5-fc68c2159f8f","resolution":{"observed_at":"2026-08-15T20:44:44.073003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.241860Z","title":"Cropharvest: A global dataset for crop-type classification,","venue":null,"work_id":"0a36a342-db12-4e45-b82f-feb10b9a02cc","year":2021},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.727620Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:3a001cd304d5685d1839238eb91d65713c3a135de50f944b23a766778743b15c","observation_id":"ea741b03-a55d-4eec-9160-e007f2a070ca","resolution":{"observed_at":"2026-08-15T20:44:44.245693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.231012Z","title":"The claude 3 model family: Opus, sonnet, haiku,","venue":null,"work_id":"6703c9dc-f1fc-458c-bf9d-2fc411a3adcd","year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.731366Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:9bec8cb5a62f6960edfc723f593ac8d981abbe86ba535a039d31f50157377cf8","observation_id":"90644816-c143-400a-b292-506a6c4b0232","resolution":{"observed_at":"2026-08-15T20:44:44.234965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-18T15:55:15.279313Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-15T20:44:43.735012Z","title":"Tinyllava: A framework of small-scale large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.735012Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:fdf38bac4510e8c193693ec4b5b8bb81af9d88a5f331de41749d1072f0dcc127","observation_id":"b1d4b9f8-06ba-4a49-b02e-e6e9ece34d7d","resolution":{"observed_at":"2026-08-15T20:44:43.735012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-16T05:38:56.513422Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-15T20:44:43.738894Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and comprehension in vision-language large model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.738894Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:8359d9f166ebe9294490a4af506c4b4651492e1419e19b4167838921befa6f4f","observation_id":"550a0bf7-a68f-48e4-b6cc-021b86d96a69","resolution":{"observed_at":"2026-08-15T20:44:43.738894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.742793Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.742793Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:361729f4c6cf6ba57772a8aba9b27cea24fa254a8286230ef6fcbc8523d95c29","observation_id":"1d9ef46f-229a-4fa4-9672-61c388c13a4e","resolution":{"observed_at":"2026-08-15T20:44:43.742793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.747231Z","title":"What matters when building vision- language models?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.747231Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:cc46eefe8d34b3514808c3c09200daaf380b1576c700a4a7dacc6b9675147c7c","observation_id":"546fd704-f8b0-41f5-870d-dff1be5acf1c","resolution":{"observed_at":"2026-08-15T20:44:43.747231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.751003Z","title":"Geochat: Grounded large vision-language model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.751003Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:dfbf9f12e3c6c62ae37bd4dff7855e6da4cd00f56ca6052ea0fcca99eae39c79","observation_id":"793974d0-9d2a-4633-984b-027cd81b1ea3","resolution":{"observed_at":"2026-08-15T20:44:43.751003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.754518Z","title":"Geollava-8k: Scaling remote-sensing multimodal large language models to 8k resolution,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.754518Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:b5d0119aea1eb3f96c173cf7a804574cf84a4af945a97bc0d14f907d82ca8db4","observation_id":"a6b9c74e-ee63-41aa-ba9f-a870aa24fddf","resolution":{"observed_at":"2026-08-15T20:44:43.754518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-15T20:44:43.758033Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal under- standing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.758033Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:ff15d839a5d0ff2ef7761c395d2697b66fbf634ffa48612b97428d7a775e92d6","observation_id":"8a12dccf-ae67-4f72-a3ab-62f6d0c5d087","resolution":{"observed_at":"2026-08-15T20:44:43.758033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-19T00:16:42.047230Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-15T20:44:43.761621Z","title":"Mantis: Interleaved multi-image instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.761621Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:d0dc0d68623edab7c2f293758a4f7766bf87fc3dfa7484ee47ab843864cff0d2","observation_id":"dbf636e4-2de3-4951-90bb-752049acb7b7","resolution":{"observed_at":"2026-08-15T20:44:43.761621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-15T20:44:43.765494Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.765494Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:d6b2868d0e784f529d4038d410d54623c485ed58ff52a79eb946862a152a7027","observation_id":"32795418-00df-47b9-9eb9-54cdfafd60a8","resolution":{"observed_at":"2026-08-15T20:44:43.765494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/5828893","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.951294Z","title":null,"venue":null,"work_id":"0b10eda1-cc85-48a9-908f-2b44038ca585","year":2021},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.769942Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:acbdedb2c9bfa0af6d7c28f188a12a45ad3705691250f041690eff807dec60a5","observation_id":"aebd6c7a-76a4-47ea-80c7-e0cd343c3e11","resolution":{"observed_at":"2026-08-15T20:44:43.956799Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:44.202410Z","title":"com/PRBonn/ phenobench OAM-TCD Dataset","venue":null,"work_id":"f676b7b0-8f43-4e43-87e0-99f006e60250","year":2023},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.772861Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:a98019001f65b1a37250d84610282bd54c8cf8071dfb3f189ac9b0d43bebe47d","observation_id":"b9b2a3c0-9be6-46d6-89e5-d92bb9b4556c","resolution":{"observed_at":"2026-08-15T20:44:44.205485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:43.776033Z","title":"box-based","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:43.776033Z"},"links":{"citing_paper":"/paper/2505.12207"},"observation_digest":"sha256:bbe4891d7cf0918085b60cc389eebf52370daf6a2ce6a8b4a809f0d5db6b3d74","observation_id":"a97a32d1-1ee7-47ba-bc2a-c0d8f8ed19fb","resolution":{"observed_at":"2026-08-15T20:44:43.776033Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12207","last_updated":"2025-08-13T05:17:53Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T03:12:21.170619Z","submitted_at":"2025-05-18T02:45:19Z","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":5,"verified_fuzzy":31},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 4 inbound Pith citation observations for arXiv:2505.12207."}