{"as_of":"2026-08-12T10:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55af4abb5f01c323fcf8d2d1be909567494e1b07342799f83d0fc852f2f20043","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:19:59.121503Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08575/citation-record","integrity":"/paper/2507.08575/integrity","json":"/paper/2507.08575/citation-record.json","paper":"/paper/2507.08575"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:19:58.967536Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.967536Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:9f435862b08f14abfcc98cbd965f223551ce1adc596df6f7ec3061eb46f72fc2","observation_id":"2f850f75-b021-4635-8d30-f25ed505b968","resolution":{"observed_at":"2026-08-06T18:19:58.967536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T18:19:58.994170Z","title":"Palm-e: An embodied multimodal language model.arXiv preprint arXiv:2303.03378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.994170Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:9f3c99a9acc6aca65c1765702d4df461f092960830698a393b93a5594245331d","observation_id":"b5372bbb-cb5c-4103-a6e9-84bb2767805d","resolution":{"observed_at":"2026-08-06T18:19:58.994170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.998910Z","title":"URL: https://aclanthology.org/P18-1119, doi:10.18653/v1/P18-1119","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.998910Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:7fbffbae6daab9c296377d5b0a18e5964d7407e51f5bbb46e222f43eac861fb0","observation_id":"070fce44-a963-48c6-a482-f3dcae919d39","resolution":{"observed_at":"2026-08-06T18:19:58.998910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:19:59.011087Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.011087Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:416658369c936f3df34ced5f65a34612067cf3f930f926e7f0d4a0ca39250e59","observation_id":"061f5130-8738-41c6-a169-9c4c2c225d99","resolution":{"observed_at":"2026-08-06T18:19:59.011087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.650972Z","title":"Grounding spatial named entities for information extraction and question answering","venue":null,"work_id":"f13c94c9-be39-4d62-91be-8dcdc9feeea0","year":2003},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.033967Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:3e5c5c672d71431817d2fb51577ba5f41d451b6b8c36d19842f517d63d290de5","observation_id":"d329a34d-baec-401c-858c-244e2a9c0e5b","resolution":{"observed_at":"2026-08-06T18:19:59.657870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09082","last_updated":"2025-03-19T13:31:16Z","snapshot_observed_at":"2026-08-11T17:18:34.737386Z","submitted_at":"2024-12-12T09:08:13Z","title":"Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method","version":3},"cited_work":{"arxiv_id":"2412.09082","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09082","snapshot_observed_at":"2026-08-06T18:19:59.323958Z","title":"Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method","venue":"cs.CV","work_id":"43452ffe-e0f2-4eda-ba71-c05e3dac62de","year":2024},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.057936Z"},"links":{"cited_paper":"/paper/2412.09082","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:18add41d15a79c49b9991e5a0467588d4cf879b9ab24d04be1b0ab1420dce2c6","observation_id":"3ca0bd32-4809-48cb-a01e-0c67a2811234","resolution":{"observed_at":"2026-08-06T18:19:59.328241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03054","last_updated":"2022-08-05T09:19:46Z","snapshot_observed_at":"2026-08-09T01:21:18.813180Z","submitted_at":"2022-08-05T09:19:46Z","title":"Global Pointer: Novel Efficient Span-based Approach for Named Entity Recognition","version":1},"cited_work":{"arxiv_id":"2208.03054","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.03054","snapshot_observed_at":"2026-08-06T18:19:59.298642Z","title":"Global Pointer: Novel Efficient Span-based Approach for Named Entity Recognition","venue":"cs.CL","work_id":"5ea9e103-5309-4943-a38b-aa565f80cfea","year":2022},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.062417Z"},"links":{"cited_paper":"/paper/2208.03054","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:0292d7d493fcefa66c190032820ad60555a3b062afb316f1aa93d79ffed429d9","observation_id":"a76411f8-78d3-49d5-91bd-f7578568ac73","resolution":{"observed_at":"2026-08-06T18:19:59.304088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11382","last_updated":"2023-02-21T12:42:44Z","snapshot_observed_at":"2026-07-06T14:54:37.559648Z","submitted_at":"2023-02-21T12:42:44Z","title":"A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11382","snapshot_observed_at":"2026-08-06T18:19:59.088000Z","title":"A prompt pattern catalog to enhance prompt engineering with chatgpt.arXiv preprint arXiv:2302.11382,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.088000Z"},"links":{"cited_paper":"/paper/2302.11382","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:31055bd77da225781d9dd33637182fdf086476dd32df37fc706fd881465ff3ee","observation_id":"f2326d49-382f-4aec-a1be-6f96cbcc1ee1","resolution":{"observed_at":"2026-08-06T18:19:59.088000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.628474Z","title":"In-context learning for few-shot nested named entity recognition","venue":null,"work_id":"a0856e5f-e4f8-4374-8888-52be4ded89e1","year":2024},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.096943Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:35acab24d8f030ca438b67b6b211e6fd94c56f7c587e401824c520d46e1e5235","observation_id":"6cb5e9d4-9e70-4b37-abd8-4c19925aee41","resolution":{"observed_at":"2026-08-06T18:19:59.634015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.615468Z","title":"A review on entity relation extraction","venue":null,"work_id":"0d5c8cd6-d347-4dc4-887f-0331d25a2b18","year":2017},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.103239Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:cc3a6147bc2b4afbee669063f34a9cfee321138bc80f4a7aac190219b9b6e7fb","observation_id":"d9f3e58a-0a35-41b3-86b6-11a5327f6e6f","resolution":{"observed_at":"2026-08-06T18:19:59.620492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-06T18:19:59.108408Z","title":"Automatic chain of thought prompting in large language models.arXiv preprint arXiv:2210.03493,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.108408Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:6aad3f7d3d398e26bd6721eeb017452e0db0e640e325f60f0d6bdd09577c8cae","observation_id":"493f346d-baa6-456f-8d54-81b62e4951eb","resolution":{"observed_at":"2026-08-06T18:19:59.108408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13339","last_updated":"2024-03-26T01:53:30Z","snapshot_observed_at":"2026-07-06T16:22:42.704981Z","submitted_at":"2023-09-23T11:21:12Z","title":"Enhancing Zero-Shot Chain-of-Thought Reasoning in Large Language Models through Logic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13339","snapshot_observed_at":"2026-08-06T18:19:59.112934Z","title":"Enhancing zero-shot chain-of-thought reasoning in large language models through logic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.112934Z"},"links":{"cited_paper":"/paper/2309.13339","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:c4e07aa3324c112cfdb56a72eb10b53c38a9ceeb8b932764e5307ec188a6c755","observation_id":"c9e9eca3-7b2e-446a-82c4-a49f0f4bb7fd","resolution":{"observed_at":"2026-08-06T18:19:59.112934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.590905Z","title":"A frustratingly easy approach for entity and relation extraction","venue":null,"work_id":"72ce1ab8-20e6-4ac4-a7bd-de5afe07df62","year":2021},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.117455Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:fa665e01517691dd381d5cfc3dd8b31ced5c3bf1a813ab684e45056aa176cfdb","observation_id":"fce66932-9b5a-478b-b1b1-a15fb387ec3c","resolution":{"observed_at":"2026-08-06T18:19:59.598471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.573942Z","title":"Geolocation on cartographic maps with multi-modal fusion","venue":null,"work_id":"93a77157-22b8-4fed-ab75-5735a75a0249","year":2024},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.121503Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:0907445b085feb0c2cc3c6894591504ea3e17d3406840d24faa8f4d31aaa5a35","observation_id":"577a26f8-d4b6-460a-9845-5754281a89f7","resolution":{"observed_at":"2026-08-06T18:19:59.579481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-06T18:19:59.092552Z","title":"Mmt-bench: A comprehensive multimodal benchmark for evaluatinglargevision-languagemodelstowardsmultitaskagi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.092552Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:e5dfea8f040b9d9e7e5522e0f6d35868c438846c23d63edeec581809b1007e08","observation_id":"194404aa-8c2c-4111-bd6d-595658e045ed","resolution":{"observed_at":"2026-08-06T18:19:59.092552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08474","last_updated":"2016-03-28T18:38:46Z","snapshot_observed_at":"2026-07-06T04:50:53.488565Z","submitted_at":"2016-03-28T18:38:46Z","title":"Deep Embedding for Spatial Role Labeling","version":1},"cited_work":{"arxiv_id":"1603.08474","doi":null,"metadata_source":"pith","pith_arxiv_id":"1603.08474","snapshot_observed_at":"2026-08-06T18:19:59.358315Z","title":"Deep Embedding for Spatial Role Labeling","venue":"cs.CL","work_id":"c3e0dba5-64c3-439b-88c6-97608af1e3ec","year":2016},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.049593Z"},"links":{"cited_paper":"/paper/1603.08474","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:534a24936f107f6b0c3aaa5b1f54f90d2532791c00d94819962a4b87940fb630","observation_id":"01214886-ca42-4c5d-814d-7f7e8e087fb1","resolution":{"observed_at":"2026-08-06T18:19:59.362605Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T18:19:58.977609Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.977609Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:4c1df1129034629e16f701592854c72be4c232316e99107c06f1b808c0c095c1","observation_id":"086ab75d-abdb-45d0-8780-a0562ec06b05","resolution":{"observed_at":"2026-08-06T18:19:58.977609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4848.25348","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.479487Z","title":"24 Yoonsik Kim, Moonbin Yim, and Ka Yeon Song","venue":null,"work_id":"7b0b20f3-0dd6-42ab-a2fc-08e0c55f9fc6","year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.027410Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:60b42d8a8dcd103362659342893d62ef3304dd7e793c5e3e041c2d1f2c797e88","observation_id":"290b1aad-18df-4aa2-ab3f-cebbf98e35be","resolution":{"observed_at":"2026-08-06T18:19:59.485488Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/2629685","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"ACM Transactions on Information Systems","work_id":"8e254f97-fc98-47d4-abb0-fb059b9434d4","year":2025},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.070619Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:e7964f46704496aded6bcf6bbf7b9d47abb0021487a72a0c6dd2741fd9c4886b","observation_id":"be06cf4a-4fb7-4f1a-9c28-5d94b593515f","resolution":{"observed_at":"2026-08-06T18:19:59.168946Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02105","last_updated":"2023-12-09T02:05:05Z","snapshot_observed_at":"2026-08-09T16:17:13.712329Z","submitted_at":"2023-05-03T13:28:08Z","title":"GPT-RE: In-context Learning for Relation Extraction using Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02105","snapshot_observed_at":"2026-08-06T18:19:59.074638Z","title":"Gpt-re: In-context learning for relation extraction using large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.074638Z"},"links":{"cited_paper":"/paper/2305.02105","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:bb67188bfd5090832de5114137c028b55e869d672d9335a069cd133ebd753107","observation_id":"48d2d07b-9d23-4fd4-a809-37840541772b","resolution":{"observed_at":"2026-08-06T18:19:59.074638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T18:19:58.986291Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.986291Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:8b3f7713c40f4afcd8d8ffb28501a0ba092f16a32198fc5e8cad818663d06d0f","observation_id":"ec5fe78f-d0a6-4ab1-90e7-b7527bf3e4e0","resolution":{"observed_at":"2026-08-06T18:19:58.986291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.080445Z","title":"59 Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Fei Xia, Ed Chi, Quoc V Le, Denny Zhou, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.080445Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:f7824619585ff1ae3463135c5df756471f00f0ba3c5ce5112b11c53bcf6d49bc","observation_id":"2b709d42-0538-4c77-a415-ebb661b4d579","resolution":{"observed_at":"2026-08-06T18:19:59.080445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T18:19:59.066219Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.066219Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:c6f1deddfe0af028d4cb1d3d708071fb601f8c80517c690c5222b083be367a3d","observation_id":"fd567148-4df0-4a48-955a-92c6a09183ea","resolution":{"observed_at":"2026-08-06T18:19:59.066219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03791","last_updated":"2024-08-26T07:13:47Z","snapshot_observed_at":"2026-08-11T03:42:10.052158Z","submitted_at":"2024-07-04T09:55:04Z","title":"M5 -- A Diverse Benchmark to Assess the Performance of Large Multimodal Models Across Multilingual and Multicultural Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":"2407.03791","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.03791","snapshot_observed_at":"2026-08-06T18:19:59.341459Z","title":"M5 -- A Diverse Benchmark to Assess the Performance of Large Multimodal Models Across Multilingual and Multicultural Vision-Language Tasks","venue":"cs.CL","work_id":"67c09f98-df1a-4b2a-89e7-4c7304daf278","year":2024},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.053584Z"},"links":{"cited_paper":"/paper/2407.03791","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:0d1ce265541e9bcb8fb1b5fcb53ed2a8917b79b1e2973d2a93cc3e0f6f1b0350","observation_id":"445ad10e-b5e3-45ea-bff3-caae10fb8c52","resolution":{"observed_at":"2026-08-06T18:19:59.346091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.038022Z","title":"A transformer-based framework for poi- level social post geolocation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.038022Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:edaf3c0da9ed26f73edf903ec802de898e4884bd0681bac99f3a8005bf168466","observation_id":"dbb14d36-a4a6-4345-bfcd-dd00aca3842b","resolution":{"observed_at":"2026-08-06T18:19:59.038022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T18:19:58.990203Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding.arXiv preprint arXiv:1810.04805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.990203Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:edae48eea9de6e2833dedbce0cd85e505b162d7cb17e1c4aaa17014a5e44b9bb","observation_id":"53351287-095b-4972-b180-3e85ad35486f","resolution":{"observed_at":"2026-08-06T18:19:58.990203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T18:19:59.043443Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.043443Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:462c88b6d5109ab963a773485677409f6ead737d9242ef39aa497e5a0001fd8e","observation_id":"1ceb43d4-b75e-4ce5-a815-76d33231b77c","resolution":{"observed_at":"2026-08-06T18:19:59.043443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.668924Z","title":null,"venue":null,"work_id":"88d9d2d6-1f04-47b4-8c0d-6c4e9047e12b","year":2025},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.023282Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:88251a3333222cb58fcb97b9fb7c4e4b321168d16da908e2be3421fa18ccdd1e","observation_id":"99d47f5e-5a25-4663-a847-3451780e21fe","resolution":{"observed_at":"2026-08-06T18:19:59.674004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T01:20:22.458672Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":17,"verified_exact":4,"verified_fuzzy":5},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2507.08575."}