{"as_of":"2026-08-14T08:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:379226f865828e0850f4d9cec10668edbc5a79cdfc7cc1031098a5171ef6911a","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:15:40.738353Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:48:08.135538Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T14:10:29.694282Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"cited_work":{"arxiv_id":"2411.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10857","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Siripong et al","venue":null,"work_id":"cc7e1fec-efac-4ff4-a3b2-adb058bc0588","year":2024},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2411.10857","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:57884372e4f63d0ad175957e1ebf0b6daae2b87863f6b71b9afff330851ce712","observation_id":"33874f6e-19a6-4391-9b4f-7190cae0c23c","resolution":{"observed_at":"2026-05-10T14:10:29.696030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10857/citation-record","integrity":"/paper/2411.10857/integrity","json":"/paper/2411.10857/citation-record.json","paper":"/paper/2411.10857"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.532860Z","title":"Image Vis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.532860Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:d8aae82a47b1236d3bbe32c549cce4597e44c24f5e4217be50b07f2899a687bf","observation_id":"1f3392d2-8c5e-4d7a-9216-57c5e9528e4c","resolution":{"observed_at":"2026-08-12T19:15:40.532860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.549580Z","title":"IEEE Trans","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.549580Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:d6960fdbf0922bf0aa4100c8c22b99c84825c8f1fab71e1d153eeaec346db521","observation_id":"aa1d06bf-39d4-42ff-8b6a-2533e30cf3da","resolution":{"observed_at":"2026-08-12T19:15:40.549580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.554780Z","title":"In: IEEE International Geoscience and Remote Sensing Sympo sium, IGARSS 2021, Brussels, Belgium, July 11-16, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.554780Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:9de22021318eb9282ad12c3f174345615a7df6604831ab773f1a7f8559611c67","observation_id":"9f41fd64-645b-4226-9a2f-1d1417f8b1d8","resolution":{"observed_at":"2026-08-12T19:15:40.554780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.561378Z","title":"In: Proceedings of the 60th Annual Meeting o f the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.561378Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:57ce62b103a3251058dfb0cf02f1d898c5dd2f5a8fcdf0089b6df546189c24b0","observation_id":"2f6f588b-75b9-42b3-849c-718a2fb473aa","resolution":{"observed_at":"2026-08-12T19:15:40.561378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.796897Z","title":"In: Proceedings of the ACM Web Conference 2022","venue":null,"work_id":"cc489c68-70d2-4606-bedb-cbff2ca4447f","year":2022},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.568150Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:4b8742cfbd572005321529f5d3c224d46a5bd0187e94332576b6378a55143aea","observation_id":"79babbff-615a-4a05-8ffc-24a05b2a3897","resolution":{"observed_at":"2026-08-12T19:15:41.801977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12961","last_updated":"2023-03-24T21:50:03Z","snapshot_observed_at":"2026-08-13T12:18:49.838767Z","submitted_at":"2023-03-22T23:54:14Z","title":"The Shaky Foundations of Clinical Foundation Models: A Survey of Large Language Models and Foundation Models for EMRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12961","snapshot_observed_at":"2026-08-12T19:15:40.580703Z","title":"CoRR abs/2303.12961 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.580703Z"},"links":{"cited_paper":"/paper/2303.12961","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:99ed65b56ff4e0432aad7fb5362d3895d17f40471d28b4eb90cf4f968a059ce7","observation_id":"bb450e1c-19ad-475e-b533-85a8cc81287f","resolution":{"observed_at":"2026-08-12T19:15:40.580703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2404.11973","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.041098Z","title":"CoRR abs/2404.11973 (2024)","venue":null,"work_id":"8380e87d-5824-47d9-850c-9918ece36779","year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.587301Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:83c76b390e0014359083ca7384b7edde2ecb0b55b17f37d3fa55ff85ef9ca8b1","observation_id":"a8854943-0f7d-4bf4-b2e4-acfc86110aea","resolution":{"observed_at":"2026-08-12T19:15:41.049351Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14656","last_updated":"2024-07-23T13:56:42Z","snapshot_observed_at":"2026-08-13T04:34:18.772084Z","submitted_at":"2024-01-26T05:33:34Z","title":"Scientific Large Language Models: A Survey on Biological & Chemical Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14656","snapshot_observed_at":"2026-08-12T19:15:40.593638Z","title":"CoRR abs/2401.14656 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.593638Z"},"links":{"cited_paper":"/paper/2401.14656","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:5192ffc858f3cab8d61298cb754b1f1266a759c66a5a85fdd14574132c2c890f","observation_id":"5056ddb1-806d-40c6-96cc-9887b5378102","resolution":{"observed_at":"2026-08-12T19:15:40.593638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.604157Z","title":"In : Proceedings of the AAAI Conference on Artiﬁcial Intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.604157Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:24f64797351ec08bb9100aa3da72b4d1c0a480307209af543dd5300dd63c5b0d","observation_id":"2a6883dd-c2bf-4ab9-b4e0-79153cecedd6","resolution":{"observed_at":"2026-08-12T19:15:40.604157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.754374Z","title":"In: Findings of the Associ ation for Computational Linguistics: ACL 2023","venue":null,"work_id":"f03719f3-3ab8-499e-9082-a2a9732dcdfa","year":2023},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.609190Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:3c779a665cdcff2f0a58d01fd181c7a229dca3a897a056089bc20b88035c8721","observation_id":"d47662f8-eafb-4b9f-91ee-559e7f2c2c2e","resolution":{"observed_at":"2026-08-12T19:15:41.760225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.613313Z","title":"In: Pro- ceedings of the 2021 Conference of the North American Chapte r of the Associa- tion for Computational Linguistics: Human Language Techno logies","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.613313Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:574bd1705d6c240dc2fa37aee0b578644b291c3881be5364b07a72f2a5c02e56","observation_id":"b70f8835-6ebe-4972-afea-8ef361897850","resolution":{"observed_at":"2026-08-12T19:15:40.613313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08734","last_updated":"2023-11-15T06:54:44Z","snapshot_observed_at":"2026-08-13T05:25:02.121156Z","submitted_at":"2023-11-15T06:54:44Z","title":"Thread of Thought Unraveling Chaotic Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08734","snapshot_observed_at":"2026-08-12T19:15:40.622649Z","title":"arXiv preprint arXiv :2311.08734 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.622649Z"},"links":{"cited_paper":"/paper/2311.08734","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:8d3205ed8c7a1edd1aebd68cf9fcc26b556527c933762c1121f713d764670d2b","observation_id":"e409346d-9884-4a68-b64d-28ddc9eb0717","resolution":{"observed_at":"2026-08-12T19:15:40.622649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.634347Z","title":": Modeling event- pair relations in external knowledge graphs for script reas oning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.634347Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:2454568977fdd247dafdc1cf2ac904d8b91d0d26d5c2ad04252887edb681ce51","observation_id":"c2f31883-198e-4e9d-988b-9a195f0f0d4c","resolution":{"observed_at":"2026-08-12T19:15:40.634347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.646236Z","title":"In: Ku , L., Mar- tins, A., Srikumar, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.646236Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:295a5ae1381adb48010bbe3f14844e57da15caed69e01c553a85af6e192d21af","observation_id":"2cfb04ed-f8e3-477c-823d-48e2ea8a1c0a","resolution":{"observed_at":"2026-08-12T19:15:40.646236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.651845Z","title":"In: Proceedings of the 2023 4th Internationa l Symposium on Artiﬁ- cial Intelligence for Medicine Science, ISAIMS 2023, Cheng du, China, October 20- 22, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.651845Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:99a88e30152a27ad61ad22a695ad0cdaef474890c76595e42f8ee929e213e39a","observation_id":"fee9ed2b-8be5-44ec-ad54-401352e5998f","resolution":{"observed_at":"2026-08-12T19:15:40.651845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10936","last_updated":"2025-01-07T12:15:01Z","snapshot_observed_at":"2026-08-13T00:04:55.237846Z","submitted_at":"2024-05-17T17:47:39Z","title":"A Survey on Large Language Models with Multilingualism: Recent Advances and New Frontiers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10936","snapshot_observed_at":"2026-08-12T19:15:40.657250Z","title":", Liu, J., Xu, Y., Xu, J., Nie, J., Liu, Y.: A survey on large lan- guage models with multilingualism: Recent advances and new frontiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.657250Z"},"links":{"cited_paper":"/paper/2405.10936","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:86801b6d043d0111edb5223187b02251727aed860e3bdbf806c8ec3aa636697d","observation_id":"c2843fce-2d3e-478b-8e16-9ba930a03823","resolution":{"observed_at":"2026-08-12T19:15:40.657250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19732","last_updated":"2024-12-20T16:19:17Z","snapshot_observed_at":"2026-08-14T06:22:20.361501Z","submitted_at":"2024-10-25T17:59:09Z","title":"Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19732","snapshot_observed_at":"2026-08-12T19:15:40.667858Z","title":"arXiv preprin t arXiv:2410.19732 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.667858Z"},"links":{"cited_paper":"/paper/2410.19732","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:233b349480850b47f5c1dd525bc9a3eef71dfe185f5ab6d4732f9470f0199745","observation_id":"898c11e7-d1e0-423c-96cf-3fb4862ba31f","resolution":{"observed_at":"2026-08-12T19:15:40.667858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.675712Z","title":"In: Findings of the Association for Comput ational Linguistics, ACL 2024, Bangkok, Thailand and virtual meeting, August 11- 16, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.675712Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:76794a154deb2a73b1bb007ce480c56b5959b4410f9024cbbde0abe62c3c83d9","observation_id":"64ae5d9e-acbe-491c-a025-616281d8b40a","resolution":{"observed_at":"2026-08-12T19:15:40.675712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.707722Z","title":"In: Companion of the 2024 International Conference on Management of Data","venue":null,"work_id":"e71d09b8-0c06-4726-9a5c-860978c0dcf7","year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.689724Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:ea0b317c6ff52f88be9aa89ff6d4534c62d1c20d7291f7c95866e4fb382a4b98","observation_id":"6516d9bc-92b3-4aee-8b43-283e518c8853","resolution":{"observed_at":"2026-08-12T19:15:41.712458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.696388Z","title":", Khan, F.S.: Geochat: Grounded large vision-language model for re mote sens- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.696388Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:6efbc01d5298fdf58b0f19cf394149a8894438ee53329af69b03c44fdb571951","observation_id":"25393ad4-cf20-4bb0-a536-2d41c767c878","resolution":{"observed_at":"2026-08-12T19:15:40.696388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09712","last_updated":"2024-01-18T04:10:20Z","snapshot_observed_at":"2026-08-13T04:40:10.480486Z","submitted_at":"2024-01-18T04:10:20Z","title":"SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09712","snapshot_observed_at":"2026-08-12T19:15:40.701608Z","title":"L VLMs for Remote Sensing VQA 13 CoRR abs/2401.09712 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.701608Z"},"links":{"cited_paper":"/paper/2401.09712","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:c6723641d58e6cf6a2cfd3515278fb23ab3fb84d43dff40d6bdb3aa3a7fcd658","observation_id":"6efbb717-2a0f-41b5-8797-a665923bc8ce","resolution":{"observed_at":"2026-08-12T19:15:40.701608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.690280Z","title":"ISPRS Journal o f Photogrammetry and Remote Sensing 184, 116–130 (2022)","venue":null,"work_id":"ce301151-c05b-4f65-887f-94558836db3b","year":2022},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.707127Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:7872b028fc7c0f552f58798f6b745bee2dc23509e1f4e040483bd915213b8ffc","observation_id":"d9c6ae98-6004-4442-9aac-9d0eb1d9b746","resolution":{"observed_at":"2026-08-12T19:15:41.696451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.712245Z","title":"IEEE Trans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.712245Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:9162c91205d9e48eb856027995be6f21356eb4cc535f06e3f056c91eb0878d99","observation_id":"8afd1e22-fd6d-4a20-99de-c81e714aba46","resolution":{"observed_at":"2026-08-12T19:15:40.712245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.716739Z","title":"In: Wooldridge, M.J., Dy, J.G., Natarajan, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.716739Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:aaf9648dcc4de30d6cf829d5761c7f1ff26bc48c1fa45134fc770b06778638e9","observation_id":"a27ae30b-cfbf-4f10-9095-b82b664b17a0","resolution":{"observed_at":"2026-08-12T19:15:40.716739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20213","last_updated":"2024-12-19T13:46:40Z","snapshot_observed_at":"2026-08-13T00:42:14.577442Z","submitted_at":"2024-03-29T14:50:43Z","title":"VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20213","snapshot_observed_at":"2026-08-12T19:15:40.721915Z","title":"C oRR abs/2403.20213 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.721915Z"},"links":{"cited_paper":"/paper/2403.20213","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:1b16b4aa4081d436921a0b52ad399282eebc03ce09354fd286763859e0acc2e1","observation_id":"1b0766c5-dfac-4e36-8aae-06d285a67953","resolution":{"observed_at":"2026-08-12T19:15:40.721915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.659821Z","title":"In: The Twelfth International Conference o n Learning Repre- sentations, ICLR 2024, Vienna, Austria, May 7-11, 2024","venue":null,"work_id":"e70cd34e-c35e-4b59-8d9f-eae5e910104b","year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.727563Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:4f4c14bc74e778303684cbe1ca1c96b8a16c0856f776ea00983f9696e2bf6c30","observation_id":"52cade4b-717e-4235-9cd4-4840347e53bf","resolution":{"observed_at":"2026-08-12T19:15:41.668694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15266","last_updated":"2023-07-28T02:23:35Z","snapshot_observed_at":"2026-08-13T10:45:48.484753Z","submitted_at":"2023-07-28T02:23:35Z","title":"RSGPT: A Remote Sensing Vision Language Model and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15266","snapshot_observed_at":"2026-08-12T19:15:40.732785Z","title":"CoRR abs/2307.15266 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.732785Z"},"links":{"cited_paper":"/paper/2307.15266","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:9d1350043e1c6ff757287b1dbb4d6eb6d4abcfe3527025a40cf294cc57074414","observation_id":"8f5e3d6f-4ffe-41f9-8388-d5f0bf429695","resolution":{"observed_at":"2026-08-12T19:15:40.732785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06475","last_updated":"2024-02-09T15:31:01Z","snapshot_observed_at":"2026-08-13T04:22:30.692524Z","submitted_at":"2024-02-09T15:31:01Z","title":"Large Language Models for Captioning and Retrieving Remote Sensing Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06475","snapshot_observed_at":"2026-08-12T19:15:40.738353Z","title":"CoRR abs/2402.06475 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.738353Z"},"links":{"cited_paper":"/paper/2402.06475","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:be398d9b26686de9d1dcc01eb051aeca2b3c893f11f4c9050bf72a42d4be033e","observation_id":"f13c5ab6-8c04-4339-9d0c-2056a4f7e859","resolution":{"observed_at":"2026-08-12T19:15:40.738353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T06:30:46.439715Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2411.10857."}