{"as_of":"2026-08-14T16:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d04c1859d6784982440e01c2f0d9288ccf2df7825af904c25110829f3804fde","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:14:30.169777Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T20:58:23.547519Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"cited_work":{"arxiv_id":"2502.08168","doi":"10.48550/arxiv.2502.08168","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08168","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sarchat-bench-2m: A multi-task vision-language benchmark for sar image inter- pretation","venue":"ArXiv.org","work_id":"8149248a-6341-443e-b91b-f281ff740e08","year":2025},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-08-08T09:11:43Z","snapshot_observed_at":"2026-08-13T23:10:57.904790Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"cited_paper":"/paper/2502.08168","citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:1b8092da0a0b40f1060696495f75c9b776847d87c76e489e8923dcc61b8d829b","observation_id":"672ac5de-67e8-4e57-9766-4edc52e0a402","resolution":{"observed_at":"2026-05-21T21:00:39.059323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"cited_work":{"arxiv_id":"2502.08168","doi":"10.48550/arxiv.2502.08168","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08168","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sarchat-bench-2m: A multi-task vision-language benchmark for sar image inter- pretation","venue":"ArXiv.org","work_id":"8149248a-6341-443e-b91b-f281ff740e08","year":2025},"citing_paper":{"arxiv_id":"2604.10591","last_updated":"2026-04-12T11:47:11Z","snapshot_observed_at":"2026-08-12T07:28:11.685251Z","submitted_at":"2026-04-12T11:47:11Z","title":"GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:55.294813Z"},"links":{"cited_paper":"/paper/2502.08168","citing_paper":"/paper/2604.10591"},"observation_digest":"sha256:ab3c9264482b646f538027fe17d281290ae2b355c448a2933df4e67a8ce9ac00","observation_id":"98bebf92-e949-40c0-b173-f2d882dee9a3","resolution":{"observed_at":"2026-05-11T10:56:01.624358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"cited_work":{"arxiv_id":"2502.08168","doi":"10.48550/arxiv.2502.08168","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08168","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sarchat-bench-2m: A multi-task vision-language benchmark for sar image inter- pretation","venue":"ArXiv.org","work_id":"8149248a-6341-443e-b91b-f281ff740e08","year":2025},"citing_paper":{"arxiv_id":"2605.10739","last_updated":"2026-05-11T15:42:09Z","snapshot_observed_at":"2026-08-13T05:14:55.607606Z","submitted_at":"2026-05-11T15:42:09Z","title":"Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:31.231685Z"},"links":{"cited_paper":"/paper/2502.08168","citing_paper":"/paper/2605.10739"},"observation_digest":"sha256:721754db0672048b2a94994a1054daf1033a37113a0d78847d17468425dc2526","observation_id":"e0e82b1d-07ee-4056-93bb-e9ba319d6416","resolution":{"observed_at":"2026-05-12T04:36:21.065867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08168/citation-record","integrity":"/paper/2502.08168/integrity","json":"/paper/2502.08168/citation-record.json","paper":"/paper/2502.08168"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-08T10:14:30.157778Z","title":"arXiv preprint arXiv:2403.04652","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.157778Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:0d2f1099392d70be9f19f961bf58ecee9ade0fee8d552d8fff91588eedda8c17","observation_id":"2a472a32-422a-491b-89b2-53790077e6c2","resolution":{"observed_at":"2026-08-08T10:14:30.157778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-08T10:14:30.118925Z","title":"arXiv preprint arXiv:2412.05271","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.118925Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:55044843d948ba8e6bceaf20debcc288b7037206244dea9dd59386b57085c786","observation_id":"3e497a2f-7f7b-4020-a666-7df7f524aa32","resolution":{"observed_at":"2026-08-08T10:14:30.118925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-08T10:14:30.130625Z","title":"arXiv preprint arXiv:2406.12793","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.130625Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:c462c8eeea92cf8e720e83979c97eaaf7d471e0b1a614dc6a9e78246103980ba","observation_id":"5e269828-1cae-4364-b35a-ebeea271ab05","resolution":{"observed_at":"2026-08-08T10:14:30.130625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15266","last_updated":"2023-07-28T02:23:35Z","snapshot_observed_at":"2026-08-13T10:45:48.484753Z","submitted_at":"2023-07-28T02:23:35Z","title":"RSGPT: A Remote Sensing Vision Language Model and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15266","snapshot_observed_at":"2026-08-08T10:14:30.133950Z","title":"arXiv preprint arXiv:2307.15266","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.133950Z"},"links":{"cited_paper":"/paper/2307.15266","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:a8f2a40c9565e9a002b9d299f75fb5e123d2e887c5f964e1092eeda2589983b3","observation_id":"52a68107-ddfe-483d-9ca3-3aee66aa6a90","resolution":{"observed_at":"2026-08-08T10:14:30.133950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-08T10:14:30.137851Z","title":"Preprint, arXiv:2403.05525","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.137851Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:5218d58a79999dafe528462f60d657c135fe08ed81758dd06e0456d89b86860a","observation_id":"bf1cb526-116f-46d0-a352-9599ec24b3ae","resolution":{"observed_at":"2026-08-08T10:14:30.137851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-08T10:14:30.149597Z","title":"arXiv preprint arXiv:2409.12191","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.149597Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:56f3c1940b4ef50c0be759998d04e251fa3e81c9e3bca18c221e4d96e5cd8bb1","observation_id":"67a22757-eed6-407a-85d8-4345e6b663af","resolution":{"observed_at":"2026-08-08T10:14:30.149597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-14T09:06:05.525723Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-08T10:14:30.153670Z","title":"arXiv preprint arXiv:2408.04840","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.153670Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:ebf356b97577b74b2fd89007234bbdc3f5f19d96bf5827d14eb0c93f14f86df9","observation_id":"c56a11df-3d31-45c9-b7a8-d6a96129c54f","resolution":{"observed_at":"2026-08-08T10:14:30.153670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11300","last_updated":"2024-01-02T14:18:02Z","snapshot_observed_at":"2026-08-14T03:27:32.608371Z","submitted_at":"2023-06-20T05:30:59Z","title":"RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11300","snapshot_observed_at":"2026-08-08T10:14:30.165818Z","title":"arXiv preprint arXiv:2306.11300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.165818Z"},"links":{"cited_paper":"/paper/2306.11300","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:f46eb3cbfb0bf80e26e93e57610d9c0f5edaa52fcce62f56455e84782e3d7566","observation_id":"fa0362de-a22c-4cf2-ae12-87a6f824ef4f","resolution":{"observed_at":"2026-08-08T10:14:30.165818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05517","last_updated":"2025-05-19T06:50:53Z","snapshot_observed_at":"2026-08-13T01:59:11.269836Z","submitted_at":"2024-08-10T11:00:13Z","title":"SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05517","snapshot_observed_at":"2026-08-08T10:14:30.169777Z","title":"Preprint, arXiv:2408.05517","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.169777Z"},"links":{"cited_paper":"/paper/2408.05517","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:38fe744d161ebe2ce2a2e60334117d0c1ccd718d3384aad66bea28ef9491d4fb","observation_id":"45149a5f-0920-4de7-8168-ae75e20d095f","resolution":{"observed_at":"2026-08-08T10:14:30.169777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:14:30.353714Z","title":"IEEE Transactions on Geoscience and Remote Sensing , 56(4):2183–2195","venue":null,"work_id":"4d6047b0-e334-4e25-997d-a1cb9538f886","year":2016},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.142157Z"},"links":{"citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:a2f94c7e22d401706cea66906ac4122a53cb72fd4e96ce312ff7b114b5ad0f13","observation_id":"e33d852e-39d9-48f9-bb7c-82ad09036460","resolution":{"observed_at":"2026-08-08T10:14:30.356652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:14:30.341716Z","title":"In IGARSS 2019-2019 IEEE International 10 Geoscience and Remote Sensing Symposium , pages 5901–5904","venue":null,"work_id":"58936e5f-4ce7-407c-9173-898c0a1ce380","year":2019},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.145906Z"},"links":{"citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:4e4af20754487ef57c05316c9da2a25c185651b2c9f3b8497bda3becff9e9848","observation_id":"39b29885-43f7-452f-868f-85a333a61aac","resolution":{"observed_at":"2026-08-08T10:14:30.347355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-08T10:14:30.126970Z","title":"arXiv preprint arXiv:2010.11929","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.126970Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:7669ba14adbe78f489f8301d7a73b1762895aff2db90e797b30ccb995a59b254","observation_id":"fd4068d0-53de-4ff9-a3e8-b0ac711a94d9","resolution":{"observed_at":"2026-08-08T10:14:30.126970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09868","last_updated":"2022-04-21T03:53:19Z","snapshot_observed_at":"2026-08-13T15:58:36.584747Z","submitted_at":"2022-04-21T03:53:19Z","title":"Exploring a Fine-Grained Multiscale Method for Cross-Modal Remote Sensing Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09868","snapshot_observed_at":"2026-08-08T10:14:30.161567Z","title":"arXiv preprint arXiv:2204.09868","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.161567Z"},"links":{"cited_paper":"/paper/2204.09868","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:cfc7e19e9c0c51d59aef43f9a19b8ef122d5d21fd62a460c3cdb44f74b894a6f","observation_id":"8827234e-7c7a-47e6-abe5-f09d1766d56f","resolution":{"observed_at":"2026-08-08T10:14:30.161567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-08T10:14:30.122842Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.122842Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:f3bb371190503ec4628298ea02692699caae1770be82db5b252438e381194150","observation_id":"1d55e7eb-66a4-45eb-8041-384b439028c7","resolution":{"observed_at":"2026-08-08T10:14:30.122842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-08T10:14:30.114591Z","title":"arXiv preprint arXiv:2404.14219","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.114591Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:0a72873b8be9ec90177675a05e6168f57d436d3cde78b1bbcd74a04faa195f2f","observation_id":"4235af41-ea2d-4c23-a5dd-ae0a38b34f70","resolution":{"observed_at":"2026-08-08T10:14:30.114591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T17:02:19.105513Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 3 inbound Pith citation observations for arXiv:2502.08168."}