{"as_of":"2026-08-15T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ac64f8f1f7bd5e7c51f1f1a0f1cfc5bafbb37c0a4be72643102498b1d3a90d1","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:53:49.353753Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:09:55.854741Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T00:48:24.793323Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-08-07T13:09:55.854741Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:55.854741Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:937f489e956b3fed6a48c015485e7b039a9346598cd538557ee3fb323eb8d354","observation_id":"af11f5c5-d302-4dc7-a9f3-23d3a0e51e42","resolution":{"observed_at":"2026-08-07T13:09:55.854741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-08-06T19:21:13.258836Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05887","last_updated":"2025-07-18T12:41:26Z","snapshot_observed_at":"2026-08-07T20:54:26.650929Z","submitted_at":"2025-07-08T11:21:03Z","title":"GeoMag: A Vision-Language Model for Pixel-level Fine-Grained Remote Sensing Image Parsing","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:13.258836Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2507.05887"},"observation_digest":"sha256:d75940c6eb451cd8f31abbf85ba3b7f076b1cabaa3268519a841a6305a4623db","observation_id":"834d3338-f0eb-4b07-8389-c1ba5296fd3f","resolution":{"observed_at":"2026-08-06T19:21:13.258836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":"2501.06828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geopix: Multi-modal large language model for pixel-level image understanding in remote sensing.CoRR, abs/2501.06828","venue":null,"work_id":"5f65582c-66bb-466f-84ff-a42105b31a81","year":2025},"citing_paper":{"arxiv_id":"2603.21783","last_updated":"2026-08-13T08:49:59Z","snapshot_observed_at":"2026-08-15T06:14:48.625670Z","submitted_at":"2026-03-23T10:25:45Z","title":"SHARP: Spectrum-aware Highly-dynamic Adaptation for Resolution Promotion in Remote Sensing Synthesis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T00:46:34.777585Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2603.21783"},"observation_digest":"sha256:3293a6fb229771087862db08614621c466d45a8864daaf6048f97fdac275926c","observation_id":"73294226-ce04-4cd9-bb65-ad36eefdba9f","resolution":{"observed_at":"2026-05-15T00:48:24.795113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-07-14T20:17:28.243545Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.21783","last_updated":"2026-08-13T08:49:59Z","snapshot_observed_at":"2026-08-15T06:14:48.625670Z","submitted_at":"2026-03-23T10:25:45Z","title":"SHARP: Spectrum-aware Highly-dynamic Adaptation for Resolution Promotion in Remote Sensing Synthesis","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T20:17:28.243545Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2603.21783"},"observation_digest":"sha256:96deb8b6dd9076846de31963783e2ef9212ce3aa35a9ba5212baaa9ce07393c4","observation_id":"a421a2c2-4c4e-42fe-bacb-e066eecb8672","resolution":{"observed_at":"2026-07-14T20:17:28.243545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":"2501.06828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geopix: Multi-modal large language model for pixel-level image understanding in remote sensing.CoRR, abs/2501.06828","venue":null,"work_id":"5f65582c-66bb-466f-84ff-a42105b31a81","year":2025},"citing_paper":{"arxiv_id":"2604.15670","last_updated":"2026-07-24T04:48:23Z","snapshot_observed_at":"2026-08-14T16:26:32.722947Z","submitted_at":"2026-04-17T03:48:56Z","title":"PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T09:20:54.635375Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2604.15670"},"observation_digest":"sha256:d5a1caa064c35d73ac0a91457b26b5f3b49ecf657524f685f616b7a320f36b29","observation_id":"6f3903d3-6baa-450f-87e1-bcfa7ce2f8bd","resolution":{"observed_at":"2026-05-10T09:23:37.112891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-08-02T16:10:02.323102Z","title":"Geopix: Multi-modal large language model for pixel-level image understanding in remote sensing.CoRR, abs/2501.06828, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.15670","last_updated":"2026-07-24T04:48:23Z","snapshot_observed_at":"2026-08-14T16:26:32.722947Z","submitted_at":"2026-04-17T03:48:56Z","title":"PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T16:10:02.323102Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2604.15670"},"observation_digest":"sha256:04dd5ccf0e12c3f5d5fb9ff4ba4b8d30d75b35fbf5ff79c1c576c6eac2ee8ae3","observation_id":"6b1db3a5-69b2-4226-ab85-d9179c01d41b","resolution":{"observed_at":"2026-08-02T16:10:02.323102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-07-14T14:09:30.395518Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10120","last_updated":"2026-07-11T04:56:27Z","snapshot_observed_at":"2026-08-14T16:05:42.515947Z","submitted_at":"2026-07-11T04:56:27Z","title":"WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T14:09:30.395518Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2607.10120"},"observation_digest":"sha256:2932d6cccefda1a54558ad271647692ffc9d94df93a42441474e15579ae090ec","observation_id":"1b903af9-48f8-45b4-8a74-25804925781b","resolution":{"observed_at":"2026-07-14T14:09:30.395518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.06828/citation-record","integrity":"/paper/2501.06828/integrity","json":"/paper/2501.06828/citation-record.json","paper":"/paper/2501.06828"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.15266","last_updated":"2023-07-28T02:23:35Z","snapshot_observed_at":"2026-08-13T10:45:48.484753Z","submitted_at":"2023-07-28T02:23:35Z","title":"RSGPT: A Remote Sensing Vision Language Model and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15266","snapshot_observed_at":"2026-08-10T20:53:47.960477Z","title":"Rsgpt: A remote sensing vision language model and benchmark,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:47.960477Z"},"links":{"cited_paper":"/paper/2307.15266","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:b20455aff193213250b0be6e5f7be64c0ee03ff249ccf5b5ca2eab55b38a6cd9","observation_id":"b57f24db-3cc5-4524-b60a-e8a3273e966d","resolution":{"observed_at":"2026-08-10T20:53:47.960477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.398674Z","title":"Geochat: Grounded large vision- language model for remote sensing,","venue":null,"work_id":"771d0285-98dc-475a-a077-6203fd9f3fc8","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.024344Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:d75dddecc6739cf28cc372b7255f545c8680254ff8655f967ebc7f8cba4e42e8","observation_id":"479916e7-27cf-4b1e-82f4-0518bc6bb86e","resolution":{"observed_at":"2026-08-10T20:53:50.402256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09712","last_updated":"2024-01-18T04:10:20Z","snapshot_observed_at":"2026-08-14T11:49:31.937716Z","submitted_at":"2024-01-18T04:10:20Z","title":"SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09712","snapshot_observed_at":"2026-08-10T20:53:48.029329Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.029329Z"},"links":{"cited_paper":"/paper/2401.09712","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:49afc724e3b283e61d1cc3b39f2206d445559d57dce2721731392eac1288c999","observation_id":"c4737594-d29f-47d6-881d-6c84d4b989a5","resolution":{"observed_at":"2026-08-10T20:53:48.029329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.388481Z","title":"Earthgpt: A universal multi-modal large language model for multi-sensor image comprehension in remote sensing domain,","venue":null,"work_id":"c919ecc4-9a92-4024-95b0-0e38dcbbcfe0","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.034921Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:fff45f1ec7131b3f14da08f84489ae4a6c6485dcc58111cf3e67aac0f8487310","observation_id":"e517ff45-b20f-4bf6-8563-74498db1a163","resolution":{"observed_at":"2026-08-10T20:53:50.392167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.378407Z","title":"Bb-geogpt: A framework for learning a large language model for ge- ographic information science,","venue":null,"work_id":"d575e695-580e-4d4e-857a-fc7fe415a904","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.039512Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:55df4b4e8dcbb73e558f593c7038e9d46df0132ba8c8efe0ee8959d7acce2531","observation_id":"74407812-8a35-4aae-8fe8-744d5b6b82ba","resolution":{"observed_at":"2026-08-10T20:53:50.382002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02544","last_updated":"2024-07-16T01:40:34Z","snapshot_observed_at":"2026-08-13T04:27:18.680428Z","submitted_at":"2024-02-04T15:46:43Z","title":"LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02544","snapshot_observed_at":"2026-08-10T20:53:48.124779Z","title":"Lhrs- bot: Empowering remote sensing with vgi-enhanced large multimodal language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.124779Z"},"links":{"cited_paper":"/paper/2402.02544","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:b7efb4c533a03a5b56b4f128ac5d90b6f6196c05d70065fe3420e0fc9fe597df","observation_id":"d87e0878-d02d-47c0-82e8-3265553242e3","resolution":{"observed_at":"2026-08-10T20:53:48.124779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.370350Z","title":"Mtp: Advancing remote sensing foundation model via multi-task pre- training,","venue":null,"work_id":"a79a625f-4b94-4caa-95d1-4a1f18b97bdc","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.225842Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:9da0f6c9998542aad07fe6dc8d3d59b8ff0317955e0201b6939f3cc35826b5c7","observation_id":"2db5c505-469c-4d4a-8d02-c746e5aa3b60","resolution":{"observed_at":"2026-08-10T20:53:50.373021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-08-12T23:42:36.797128Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-10T20:53:48.229191Z","title":"Skysensegpt: A fine- grained instruction tuning dataset and model for remote sensing vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.229191Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:29bdf74fa3e5398d0b9f8f32be021dff993ed1675551a58fe484abda733508bd","observation_id":"ed8fa80b-baed-4c4e-bb80-6eaef91a6e75","resolution":{"observed_at":"2026-08-10T20:53:48.229191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06234","last_updated":"2025-01-27T01:45:15Z","snapshot_observed_at":"2026-08-12T22:27:57.483365Z","submitted_at":"2024-10-08T17:45:51Z","title":"TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06234","snapshot_observed_at":"2026-08-10T20:53:48.233807Z","title":"Teochat: A large vision-language assistant for temporal earth obser- vation data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.233807Z"},"links":{"cited_paper":"/paper/2410.06234","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:a6416e4c942a601197b947e74f9680df240b4be935decb487615568aeffe0bc9","observation_id":"b4ed543d-7b2f-49b6-8fd0-eaf5c210dcdf","resolution":{"observed_at":"2026-08-10T20:53:48.233807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.361305Z","title":"Earthmarker: A visual prompting multi-modal large language model for remote sensing,","venue":null,"work_id":"dfa2aa95-a9ff-4295-8485-1af9f4f7fae6","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.239203Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:372e2990d27649b83d7ba89aabdbace15a9ad60cae643b212696f6ea532c9885","observation_id":"44b65459-5320-461b-bf2a-5d9080062463","resolution":{"observed_at":"2026-08-10T20:53:50.365058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:48.243234Z","title":"Rsvg: Exploring data and models for visual grounding on remote sensing data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.243234Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:da6afe699467c4312d561a9461fa4745f8c1f0a66fbf79bba8f8fe6143b31bc6","observation_id":"fbd223b6-275f-4767-b043-163aaa67b744","resolution":{"observed_at":"2026-08-10T20:53:48.243234Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.352770Z","title":"Samrs: Scaling- up remote sensing segmentation dataset with segment anything model,","venue":null,"work_id":"78850e1b-04d5-4ca1-88a7-6dc674d5993e","year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.247566Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:636c0940318ffffc24523be2a0391892c3e5b9d33c2c26b442bfa1cb297b88d9","observation_id":"74e8ace1-bf93-4ecc-9ce8-3337ffa99726","resolution":{"observed_at":"2026-08-10T20:53:50.355995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.343479Z","title":"Rrsis: Referring remote sensing image segmentation,","venue":null,"work_id":"d0432099-ce54-499e-a900-f9a8c52a6714","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.251055Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:05097acf8efa657324c7b0f709ae689718dbd210b1600b3e0cf3914f7dd455f8","observation_id":"676270de-e63e-4f45-8e34-f2115e1e0a37","resolution":{"observed_at":"2026-08-10T20:53:50.347108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12470","last_updated":"2024-04-02T05:37:25Z","snapshot_observed_at":"2026-08-13T04:58:50.714870Z","submitted_at":"2023-12-19T08:14:14Z","title":"Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation","version":3},"cited_work":{"arxiv_id":"2312.12470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.12470","snapshot_observed_at":"2026-08-10T20:53:49.952591Z","title":"Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation","venue":"cs.CV","work_id":"0edea39a-ffd7-4a79-83c8-fefb5ac009fe","year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.254286Z"},"links":{"cited_paper":"/paper/2312.12470","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:654d62894c0497d0704788a5921a5e8c9b8749747638da9f398317cd014eeddb","observation_id":"0a0d5c78-5d9e-465f-a00d-8f79f4e83ca6","resolution":{"observed_at":"2026-08-10T20:53:50.015691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12384","last_updated":"2024-11-11T17:25:20Z","snapshot_observed_at":"2026-08-14T09:28:57.175608Z","submitted_at":"2024-06-18T08:15:21Z","title":"VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12384","snapshot_observed_at":"2026-08-10T20:53:48.302408Z","title":"Vrsbench: A versatile vision-language benchmark dataset for remote sensing image understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.302408Z"},"links":{"cited_paper":"/paper/2406.12384","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:be8eff6116c1b9e4c4362ec84329b686f1e2645fe2a0fc6de4296210dc99490c","observation_id":"e286015a-c9ee-4903-94b0-ece529454917","resolution":{"observed_at":"2026-08-10T20:53:48.302408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.331892Z","title":null,"venue":null,"work_id":"08d6cf46-4ca6-41fd-b3ad-47f6a4e0257c","year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.371796Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:f6f3d5b8ceb580f044ad27f27033d9c5806705c7361db9603b51f53157f2fb58","observation_id":"e734e1a0-b2b5-494a-b871-5c8184f1f067","resolution":{"observed_at":"2026-08-10T20:53:50.336893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.321768Z","title":null,"venue":null,"work_id":"f534606f-df60-4dad-81c9-5bedf7ed4009","year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.375743Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:c2aaa731b8758dc00dfac5eaf392c9270dbe0e315fb7a8b09d869f1966d74f88","observation_id":"23036da1-0560-4222-9955-73812f1a3d9f","resolution":{"observed_at":"2026-08-10T20:53:50.325240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.312901Z","title":null,"venue":null,"work_id":"f231b707-4cb3-4f47-ad67-b846c6dee266","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.380182Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:4498e303859359f70369c3f8dac679f0b64c4e05f50244ac82bd9af6a49b7977","observation_id":"132a4d93-a91a-4b8d-bbd1-c496dcbb6acd","resolution":{"observed_at":"2026-08-10T20:53:50.316077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T20:53:48.385169Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.385169Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:59bf14a14c2cf0f7b6566d21fbeb35832120500ed9682bbed626ccedba1dc2e9","observation_id":"60e82997-5cfc-43bd-a2fe-72a5345fbd19","resolution":{"observed_at":"2026-08-10T20:53:48.385169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-10T20:53:48.389986Z","title":"Minigpt-v2: Large lan- guage model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.389986Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:bbac89f2ec10886a60ff208ea91c7e1a12689b41d87e2a9625cfe1a02b9bc378","observation_id":"72c10116-e0cb-43bf-af8a-f827f1acfd0d","resolution":{"observed_at":"2026-08-10T20:53:48.389986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T20:53:48.394343Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.394343Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:1debe7cdcf857d3d1b9d6ebe6e872e7b4fcc4874e9d6e45f324b9b206a88a28c","observation_id":"9f5833d6-7dd0-4bd2-9e0e-1dafa976c291","resolution":{"observed_at":"2026-08-10T20:53:48.394343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T20:53:48.427182Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.427182Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:8bd0c06f4b6718ae91f0565d1b7c5540e4bba7b7e484229f8d699510b6a729ac","observation_id":"2ad8e6e5-a33a-4a77-a1b2-694f80493fcc","resolution":{"observed_at":"2026-08-10T20:53:48.427182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-10T20:53:48.493042Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.493042Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:299b601060e0cc2d785821dce3d73dd02b58c7fba6f935e34517c841a867e9c4","observation_id":"d2218fbd-ede2-4ba3-9b6f-0d325e5b5a67","resolution":{"observed_at":"2026-08-10T20:53:48.493042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-10T20:53:48.528819Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.528819Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:c59839119f41515bbea9cb0adb247604bb00fcc3346d47baee497065c8a0d6d1","observation_id":"4f6c3bab-f864-42f2-bede-2d92b567c5dd","resolution":{"observed_at":"2026-08-10T20:53:48.528819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-10T20:53:48.533532Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.533532Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:cfac5b284ee8f6b9dd4fa536831d4929b034da44387493376f8fc6f2f1644e00","observation_id":"ed754b60-189c-4733-bfe6-b64d3a37e722","resolution":{"observed_at":"2026-08-10T20:53:48.533532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05662","last_updated":"2023-06-02T16:19:48Z","snapshot_observed_at":"2026-08-14T04:59:13.217854Z","submitted_at":"2023-05-09T17:58:34Z","title":"InternGPT: Solving Vision-Centric Tasks by Interacting with ChatGPT Beyond Language","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05662","snapshot_observed_at":"2026-08-10T20:53:48.539652Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.539652Z"},"links":{"cited_paper":"/paper/2305.05662","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:df1044fb9459525fae87a114a96d2cfb3adef7271c0e14e9b2f99b225329a2fc","observation_id":"ddc7b7af-d2c7-45dc-a28a-874ae8c0d7c1","resolution":{"observed_at":"2026-08-10T20:53:48.539652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-10T20:53:48.544572Z","title":"Zhang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.544572Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:6e31d5cab5aa939d99ac0e7b28cf45a33bdc1562982eac71b17ebb94b3ccba46","observation_id":"6a71dd86-2518-4f1c-b76f-f687a36fbd61","resolution":{"observed_at":"2026-08-10T20:53:48.544572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-10T20:53:48.548802Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.548802Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:6a59856e457cfc3670acd55b0b589d49404c8a92460c141252d4db0c7629f824","observation_id":"57de04f7-f32d-42a0-82ae-abf953042751","resolution":{"observed_at":"2026-08-10T20:53:48.548802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-10T20:53:48.552690Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.552690Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:fdd105444df98486f206d5dec9f851c6b5a54d50bc72905b3bcc2486e7684c80","observation_id":"b1f5dab7-0915-4a14-8676-0d8951c142fe","resolution":{"observed_at":"2026-08-10T20:53:48.552690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-10T20:53:48.556327Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.556327Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:d0eb975ffda6ebbf111bcf6d518be93716a949ece5d8289c96990309ddbc04b9","observation_id":"ad57b2d2-6bb5-4359-90fd-37aa725ec24e","resolution":{"observed_at":"2026-08-10T20:53:48.556327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02228","last_updated":"2024-07-18T07:18:36Z","snapshot_observed_at":"2026-08-13T05:10:47.115897Z","submitted_at":"2023-12-04T03:05:59Z","title":"PixelLM: Pixel Reasoning with Large Multimodal Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02228","snapshot_observed_at":"2026-08-10T20:53:48.653877Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.653877Z"},"links":{"cited_paper":"/paper/2312.02228","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:d27fab7be20fbb04ae3218065fa4d2415142d85d191b94d7bb3ac1d2a03295ef","observation_id":"86681f54-61b8-4a88-a6f5-273f4ef7fc9f","resolution":{"observed_at":"2026-08-10T20:53:48.653877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13925","last_updated":"2025-01-23T18:59:30Z","snapshot_observed_at":"2026-08-15T03:53:36.276667Z","submitted_at":"2025-01-23T18:59:30Z","title":"GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13925","snapshot_observed_at":"2026-08-10T20:53:48.729794Z","title":"Shabbir, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.729794Z"},"links":{"cited_paper":"/paper/2501.13925","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:b54da043fbc3101d10b6bce3ea7f88c515252a2a11223060cfc2abca6098845e","observation_id":"fac7f3f5-a830-40fd-8a84-133276b70349","resolution":{"observed_at":"2026-08-10T20:53:48.729794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.302351Z","title":"Object detection in optical remote sensing images: A 13 survey and a new benchmark,","venue":null,"work_id":"004d33af-b26c-49cd-8b99-0f1dd67bfac1","year":2020},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.733812Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:8c88697bcef28694109a2622ac5b13c68721fb1c7d374ec000a50fc5e0702d8f","observation_id":"a59bfb6a-f2d4-4226-9d05-6de0780ababb","resolution":{"observed_at":"2026-08-10T20:53:50.306212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.292176Z","title":"Object detection in aerial images: A large-scale benchmark and challenges,","venue":null,"work_id":"853624c1-91a1-4bcc-bbde-3030fcfa51c4","year":2021},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.844459Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:7a07ec6b80fd2152eb306b71aabe9be91d6bdf2bcd1530ed05be1a385b15cc71","observation_id":"69fb0bfc-0a14-469f-b565-175e31227b04","resolution":{"observed_at":"2026-08-10T20:53:50.295806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:48.915827Z","title":"Fair1m: A bench- mark dataset for fine-grained object recognition in high- resolution remote sensing imagery,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.915827Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:343603c2628daf29f780b1f674bb88b8d33ac7f3f84bbad59cea739472e8e065","observation_id":"c07902bd-c878-46fc-8958-fed9ce27a3a1","resolution":{"observed_at":"2026-08-10T20:53:48.915827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.26859","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:49.685226Z","title":"Aid: A benchmark data set for performance evaluation of aerial scene classification,","venue":null,"work_id":"4a965c01-bdef-4321-b85a-866e06c2b3ed","year":2017},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.920809Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:018aad806b1973cc73826e448c4083c59b604e27a0978d629a9693d82c9bd729","observation_id":"74699657-9a64-4fbe-815b-0bff53a95b28","resolution":{"observed_at":"2026-08-10T20:53:49.755682Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:48.924161Z","title":"Nwpu-crowd: A large-scale benchmark for crowd counting and lo- calization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.924161Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:4c8d414a9e025cb988d7335db8c1b9e2d7b3b924f77a0d442ca79d0aea95163c","observation_id":"276bb595-2037-4757-a1ea-05da2a137c85","resolution":{"observed_at":"2026-08-10T20:53:48.924161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.282205Z","title":"Eu- rosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":"34159237-5b8d-4b1b-b31c-a699867cadca","year":2019},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.929800Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:cfc821317709a2ce76e2cc25bcd4995ff6cb5954cc287c89697525313f51053b","observation_id":"5cc974fa-04de-4841-94af-f937cc7041a8","resolution":{"observed_at":"2026-08-10T20:53:50.286416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.271914Z","title":"Rsvqa: Visual question answering for remote sensing data,","venue":null,"work_id":"0a6fd674-036b-48d0-8d78-3ca423244fd2","year":2020},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.934859Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:2164adf46a8d77147b5505f2d94a6060b5a0adb0b3b9227cb3d9f6044c04a6c7","observation_id":"f6f8f5c1-212f-41f0-bf55-3d951d630960","resolution":{"observed_at":"2026-08-10T20:53:50.275459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.06760","last_updated":"2017-02-22T11:37:49Z","snapshot_observed_at":"2026-08-14T21:15:20.831860Z","submitted_at":"2017-02-22T11:37:49Z","title":"Memory Matching Networks for Genomic Sequence Classification","version":1},"cited_work":{"arxiv_id":"1702.06760","doi":null,"metadata_source":"pith","pith_arxiv_id":"1702.06760","snapshot_observed_at":"2026-08-10T20:53:49.595780Z","title":"Memory Matching Networks for Genomic Sequence Classification","venue":"cs.LG","work_id":"6520edbd-2b6e-4124-aae8-c96e9cc8f2c4","year":2017},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.943707Z"},"links":{"cited_paper":"/paper/1702.06760","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:177e644da9c64bed48b2c96e30b17b9e1f5e3511ea7d3b44d70b3988bd823e64","observation_id":"0b1b3e55-2252-4aa4-99c2-8052b752ed3e","resolution":{"observed_at":"2026-08-10T20:53:49.604414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.253262Z","title":"Unsupervised learning using pretrained cnn and associative memory bank,","venue":null,"work_id":"27ca776e-bcaf-499c-83c1-68343b428a26","year":2018},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.948787Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:fceb038dd84f665a81f3aacfff8884aa266456688cc5b6355ca62aee038f545f","observation_id":"f9f2c85f-b234-4ac9-8f1e-f914575d4ec1","resolution":{"observed_at":"2026-08-10T20:53:50.256559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.242358Z","title":"Point cloud classi- fication via learnable memory bank,","venue":null,"work_id":"c80af2b5-6b73-4642-adc8-eeb0c6092b19","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.952127Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:a40f5dbc1b034b58f57ca49a03426991f2784b96670d7d717ed87fd966885fb6","observation_id":"d64bc291-b7bb-4597-b758-eedc1136c231","resolution":{"observed_at":"2026-08-10T20:53:50.246020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.231111Z","title":"A new approach to automatic memory banking using trace-based address mining,","venue":null,"work_id":"56f70dbd-c5c3-46c8-96cb-d910c8445efd","year":2017},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.960698Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:89f1fa9a7fbf7be5c69796134578875535517b5401e28d751ac47ace95f0d331","observation_id":"3e1a7e91-9290-4fcd-a985-29f759521b7d","resolution":{"observed_at":"2026-08-10T20:53:50.235618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.218878Z","title":"Visual anomaly detection via partition memory bank module and error estimation,","venue":null,"work_id":"608ea273-97cc-46b9-a951-93d5f2eea288","year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.040394Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:7fa656085de2073341daa473f2f2357e88d39af7cba9426cf3299a743f5369d8","observation_id":"2c9ba90b-a9b2-406f-8d28-2c936e290849","resolution":{"observed_at":"2026-08-10T20:53:50.222736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.206808Z","title":"Mamba: Multi-level aggregation via memory bank for video ob- ject detection,","venue":null,"work_id":"403a011e-1521-4a05-811a-52252b6d220d","year":2021},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.134468Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:785c32042b97803127a13d80204aa8844a7e5d728876e3e90b8e223691223521","observation_id":"ef5425ed-c87c-4bb3-ba1c-9a302af34009","resolution":{"observed_at":"2026-08-10T20:53:50.210886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.194338Z","title":"Semi-supervised se- mantic segmentation using unreliable pseudo-labels,","venue":null,"work_id":"ebebf1ab-5c90-410f-8f4f-b52bb94aa7a7","year":2022},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.138237Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:3571bfcee1cb1c3419d0396a711dc08eb3680786c044fbf0fe82ed229662f344","observation_id":"5bfbfdac-8b31-4c20-8aca-15c4f3c3fc2a","resolution":{"observed_at":"2026-08-10T20:53:50.198699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.183704Z","title":"Weakly su- pervised semantic segmentation by pixel-to-prototype contrast,","venue":null,"work_id":"170381c5-10ee-4b88-884c-e91568b8a6bc","year":2022},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.142549Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:c264f6bf81fa9458fbeeaa60c79691fb6b83680ffef133e0b451bf688e6e5e94","observation_id":"415f4932-3d03-44c9-a949-187556a79f3b","resolution":{"observed_at":"2026-08-10T20:53:50.187358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:49.145828Z","title":"Memory-based cross-image con- texts for weakly supervised semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.145828Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:e78e4c1a9b103912a0dad28a2e04b7da5123fc30310aabdb093a03757d3e592a","observation_id":"684a14ed-537d-4607-87aa-0a3b54aafca4","resolution":{"observed_at":"2026-08-10T20:53:49.145828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-10T20:53:49.150228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.150228Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:9cb214271a702036e639acc0d6ee63aace188a50398976e17265d182ebe98459","observation_id":"22fb036f-3f3b-49b7-9d3f-73c5c9f51bce","resolution":{"observed_at":"2026-08-10T20:53:49.150228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10115","last_updated":"2024-03-22T16:46:36Z","snapshot_observed_at":"2026-08-13T12:16:14.893703Z","submitted_at":"2023-12-15T09:57:21Z","title":"SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10115","snapshot_observed_at":"2026-08-10T20:53:49.155213Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.155213Z"},"links":{"cited_paper":"/paper/2312.10115","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:efa629aef8dd8efe5b09768075d81e8f06d803b02793eb2e3943bef58c21fb58","observation_id":"0c4f3726-bc66-403a-8186-5295f5245880","resolution":{"observed_at":"2026-08-10T20:53:49.155213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T20:53:49.159740Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.159740Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:67220f3df72468ced4a2c716fb7f2ea73791dcf619108d793d0dd662c39d70e2","observation_id":"acc63c6e-dc1a-491c-9f95-9c707cdbb79b","resolution":{"observed_at":"2026-08-10T20:53:49.159740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.172828Z","title":null,"venue":null,"work_id":"6c6e5c4b-eaf6-4bc0-968f-c30fe9815f10","year":null},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.163538Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:732fed0e583e94a9e6ef84c8badec00e42db5d3dd45b306ca4fe511498210f82","observation_id":"fb343ad8-1d33-493f-939c-733a0419130b","resolution":{"observed_at":"2026-08-10T20:53:50.176587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.161014Z","title":"Bleu: A method for automatic evaluation of machine translation,","venue":null,"work_id":"92e2703a-16b9-4bb2-a581-83fea8e5a771","year":2002},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.175607Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:74b05cd8e900f6f81d7dad3b45f0a30dfd5eacc8c7f77fc372548a90697f7070","observation_id":"27cc5b5b-8844-4ab4-9905-14ce799e1e9c","resolution":{"observed_at":"2026-08-10T20:53:50.164726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:49.236877Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.236877Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:d65aa5cd8f7ef54d549d1cbc67b69ccf49bdfddc451a497cc40befe7f2b10975","observation_id":"d9a9a7f3-0cd3-45c5-bb48-edcc708c2fcb","resolution":{"observed_at":"2026-08-10T20:53:49.236877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.144516Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":"7b59f8bf-4bf1-4dcc-8595-a53b22c93b3e","year":2005},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.345436Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:debe234c7c7ff457a7f0825a236afb7aba7af6c80c61f6855132e6a8d6421ca4","observation_id":"2072881c-4e83-4d51-b916-1a177d2167bc","resolution":{"observed_at":"2026-08-10T20:53:50.148712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:49.349243Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.349243Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:7488ebd3447393c11bd5cd000a38328d0edb838cc81adeee91d12084a9366c9d","observation_id":"6b402188-5f59-45d8-b7e8-43466cc73e3f","resolution":{"observed_at":"2026-08-10T20:53:49.349243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12971","last_updated":"2023-10-19T17:59:01Z","snapshot_observed_at":"2026-08-13T21:11:20.544454Z","submitted_at":"2023-10-19T17:59:01Z","title":"CLAIR: Evaluating Image Captions with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12971","snapshot_observed_at":"2026-08-10T20:53:49.353753Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.353753Z"},"links":{"cited_paper":"/paper/2310.12971","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:d387216439a6f78974473f2f2fc8a658a87ab1aa530c6f9d86776d7dc28ac538","observation_id":"e11a5396-91b5-45f2-a37e-e9b145a0dd63","resolution":{"observed_at":"2026-08-10T20:53:49.353753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.262855Z","title":"1109 / tgrs","venue":null,"work_id":"4c6d58ba-7dee-40ee-88cb-2df3061e5456","year":2020},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":644,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.939219Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:ab86817415b92a74a6e5678ac4ca6d5d1a99293cc7ebc8f1a01be83bcbc0a057","observation_id":"4d9b901b-18c8-4fb0-ad40-bd1ab864714a","resolution":{"observed_at":"2026-08-10T20:53:50.265991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T20:53:49.166936Z","title":"[Online]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.166936Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:d8783f0bdf6a152c916f429f0d4050feead1ba29bed4ecabfcfd9f8fd1d535db","observation_id":"718daccd-d34f-4936-b586-5d5d9b13f84f","resolution":{"observed_at":"2026-08-10T20:53:49.166936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":34,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 7 inbound Pith citation observations for arXiv:2501.06828."}