{"as_of":"2026-08-11T13:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b13fb1e6f27223ec9c012785b704f6f64c6dbe2d71bce3abedd8e6e6e8f44a62","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:44:30.688266Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:33:17.463837Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T08:25:33.081217Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00895","snapshot_observed_at":"2026-08-10T20:33:17.463837Z","title":"Text2earth: Unlocking text-driven remote sensing image genera- tion with a global-scale dataset and a foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.08114","last_updated":"2025-01-14T13:46:03Z","snapshot_observed_at":"2026-08-10T20:27:13.234756Z","submitted_at":"2025-01-14T13:46:03Z","title":"Change Captioning in Remote Sensing: Evolution to SAT-Cap -- A Single-Stage Transformer Approach","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:33:17.463837Z"},"links":{"cited_paper":"/paper/2501.00895","citing_paper":"/paper/2501.08114"},"observation_digest":"sha256:9aef6b9ac3bfcba414db08fe2aeecfc7e3378fd5e71554d3b992b29b97afbe7a","observation_id":"2eccb32d-bef0-4bc6-877d-77abe0fdb306","resolution":{"observed_at":"2026-08-10T20:33:17.463837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00895","snapshot_observed_at":"2026-08-07T15:39:21.074195Z","title":"Text2earth: Unlocking text-driven remote sensing image generation with a global-scale dataset and a foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":293,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:21.074195Z"},"links":{"cited_paper":"/paper/2501.00895","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:882a5cf0425e466e1eaedc84b36aa90663e95edea3a2558e8c6e0cea32b58f16","observation_id":"d0ea4d74-887e-42d7-b2ad-e366bb7ae66d","resolution":{"observed_at":"2026-08-07T15:39:21.074195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"cited_work":{"arxiv_id":"2501.00895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00895","snapshot_observed_at":"2026-07-01T08:25:33.081217Z","title":"Text2earth: Unlocking text-driven remote sensing image generation with a global-scale dataset and a foundation model","venue":null,"work_id":"cdac3cfb-cbae-4258-b6a2-b81c1f7877a2","year":2025},"citing_paper":{"arxiv_id":"2605.00310","last_updated":"2026-06-01T02:46:29Z","snapshot_observed_at":"2026-08-08T00:23:57.410697Z","submitted_at":"2026-05-01T00:44:46Z","title":"Beyond Visual Fidelity: Benchmarking Super-Resolution Models for Large-Scale Remote Sensing Imagery via Downstream Task Integration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T20:24:54.846887Z"},"links":{"cited_paper":"/paper/2501.00895","citing_paper":"/paper/2605.00310"},"observation_digest":"sha256:cb7b9d8f29e37c6a76fd1566f396adfd49782ee36144b0b5f21e33622f9c1f3b","observation_id":"ac133a5c-ba20-4eac-9621-27c986c1880a","resolution":{"observed_at":"2026-05-11T15:16:08.462295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"cited_work":{"arxiv_id":"2501.00895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00895","snapshot_observed_at":"2026-07-01T08:25:33.081217Z","title":"Text2earth: Unlocking text-driven remote sensing image generation with a global-scale dataset and a foundation model","venue":null,"work_id":"cdac3cfb-cbae-4258-b6a2-b81c1f7877a2","year":2025},"citing_paper":{"arxiv_id":"2605.00310","last_updated":"2026-06-01T02:46:29Z","snapshot_observed_at":"2026-08-08T00:23:57.410697Z","submitted_at":"2026-05-01T00:44:46Z","title":"Beyond Visual Fidelity: Benchmarking Super-Resolution Models for Large-Scale Remote Sensing Imagery via Downstream Task Integration","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-01T08:23:54.413015Z"},"links":{"cited_paper":"/paper/2501.00895","citing_paper":"/paper/2605.00310"},"observation_digest":"sha256:5b9a21e7345d34eb75eba7257821c9449a9cf4437f1f2a14367b85342ceea6d0","observation_id":"1f7169ae-5b78-4a4d-9436-20ac37740f97","resolution":{"observed_at":"2026-07-01T08:25:33.083393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00895/citation-record","integrity":"/paper/2501.00895/integrity","json":"/paper/2501.00895/citation-record.json","paper":"/paper/2501.00895"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.372942Z","title":"Vision-language models in remote sensing: Current progress and future trends,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.372942Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:0900887ac82ae679c13dee8455616c5e5538a8dca799ae4fa61913642a09f340","observation_id":"b67b6957-bab6-414e-ad8f-7dde7b3f387c","resolution":{"observed_at":"2026-08-10T22:44:30.372942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.377547Z","title":"Multimodal image synthesis and editing: The generative ai era,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.377547Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:f1baa63588ec63f89e6dd38e1fe4a60b12892d56af6a0af96bbe050d137d045f","observation_id":"995fd004-dcc4-444d-8710-2778cef9ca51","resolution":{"observed_at":"2026-08-10T22:44:30.377547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.381844Z","title":"Text-to-image synthesis: A decade survey,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.381844Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:712ea09a25fba0bd56d0964904da4fb4a03b691c354b1c1ba004830087d13b87","observation_id":"3e702748-221d-44a3-9fd6-efabfcf3cd61","resolution":{"observed_at":"2026-08-10T22:44:30.381844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03464","last_updated":"2025-02-11T22:29:52Z","snapshot_observed_at":"2026-07-06T18:57:39.564455Z","submitted_at":"2024-08-06T22:39:34Z","title":"Vision Foundation Models in Remote Sensing: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03464","snapshot_observed_at":"2026-08-10T22:44:30.389777Z","title":"Ai foundation models in remote sensing: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.389777Z"},"links":{"cited_paper":"/paper/2408.03464","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:5872dadf7c97ec42dbe28a44bb095b3916c70a4ad755f1a4874c323c38b08aeb","observation_id":"3aba4280-6016-4736-8c24-0d8be8a176b7","resolution":{"observed_at":"2026-08-10T22:44:30.389777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16602","last_updated":"2025-06-03T02:58:06Z","snapshot_observed_at":"2026-08-09T20:01:08.885349Z","submitted_at":"2024-10-22T01:08:21Z","title":"Foundation Models for Remote Sensing and Earth Observation: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16602","snapshot_observed_at":"2026-08-10T22:44:30.394204Z","title":"Foundation models for remote sensing and earth observation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.394204Z"},"links":{"cited_paper":"/paper/2410.16602","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:ae055506533b7d8ec975b25a24ef6e081bd8a9220db73217d2393d645e2fb77e","observation_id":"8cfb636a-6efa-4ce3-9022-684ee9f3def0","resolution":{"observed_at":"2026-08-10T22:44:30.394204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.398454Z","title":"To- wards vision-language geo-foundation model: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.398454Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:0a75374e027b416cbf354f1616673a412e47706a526623a95222806fc9c3ed44","observation_id":"cd389ac5-1cd0-4e32-bd9d-8ee8b11b24a4","resolution":{"observed_at":"2026-08-10T22:44:30.398454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.402342Z","title":"Remote sensing temporal vision-language models: A comprehensive survey,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.402342Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:509bef04f641d5a8be84cac22da776b85c3544326934b3bf3feab4ba15d1f6ce","observation_id":"f7b3cbc6-1883-46a8-929c-d71c7c6b0265","resolution":{"observed_at":"2026-08-10T22:44:30.402342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.409923Z","title":"Txt2img- mhn: Remote sensing image generation from text using modern hopfield networks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.409923Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:ace85f11d0d6f21c0867313a8fbb1ecb01749d64e1e85cbcb0cdc91c588c6594","observation_id":"3cbc52b5-cbf8-4ee1-aedc-0defd2339c35","resolution":{"observed_at":"2026-08-10T22:44:30.409923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.406221Z","title":"Available: https: //arxiv.org/abs/2412.02573","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.406221Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:0ea056c31b932021c72b7be0ed6ae47103945f8ddc2c07a5e99e961e8819f667","observation_id":"3b8770c5-31fe-4622-a5f4-e69d554f11eb","resolution":{"observed_at":"2026-08-10T22:44:30.406221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16648","last_updated":"2023-08-31T11:44:40Z","snapshot_observed_at":"2026-07-06T16:12:42.589161Z","submitted_at":"2023-08-31T11:44:40Z","title":"Generate Your Own Scotland: Satellite Image Generation Conditioned on Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16648","snapshot_observed_at":"2026-08-10T22:44:30.418028Z","title":"Generate your own scotland: Satellite image generation conditioned on maps,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.418028Z"},"links":{"cited_paper":"/paper/2308.16648","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:757fbc66b0e17cb820b26a5fa6b130f9b0e1a0d638bc8b1482575f51f3c5f834","observation_id":"daf128f5-caa9-4f6e-beb9-eeedfa70f6b5","resolution":{"observed_at":"2026-08-10T22:44:30.418028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.414204Z","title":"Metaearth: A generative foun- dation model for global-scale remote sensing image generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.414204Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:e66a880abfd4a116aebe77b22aa290c0cd7fc06fd47c766bd26c56a01988977c","observation_id":"5f46ce46-19ce-4601-a7df-b9a2ae668dda","resolution":{"observed_at":"2026-08-10T22:44:30.414204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.425627Z","title":"Artificial intelligence to advance earth observation: A review of models, recent trends, and pathways forward,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.425627Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:c12db1fc627d4f2f07411e5ad408163fedc66a43c4e6fe0dc6d1691ce6b9b1f1","observation_id":"8088020d-bf51-4ee9-b848-571130ee92a7","resolution":{"observed_at":"2026-08-10T22:44:30.425627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.422137Z","title":"Deep learning in remote sensing: A comprehensive review and list of resources,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.422137Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:5ebf4d4977e96d956740338de7e171ae07d9e4df1cbf60aed5c38821a659db95","observation_id":"74960b3f-9731-4f08-8a43-ab825e7755fe","resolution":{"observed_at":"2026-08-10T22:44:30.422137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.654616Z","title":"Remote sensing image captioning based on multi-layer aggregated transformer,","venue":null,"work_id":"f74af823-f0f7-4054-9146-ffe33bcf646b","year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.432974Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:80dd0a7eed66c1742d9d5d8e641c3212592d2440758c90d997901a0e80b12c64","observation_id":"941eddc3-5ea9-4f31-bef2-31ada53c331e","resolution":{"observed_at":"2026-08-10T22:44:31.658036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.429316Z","title":"Rsprompter: Learning to prompt for remote sensing instance seg- mentation based on visual foundation model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.429316Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:992e288229643c0a6c3051e11dbb02128bf3e343333c4adfadf7d78acbf50c97","observation_id":"3b27f368-e1f4-45dc-a5a1-e6063c4e583a","resolution":{"observed_at":"2026-08-10T22:44:30.429316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.440222Z","title":"Deep semantic understanding of high resolution remote sensing image,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.440222Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:2997a954840ee31074d3ed3ab2623a64148c2e57699fae11561c0cbed91a90a4","observation_id":"d0a3c84e-3792-4e08-82f0-b85da2e89553","resolution":{"observed_at":"2026-08-10T22:44:30.440222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.436809Z","title":"Change-agent: Toward interactive comprehensive remote sensing change interpretation and analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.436809Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:d1b0245f035b6fbfc58ae30870518c6bcff513a8991157fabd63fede83025962","observation_id":"4e32f534-6f3e-4af7-8b68-814e1f90682b","resolution":{"observed_at":"2026-08-10T22:44:30.436809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.617453Z","title":"Di ffusion models beat gans on image synthesis,","venue":null,"work_id":"0267a302-1c42-4075-802f-5d5f997a1c26","year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.447115Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:d9cf8e934588f00f391c4a1e6887ab3b9704eb5d535fa10e8d065a361e00044d","observation_id":"34bb5381-1d1b-4673-a2af-9d77d7dda958","resolution":{"observed_at":"2026-08-10T22:44:31.621429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.629229Z","title":"Exploring models and data for remote sensing image caption generation,","venue":null,"work_id":"7594212f-5b2c-4ba8-b883-2e22ac50b110","year":2018},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.443998Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:532ec6dc2152aad9f4b6b14038c8ee8019b90a40a1e4695409dd8552e68be7d9","observation_id":"925560bf-45d3-43bc-afff-dd6180ac20e6","resolution":{"observed_at":"2026-08-10T22:44:31.633321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.453537Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.453537Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:1ff433c13da46dcdd4c2be03bb37d7268635035d73d74f08ae13968189d0bb83","observation_id":"562e37e5-9845-49bd-a83e-601ec109796e","resolution":{"observed_at":"2026-08-10T22:44:30.453537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.604955Z","title":"High- resolution image synthesis with latent di ffusion models,","venue":null,"work_id":"8eaad6d2-4d08-4764-9c5a-692f243b343b","year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.450485Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:f2b5015ca82abb69f7a3f61a6277c6f1b3f2e4c0396cc2d4bccb3eba7c448c9f","observation_id":"ca3b8914-bb4f-4cd6-b6ca-453d07f7727f","resolution":{"observed_at":"2026-08-10T22:44:31.609305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.459773Z","title":"Nwpu- captions dataset and mlca-net for remote sensing image captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.459773Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:c62c4763104b66e7ef464d0373b8e423d1076c4d72174c3967463397c9b3cff8","observation_id":"c0d33c2e-a32d-48a3-be98-e86a715044b1","resolution":{"observed_at":"2026-08-10T22:44:30.459773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.456669Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.456669Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:83d535bf1dbaa800cbcc0e21e08f581988841aab811b1bb53f74b05a5b8b6bd7","observation_id":"fba5fe75-e9bf-450d-a428-2c40229496b7","resolution":{"observed_at":"2026-08-10T22:44:30.456669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07909","last_updated":"2024-11-08T06:19:33Z","snapshot_observed_at":"2026-08-09T15:37:28.200871Z","submitted_at":"2023-03-14T13:49:54Z","title":"Text-to-image Diffusion Models in Generative AI: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07909","snapshot_observed_at":"2026-08-10T22:44:30.466225Z","title":"Text-to- image di ffusion models in generative ai: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.466225Z"},"links":{"cited_paper":"/paper/2303.07909","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:c4f5350522568e642501db537b90cb83b2eb4d0efeadc4da5a2f9d532385b0a4","observation_id":"a4e8f13e-7022-481d-976b-8bebeefd45cc","resolution":{"observed_at":"2026-08-10T22:44:30.466225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.571354Z","title":"Rs5m and georsclip: A large scale vision-language dataset and a large vision-language model for remote sensing,","venue":null,"work_id":"89c3edf2-1b63-46a0-9d34-4f3b91bc3574","year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.462978Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:7c3f9e8fec04a3d9ac5b2c18be982bf332fa4fc209fac23eaf675eddf827e51b","observation_id":"d2acef50-d03d-486d-bc99-97a8e969a6e3","resolution":{"observed_at":"2026-08-10T22:44:31.575006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.473503Z","title":"A decoupling paradigm with prompt learning for remote sensing image change cap- tioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.473503Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:848e41f96d56cdafc7969946ddaa27491311b7b3d0a3d54d3e82be47d58a6438","observation_id":"b29fa7d4-e1e7-48ee-bd34-a9df41746aed","resolution":{"observed_at":"2026-08-10T22:44:30.473503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.469795Z","title":"Remote sensing image change captioning with dual-branch transformers: A new method and a large scale dataset,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.469795Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:cbe6bba7aaab0f46458e317bc384b68fa8e1314f2ef4b55efa43826f0e245c71","observation_id":"eb824d00-12d2-445b-b2e1-6b1f89526753","resolution":{"observed_at":"2026-08-10T22:44:30.469795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.480606Z","title":"Generative adversarial networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.480606Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:8cb3afade86aed6801b14583a0471afc3000ec714e980eb3e5db3971ad61897b","observation_id":"700a1972-b368-4799-8a03-ef7ebc81a38c","resolution":{"observed_at":"2026-08-10T22:44:30.480606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.544635Z","title":"Progressive scale-aware network for remote sensing image change captioning,","venue":null,"work_id":"c900078a-0769-4720-9dfc-f34b58c77f5c","year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.476985Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:a32312ddde7dbebbcbfecfa10eb63a03857cd1fd26cd80b4eb75e5623e63e31d","observation_id":"28ea3c67-5118-4a44-945c-d41dca4f91ff","resolution":{"observed_at":"2026-08-10T22:44:31.549332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.487626Z","title":"Taming transformers for high- resolution image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.487626Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:731a3c7db933f1ba982d0570e3fd24f2efcf5028fdb72c923b8f7778b1a2f71e","observation_id":"52384318-5d12-4d1a-b33c-714c6a0791e8","resolution":{"observed_at":"2026-08-10T22:44:30.487626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.525462Z","title":"Df-gan: A simple and effective baseline for text-to-image synthesis,","venue":null,"work_id":"4586d25b-0c88-447b-abaa-e0f12d8ae8f2","year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.484127Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:2a701b1c3052240cf9ea84c54e3664b912a84a88a6a0f57d69d92b9cb15aeeac","observation_id":"8435ab0c-6395-4561-a4c5-a743b67f1d30","resolution":{"observed_at":"2026-08-10T22:44:31.529368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.495387Z","title":"Galip: Generative adversarial clips for text-to-image synthesis,","venue":null,"work_id":"ef204de2-f991-49c7-abc7-120426220e0f","year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.494649Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:bab2926b2370a152f056e2718632b884b895d780b9f47e9d5987812953e89581","observation_id":"65619ebe-db97-4877-a88d-b9e865665f51","resolution":{"observed_at":"2026-08-10T22:44:31.499464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.506626Z","title":"Towards language-free training for text-to-image generation,","venue":null,"work_id":"7504a582-f34d-4fb4-8908-73391f3b5043","year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.491226Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:e065ea16569a2e11e6b818821b5fc781442b17dabcfae655ba199734f3eec8e1","observation_id":"9396c3d9-b76f-4ba6-b5a8-2b3f572ea3c2","resolution":{"observed_at":"2026-08-10T22:44:31.510584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.501902Z","title":"Drag your gan: Interactive point-based manipulation on the generative image manifold,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.501902Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:5c24d89eb05d299637c5657c1f3d9456b8b24ce6cc46ba4f500bd6e6b308a5c0","observation_id":"c874c0fe-7b23-46ee-a06f-e9a797ac33ad","resolution":{"observed_at":"2026-08-10T22:44:30.501902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.483358Z","title":"Recurrent a ffine transformation for text-to-image synthesis,","venue":null,"work_id":"77aef0d1-0372-4a69-be5f-b519379fc298","year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.498416Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:36d9485ced426d7f76b76979f41301b9f5cb9e1febfd3b5a6e9974a7ef02dfa5","observation_id":"c360bf57-de4b-4c55-962b-0904c73d18c3","resolution":{"observed_at":"2026-08-10T22:44:31.487839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.464011Z","title":"Stackgan: Text to photo-realistic image synthesis with stacked generative adversarial networks,","venue":null,"work_id":"2efaf172-7995-41f8-8169-42fed5bb4436","year":2017},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.509304Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:7484bbcaa1dce9908176be92a4f3efd642a17030090627e5056410ae43bdc98d","observation_id":"5aba10f8-af07-426d-804d-eb0fe0cede14","resolution":{"observed_at":"2026-08-10T22:44:31.468105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.1784","last_updated":"2014-11-06T22:33:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-11-06T22:33:22Z","title":"Conditional Generative Adversarial Nets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.1784","snapshot_observed_at":"2026-08-10T22:44:30.505521Z","title":"Conditional generative adversarial nets,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.505521Z"},"links":{"cited_paper":"/paper/1411.1784","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:80d06460bb5d5a7e2a75c3bb4da6d6d589c0b57884d7b2aa558b905b5da02fd1","observation_id":"3dfc4e8e-3fd9-485f-95ef-77cbd31fb421","resolution":{"observed_at":"2026-08-10T22:44:30.505521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.444374Z","title":"Mirrorgan: Learning text-to- image generation by redescription,","venue":null,"work_id":"9c86c8c7-529b-473a-8f7c-49ceb1401b84","year":2019},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.516717Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:2f383a73b6e20b18ca90a00d08bac958c1de01c8c2cd648e584ffa1d9545a146","observation_id":"22159c23-0963-4a43-b24d-4378a7c167a6","resolution":{"observed_at":"2026-08-10T22:44:31.448415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.512960Z","title":"Attngan: Fine-grained text to image generation with attentional generative adversarial networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.512960Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:29943d05a606388314f6ce744c1f6f3222fa027dc139b09d56288b8eb22d0740","observation_id":"0551f7ff-b1d0-4c14-9e51-1448f5d77cba","resolution":{"observed_at":"2026-08-10T22:44:30.512960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.424361Z","title":"Ufogen: You forward once large scale text-to-image generation via di ffusion gans,","venue":null,"work_id":"4183af16-daba-441f-8294-2230d8ce9d04","year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.524103Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:d9f942e50e25f51a8c815e787098594199f649e5dd81c5ad7db1d8fc3b4e5a1a","observation_id":"a2f086e3-86b4-4ea8-9ae4-6b00c067a584","resolution":{"observed_at":"2026-08-10T22:44:31.427709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.434633Z","title":"Scaling up gans for text-to-image synthesis,","venue":null,"work_id":"c2a4736f-6398-4b92-985d-8512afafebf8","year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.520503Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:fa7d5f7771bf7edc18a10e0ebcc96a51f6d4d8cb3309a6bd2ae9e6293397823a","observation_id":"c1361ac5-edd8-490b-bdb4-03c70d84a8bc","resolution":{"observed_at":"2026-08-10T22:44:31.437942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.403103Z","title":"A survey on generative adversarial networks: Variants, applications, and training,","venue":null,"work_id":"bf5465ca-113c-460d-b7c2-5470d737685c","year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.531374Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:62430fc2a9ec021aef85a63f7eca78370fdf1c049ba3b6127e8401b6a91033af","observation_id":"c1c98914-ba45-48f5-9894-40d636bc3535","resolution":{"observed_at":"2026-08-10T22:44:31.407371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.414051Z","title":"A review on generative adversarial networks: Algorithms, theory, and applications,","venue":null,"work_id":"3089bcfc-ef9c-4c60-9cb4-1022b9b26364","year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.527943Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:edcae745a1ea1ad29ec81b95d0a112f9ea8b71e38f4f455d7ae3266f0e92c1da","observation_id":"e941ef23-b53c-4c62-8f63-a42c77de1c1f","resolution":{"observed_at":"2026-08-10T22:44:31.417520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.385642Z","title":"Cogview: Mastering text-to-image generation via transformers,","venue":null,"work_id":"60be2904-c754-45e4-8e75-c0e7cc1c62b3","year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.538352Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:ace8c191d77f62939be44a9b415e9c16f54f7230d1d69432d6371d76b4ad9c61","observation_id":"9277d0fa-52a0-4a79-a9d3-6b397b1ef9c5","resolution":{"observed_at":"2026-08-10T22:44:31.389600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.534695Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.534695Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:98d0f17e829447cc07cf1bc3fcfe2187b402e8c75af5801237826a4fe52b1b29","observation_id":"b07a3426-b42a-406d-b8df-7f67c363587f","resolution":{"observed_at":"2026-08-10T22:44:30.534695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07614","last_updated":"2024-07-11T11:05:53Z","snapshot_observed_at":"2026-08-09T00:20:36.600009Z","submitted_at":"2024-07-10T12:52:49Z","title":"MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07614","snapshot_observed_at":"2026-08-10T22:44:30.545433Z","title":"Mars: Mixture of auto-regressive models for fine-grained text-to-image synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.545433Z"},"links":{"cited_paper":"/paper/2407.07614","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:2c632523e1dae9452554d599791c361d28e8dd2e8411e9e8284357625cfc53b3","observation_id":"779a674e-f8fa-4631-9a2d-5bf3291d5568","resolution":{"observed_at":"2026-08-10T22:44:30.545433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T22:44:30.541656Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.541656Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:a0f178d7c8ef5568469d59acdfa15b4221f1c938cac3dfdf9ffff45823d48536","observation_id":"52e35fa3-3958-4a53-9135-94994b442840","resolution":{"observed_at":"2026-08-10T22:44:30.541656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.552764Z","title":"Rscama: Remote sensing image change captioning with state space model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.552764Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:4ae04aeb96a2d61e22261ddb62667a809477eee87a02d5297c255f9c0fd38b38","observation_id":"8fb17d38-f53f-49f6-b1de-25fdb8b7216a","resolution":{"observed_at":"2026-08-10T22:44:30.552764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.374426Z","title":"Make-a-scene: Scene-based text-to-image generation with human pri- ors,","venue":null,"work_id":"890e4aaf-7def-4a25-a545-8e2a3dabd5e5","year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.549054Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:3a17edeb11e6ad2a933b5d8e5a1f58dbc96299c161cb5507b1eaedf03a728ca2","observation_id":"2ab9b0b4-4226-4dc9-993b-eb795d77c31c","resolution":{"observed_at":"2026-08-10T22:44:31.378410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04062","last_updated":"2025-06-29T07:13:36Z","snapshot_observed_at":"2026-08-09T07:28:10.213836Z","submitted_at":"2024-12-05T10:57:08Z","title":"ZipAR: Parallel Auto-regressive Image Generation through Spatial Locality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04062","snapshot_observed_at":"2026-08-10T22:44:30.560502Z","title":"Zipar: Accelerating autoregressive image generation through spatial locality,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.560502Z"},"links":{"cited_paper":"/paper/2412.04062","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:902e7869cdab7c491065501909c6d9c48235a36cd5096e0fab254ecce323da37","observation_id":"c676609a-75d6-4bf7-a9b2-c8dd910643e7","resolution":{"observed_at":"2026-08-10T22:44:30.560502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T22:44:30.556702Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.556702Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:1c64b73c9421b00028cf422d9bdef9d49e7aa01a65f5df0ea015bb7957bf6406","observation_id":"915d1d9d-09d5-4885-ada2-261af54cf9fd","resolution":{"observed_at":"2026-08-10T22:44:30.556702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.342608Z","title":"Denoising di ffusion probabilistic models,","venue":null,"work_id":"cc45b2a5-015f-40fa-a0c4-c12dc9f7cd14","year":2020},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.567980Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:011f8f0f6bc80c2700953ec94492eb3609ae038492b50af9d4314bf94d4295c1","observation_id":"ae19ce8b-4063-401f-be2b-9881da0fb86c","resolution":{"observed_at":"2026-08-10T22:44:31.346481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.354047Z","title":"Spectral-cascaded diffusion model for remote sensing image spectral super-resolution,","venue":null,"work_id":"e9b02e2a-ec04-4753-a55e-cf32c8aa8e74","year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.564426Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:2ba2c6f70e4b50b79b85f28600571ceefc2bbe45d2531888f497e965e0fb13be","observation_id":"5a674c51-08b3-4119-8ad8-7c6a61db2f01","resolution":{"observed_at":"2026-08-10T22:44:31.358978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-10T22:44:30.574304Z","title":"Hierarchical text-conditional image generation with clip latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.574304Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:e1dccf87a17ae7a1e94f4db28479f44417173c43a1a6850f83cc0179b18efc2c","observation_id":"a410feb0-49fc-4e3a-befc-bb7892d47e34","resolution":{"observed_at":"2026-08-10T22:44:30.574304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-10T22:44:30.571363Z","title":"Glide: Towards photorealistic image gen- eration and editing with text-guided di ffusion models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.571363Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:e47c718917065666ba2c8de49ff19b6a67fbd4a3b820c4fe40e31ad752dea454","observation_id":"4377a57a-e3c8-49fe-98e8-02fa2eac9bdb","resolution":{"observed_at":"2026-08-10T22:44:30.571363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.331435Z","title":"Draw your art dream: Diverse digital art synthesis with multimodal guided di ffusion,","venue":null,"work_id":"4f78d7bd-e4ee-4f91-870f-e03571764bb1","year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.580908Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:2d6eb8b3646924c95ad94cd6a53f2be9dda189d5136fed54cdeec250f9e76bf7","observation_id":"4f79e091-587b-4247-ab11-fd12d3450e61","resolution":{"observed_at":"2026-08-10T22:44:31.335694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.13038","last_updated":"2022-07-26T16:56:51Z","snapshot_observed_at":"2026-08-04T06:19:32.429306Z","submitted_at":"2022-07-26T16:56:51Z","title":"Text-Guided Synthesis of Artistic Images with Retrieval-Augmented Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.13038","snapshot_observed_at":"2026-08-10T22:44:30.577685Z","title":"Text-guided synthesis of artistic images with retrieval-augmented di ffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.577685Z"},"links":{"cited_paper":"/paper/2207.13038","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:eb57faa05f516d21ac764be5199ee3e89efcf412a5b0022c435284639158a05b","observation_id":"f4d7b305-7702-4f71-8818-268db0ed47ef","resolution":{"observed_at":"2026-08-10T22:44:30.577685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.319277Z","title":"Imagic: Text-based real image editing with di ffusion models,","venue":null,"work_id":"5e1fb426-7400-4acb-8ae7-5ff8dc866529","year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.587357Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:26ae158c6cacb81a0f89bd83e2c34f81d859e9c823270e5d22098a2c1d8f0897","observation_id":"d1360b75-4134-4ab2-a6c1-dbbde4cc8946","resolution":{"observed_at":"2026-08-10T22:44:31.323738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-01T15:07:11.635426Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-10T22:44:30.584065Z","title":"Di ffedit: Diffusion- based semantic image editing with mask guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.584065Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:ae05f361dab5d5755c65bb088b99a267f1fe0af8a3d51afb8ecb889aea6fac45","observation_id":"163e4804-4201-4524-b3c5-a61ef4d02290","resolution":{"observed_at":"2026-08-10T22:44:30.584065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-10T22:44:30.594080Z","title":"Imagen video: High definition video generation with di ffusion models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.594080Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:5f6c18eb38f7eb6e03a71586aa682f3910192fa3031a6fa17413e81c5bc6a83a","observation_id":"b5e9ca1b-ff3b-405f-9678-6c293e16af05","resolution":{"observed_at":"2026-08-10T22:44:30.594080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-10T22:44:30.590384Z","title":"Make-a-video: Text-to-video generation without text-video data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.590384Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:edefc709e6695d53f2175e6dc77c6f788cad91a0f8027011f43a883ade3e448c","observation_id":"25b70d4e-b39e-4c5c-91c2-40e33ef47c4b","resolution":{"observed_at":"2026-08-10T22:44:30.590384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.296679Z","title":"Adding conditional control to text-to-image di ffusion models,","venue":null,"work_id":"568c7cc8-e4b3-492b-a99b-3ceceff10866","year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.601757Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:0644026d3c89b1a7a18cf6d6d9729dd9cc72fa96b6c77c2129a4ca627dbc0c86","observation_id":"c6d3d020-dab1-4452-bf5e-449629e343ae","resolution":{"observed_at":"2026-08-10T22:44:31.300013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.307089Z","title":"Synthesizing coherent story with auto-regressive latent di ffusion models,","venue":null,"work_id":"c91ce7fb-5fa8-4c1d-ac29-d2d865523dba","year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.598218Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:d774c9773fe51d1c619bcc0c77bd8dcc5ed73a931dee61f619b355cf28a64d82","observation_id":"50b3932b-9cd4-4bcf-ab5e-78b470b4af78","resolution":{"observed_at":"2026-08-10T22:44:31.311392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.273296Z","title":"Retro-remote sensing: Generating images from ancient texts,","venue":null,"work_id":"8c52ec34-f710-4e1d-9edb-627a5400cdce","year":2019},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.608770Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:7b2d8d1660d2641b7cd08ce8987037ce0c0eab43d44099a892d7bd46a2fc4eed","observation_id":"72520896-280f-4ed0-a1fb-cc9197862542","resolution":{"observed_at":"2026-08-10T22:44:31.277555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.285464Z","title":"Dragdi ffusion: Harnessing di ffusion models for interactive point-based image editing,","venue":null,"work_id":"c938df92-4ef3-4eea-83a7-7b7a1df11410","year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.605138Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:cfd07494c00919d98e0752c89e1f408b5f9aee41d4d403c3e0c236ca856ea13c","observation_id":"b4c61fd1-1dcf-48fa-9484-7a6198405205","resolution":{"observed_at":"2026-08-10T22:44:31.289524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.246463Z","title":"Improving text encoding for retro-remote sensing,","venue":null,"work_id":"9c623a04-8b3e-4ac0-a5eb-b5c78a3fea4b","year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.615945Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:8e9aeff664aad034d5af70f4f538016e40554528b43d9fd793367cff27a9fdbe","observation_id":"aa793be8-fa34-4f99-91e5-7ea122600d58","resolution":{"observed_at":"2026-08-10T22:44:31.250341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.261260Z","title":"Retro-remote sensing with doc2vec encoding,","venue":null,"work_id":"e1795ddb-047f-46a8-90c6-4c88f45e2712","year":2020},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.612523Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:95ea485ad0448274dc040cd6b51072a5848bea3409cc42713f7aa322e8d0dabd","observation_id":"abf5dd06-7070-448c-a8db-372d8c405862","resolution":{"observed_at":"2026-08-10T22:44:31.265462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.228351Z","title":"Text-to-remote-sensing-image generation with structured generative adversarial networks,","venue":null,"work_id":"60457e55-eecb-4184-8a0e-68d979d46499","year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.622781Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:d5b8e54bb6ca77506c3eb6efe93b8b7fe65e8205f34e4f53dc261a7aa532f398","observation_id":"b8f73476-137a-4647-9f1c-f65b9e050d4f","resolution":{"observed_at":"2026-08-10T22:44:31.232517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.619506Z","title":"Distributed representations of sentences and documents,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.619506Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:410fde06956aebcdf2cd2c03a799b87efe0493d5d98d38ee6978219dc2126fa6","observation_id":"a2d5d335-9508-4a7b-82f6-82797bd084e7","resolution":{"observed_at":"2026-08-10T22:44:30.619506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02217","last_updated":"2021-04-28T07:24:49Z","snapshot_observed_at":"2026-08-10T14:03:30.039538Z","submitted_at":"2020-07-16T17:52:37Z","title":"Hopfield Networks is All You Need","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.02217","snapshot_observed_at":"2026-08-10T22:44:30.630011Z","title":"Hopfield networks is all you need,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.630011Z"},"links":{"cited_paper":"/paper/2008.02217","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:08c593df62784a2b44f655b770a49af2f189d3a69d5dcfc744d31436f2c14169","observation_id":"0ee12379-6fe6-444d-b0bb-c728a6414bdb","resolution":{"observed_at":"2026-08-10T22:44:30.630011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.218275Z","title":"Remote sensing image augmentation based on text description for waterside change detection,","venue":null,"work_id":"e3479239-f0c5-4bae-9c8b-424f3839585c","year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.626429Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:7cfb28ddc5db22f7f69aa0490c1b6714eae11f51a3260ff70dc7f96ed2763235","observation_id":"040490cb-7e4e-44c0-afaa-3d713c1e9773","resolution":{"observed_at":"2026-08-10T22:44:31.221740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.197279Z","title":"Di ffusionsat: A generative foundation model for satellite imagery,","venue":null,"work_id":"a2825156-bad3-465d-88e2-af633b85f48e","year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.637261Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:036222fc71347961b2fdc70e29bd8eb5448d1d6b2c5a8e84713f3b1418b5d37b","observation_id":"8de75e5d-7ef2-453c-9f8c-878fd587cf0e","resolution":{"observed_at":"2026-08-10T22:44:31.202142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.633768Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.633768Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:0f99f0424f52e795392714f99b8a0fe8e04fe86f16dabe8216fc29dd26e540b1","observation_id":"6f27da70-66d1-4282-9a05-9dfe103872de","resolution":{"observed_at":"2026-08-10T22:44:30.633768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.172746Z","title":"Rsdi ff: Remote sensing image generation from text using di ffusion model,","venue":null,"work_id":"d935ba78-9dd9-4f07-80f8-787d761fc8e1","year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.644325Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:081e4bb0549ba2d94bc155603a7b0a3bd5799b8ab3726c2937d68643baf1aa6e","observation_id":"acd5e799-811c-4d71-a80b-d3e96aab982c","resolution":{"observed_at":"2026-08-10T22:44:31.177697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.185304Z","title":"Crs-di ff: Controllable remote sensing image generation with di ffusion model,","venue":null,"work_id":"220996ee-2753-4819-b25c-c89bd92c496d","year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.640873Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:5b1b9e2d0f570dfc2c93c8837f1accf39932aacbad11f5f2a3d3a0e83fcf26e9","observation_id":"b7b33e29-ce4e-4a3d-a077-0b6dfcb966d9","resolution":{"observed_at":"2026-08-10T22:44:31.189263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.147401Z","title":"On creating benchmark dataset for aerial image interpre- tation: Reviews, guidances, and million-aid,","venue":null,"work_id":"740ba4d1-a282-4a53-9db6-d8d1e37ac00a","year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.651388Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:a42bd6632a06390ad371c1ba6fcacb2d26d128db7239e222a81c4dd8338a69b5","observation_id":"8021894e-8948-4915-bd43-fb0c95a3fb8a","resolution":{"observed_at":"2026-08-10T22:44:31.151535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.159651Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":"de48eb53-44b9-4c11-a29d-ae8c72328269","year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.647899Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:ec3fa0f2d5317925a46f478abcd8efe0da6192678e68f651e5fbd11dde7f6769","observation_id":"0f60b771-f526-4440-a2a5-d8de0cf8ebd3","resolution":{"observed_at":"2026-08-10T22:44:31.163982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.129321Z","title":"Ssl4eo-s12: A large-scale multimodal, multitemporal dataset for self-supervised learning in earth observation [software and data sets],","venue":null,"work_id":"564a605a-662b-4a9f-9c5b-86892c01e79a","year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.658905Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:4f7071e3c41bb402393539e67dd3f45702495910aa6721c823f2f6cac1a2a51c","observation_id":"a58aabbd-0ef7-483f-845e-628485505dba","resolution":{"observed_at":"2026-08-10T22:44:31.132910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.654980Z","title":"Towards geospatial foundation models via continual pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.654980Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:01c50e3addf120905ad63ea78c5953f27e758e4db7698ec53312472e068d9574","observation_id":"38676fec-b851-42c4-aa98-ae356e1e6548","resolution":{"observed_at":"2026-08-10T22:44:30.654980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.665923Z","title":"Object detection in optical remote sensing images: A survey and a new benchmark,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.665923Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:c4c32ed18d1c378a514ab28e2070f752b60c1d7d505d23c7b7804048b94a7130","observation_id":"f1a9b526-11a6-4b4f-8fbc-e7f0fb5e0efc","resolution":{"observed_at":"2026-08-10T22:44:30.665923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.662371Z","title":"Skyscript: A large and semantically diverse vision-language dataset for remote sens- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.662371Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:f316cd7b7921fb21b3318099b9d5f1a38d08e4446285cf71951a2b427d20da79","observation_id":"8f584eab-ace8-4fab-b053-858fa1b831e3","resolution":{"observed_at":"2026-08-10T22:44:30.662371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T22:44:30.673425Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.673425Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:55e339c0c07d9304196bf4a27d4fb5a3b9e245257818f1c03ab7b187267035fd","observation_id":"b0be3d21-bd58-498c-af38-da7e136354c5","resolution":{"observed_at":"2026-08-10T22:44:30.673425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.10450","last_updated":"2020-01-10T11:31:17Z","snapshot_observed_at":"2026-08-04T07:16:52.057908Z","submitted_at":"2017-05-30T03:53:03Z","title":"RSI-CB: A Large Scale Remote Sensing Image Classification Benchmark via Crowdsource Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.10450","snapshot_observed_at":"2026-08-10T22:44:30.669682Z","title":"Rsi-cb: A large scale remote sensing image classification benchmark via crowdsource data,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.669682Z"},"links":{"cited_paper":"/paper/1705.10450","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:99fa38bfd90f88f1171f4a19eac5a256d57006eb5cbb62a8be6034a6cfa0997d","observation_id":"a95cd16a-53c0-40b6-84ed-2d004c9f731c","resolution":{"observed_at":"2026-08-10T22:44:30.669682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.679409Z","title":"Rethinking the inception architecture for computer vision,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.679409Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:4cbe4cad7d4613f09b0f73d4a047ac55c234a0fea3031cde234ee1f8c9d0dd48","observation_id":"69b01659-dd1a-42ab-bc59-38fb5133f673","resolution":{"observed_at":"2026-08-10T22:44:30.679409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T22:44:30.676319Z","title":"Classifier-free di ffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.676319Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:6bbc02502e5f032f74cf9462c142f320ec437e2531f97719be8a6187eabbbc8a","observation_id":"4da06e71-e419-400d-b849-af9b1c6a0534","resolution":{"observed_at":"2026-08-10T22:44:30.676319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T22:44:30.685235Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.685235Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:9c16d8915fa0bda3e5feb9733d7526f1e320ebb5b80b8cdc16991c077e748716","observation_id":"b6624479-3f34-4ff6-b377-c227369b8c2e","resolution":{"observed_at":"2026-08-10T22:44:30.685235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:31.094929Z","title":"Dae-gan: Dynamic aspect-aware gan for text-to-image synthesis,","venue":null,"work_id":"9834a3ad-5bcd-4277-854e-d28471610b37","year":2021},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.682364Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:68a5cf1d804f253edc3fbb26f10d029591fcbe7826799cc73300231277bd615e","observation_id":"52f35960-d054-4875-9de8-663d35e35942","resolution":{"observed_at":"2026-08-10T22:44:31.100887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.688266Z","title":"Remoteclip: A vision language foundation model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.688266Z"},"links":{"citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:40cacbc4e0f1eb432cbff38ecbf5c7a8567d872082263fdd448089b62a57e3d2","observation_id":"357da7f1-28b7-4e83-8172-85910e72a919","resolution":{"observed_at":"2026-08-10T22:44:30.688266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16164","last_updated":"2024-11-25T07:40:32Z","snapshot_observed_at":"2026-07-06T19:56:21.333277Z","submitted_at":"2024-11-25T07:40:32Z","title":"Text-to-Image Synthesis: A Decade Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16164","snapshot_observed_at":"2026-08-10T22:44:30.385651Z","title":"Available: https: //arxiv.org/abs/2411.16164","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.385651Z"},"links":{"cited_paper":"/paper/2411.16164","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:f0b758dd3f5cba1292ef4a1d7d59673429b3a7f6b32af7a5017cb66e889406f5","observation_id":"c98701ab-e158-4a69-a577-23fcfaa51e1b","resolution":{"observed_at":"2026-08-10T22:44:30.385651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 4 inbound Pith citation observations for arXiv:2501.00895."}