{"as_of":"2026-08-14T08:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:463deabe356b8e3159944ed16ea83b4a313981ed6822ae5fddeac5a8e4249ce1","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:18:21.438754Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:05.499836Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:14:11.438315Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20742","snapshot_observed_at":"2026-08-04T16:16:50.580454Z","title":"UniRS: Unifying multi- temporal remote sensing tasks through vision language mod- els.arXiv preprint arXiv:2412.20742, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02039","last_updated":"2026-08-04T02:55:12Z","snapshot_observed_at":"2026-08-13T14:28:38.436551Z","submitted_at":"2026-08-03T10:34:42Z","title":"RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T16:16:50.580454Z"},"links":{"cited_paper":"/paper/2412.20742","citing_paper":"/paper/2608.02039"},"observation_digest":"sha256:a0498e4cdaa6fda4f780c426bd912268fb02ee7e5f9514ae743c0021b1c4b6a3","observation_id":"7285c014-15ee-4005-8ea9-9c153e94f6a6","resolution":{"observed_at":"2026-08-04T16:16:50.580454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"cited_work":{"arxiv_id":"2412.20742","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20742","snapshot_observed_at":"2026-08-07T00:14:11.438315Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","venue":"cs.CV","work_id":"b0f5113b-3947-4d6a-9b24-a774f6a7cd99","year":2024},"citing_paper":{"arxiv_id":"2608.02039","last_updated":"2026-08-04T02:55:12Z","snapshot_observed_at":"2026-08-13T14:28:38.436551Z","submitted_at":"2026-08-03T10:34:42Z","title":"RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:05.499836Z"},"links":{"cited_paper":"/paper/2412.20742","citing_paper":"/paper/2608.02039"},"observation_digest":"sha256:31413bdfab4b27e6e671abc78478786c57860f476fe261c1f01c4d337fa05df7","observation_id":"0df9cd09-f311-4e22-8d2e-b4f62b846751","resolution":{"observed_at":"2026-08-07T00:14:11.514686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.20742/citation-record","integrity":"/paper/2412.20742/integrity","json":"/paper/2412.20742/citation-record.json","paper":"/paper/2412.20742"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.410659Z","title":"Visual instruction tuning,","venue":null,"work_id":"6b313922-4ce4-4239-8162-96fbe78fc294","year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.129990Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:46db9c19b199ac8369bdface76efa1554cac61bf24778660c804984f015d237f","observation_id":"cfdd125b-a09c-4491-883a-9cbe2377ad50","resolution":{"observed_at":"2026-08-10T23:18:23.458753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.361990Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"8a2317db-55d8-43ae-8545-84af5c5d7efa","year":2022},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.136231Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:9bf0db78d9ab5d2f8a417f4e469bb2b64a2519f637ae954527af4ffd8d68d358","observation_id":"ce25b4aa-3cbd-43d6-8ce7-7b336e7685b2","resolution":{"observed_at":"2026-08-10T23:18:23.367346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.344947Z","title":"Vila: On pre-training for visual language models,","venue":null,"work_id":"3c61342c-8d33-4237-a593-d5e9edf53fe6","year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.141609Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:d4363869eb66d11d9abfa5418e9c9bed51292d907f3e8c7d91b9a07b25e5a62d","observation_id":"530008c7-1235-4052-950f-d8ec06735c83","resolution":{"observed_at":"2026-08-10T23:18:23.350477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-10T23:18:21.147250Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.147250Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:1279a37c0dc28a1939f70a83e0aaa1460912691ff40ab50ba2128a0ef5f30924","observation_id":"fbe617b2-21fb-44de-8a92-073732e6ca3c","resolution":{"observed_at":"2026-08-10T23:18:21.147250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.327054Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"99e02231-b2c0-465c-83cf-169603af2832","year":2022},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.153597Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:78ee465cbaa034f8bdab9ad2b775167ee46610456d9e24aaefafe42d51bfa074","observation_id":"06d2b9f4-d435-4e2c-9e8b-d09ecacff320","resolution":{"observed_at":"2026-08-10T23:18:23.333186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.308462Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"9b3fd776-75a9-44d5-8261-2cca003357c6","year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.158791Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:03be88cc2641a9ccc56403ee13e96e2e8dfa506befec09e2931a2906d2362927","observation_id":"799829fc-f48b-40d5-9955-a60296e47ea9","resolution":{"observed_at":"2026-08-10T23:18:23.315300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T23:18:21.164175Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.164175Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:250d6c3206d8a9fbbc75954e2bedaf41d9f0ee1a3665bc65fc41ed90a99be59d","observation_id":"21c7731b-5099-4296-a867-84ceff71c929","resolution":{"observed_at":"2026-08-10T23:18:21.164175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.289859Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":"d32f7a21-8c47-4d8b-8d52-7679c01c7cc0","year":2022},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.170197Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:edf8f5d1bf7c3722dc2b4237f703cf58672a541e8076efa72901435f6bdb8dec","observation_id":"df83d8ad-0e80-44f5-a8c3-905779f10e98","resolution":{"observed_at":"2026-08-10T23:18:23.296497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T23:18:21.175296Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.175296Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:044c3f9c6981dc604a23b409dc7de73d40241ddf8e1454859a7564d4fd60c710","observation_id":"c88ce50f-906b-4c8f-8b5d-37fc8e4da3d3","resolution":{"observed_at":"2026-08-10T23:18:21.175296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.273330Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":"c3809b28-f104-49e9-8658-8026d08170fd","year":1901},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.180320Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:3699f09b72156cefd9c2e65d8c2015fb7b4777605d50f9e3111147aa286000ff","observation_id":"5b31fda4-bd17-4c4d-9c1f-41a87607715a","resolution":{"observed_at":"2026-08-10T23:18:23.278960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.256801Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":"598189b6-7bd3-4684-a1c8-23e148a025ae","year":2022},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.185583Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:870f9efbcd8f1372ef64f34307664776fda70c92b9b6262f5ecd0baebfcaa40f","observation_id":"09aa9e4d-7db1-406f-b233-051a3d217e69","resolution":{"observed_at":"2026-08-10T23:18:23.261896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.240783Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day,","venue":null,"work_id":"fcfc122c-f5e3-47fb-a7fc-89fee70faab8","year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.190988Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:d81f4ad2160f459b38b5b4679411c77245fd4659dc335ee133b78357a2f03cbc","observation_id":"f3555b1b-c8ba-41f1-9012-807276725dd0","resolution":{"observed_at":"2026-08-10T23:18:23.245810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07775","last_updated":"2024-07-12T14:37:08Z","snapshot_observed_at":"2026-08-12T23:24:55.990893Z","submitted_at":"2024-07-10T15:49:07Z","title":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07775","snapshot_observed_at":"2026-08-10T23:18:21.196144Z","title":"Mobility vla: Multimodal instruction navigation with long-context vlms and topological graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.196144Z"},"links":{"cited_paper":"/paper/2407.07775","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:875f41d40053584fd645ce9d2f06b44b36ebb964e32ecf117ea27706ad634039","observation_id":"f0d34255-e33e-49db-837d-38721ecf3295","resolution":{"observed_at":"2026-08-10T23:18:21.196144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.224317Z","title":"Rsvqa: Visual question answering for remote sensing data,","venue":null,"work_id":"b1078212-9e13-4d0d-9e50-669a238fac36","year":2020},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.201942Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:46c180994647fdd44fae1bbef0b3f2f7748299de2f446fae89561c6ecf6ec895","observation_id":"4632d040-0eac-4350-aef7-8a6f7e96d63c","resolution":{"observed_at":"2026-08-10T23:18:23.229120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.207477Z","title":"Answer-type prediction for visual question answering,","venue":null,"work_id":"a3d48871-f66e-4d82-b176-591f18fcf2f5","year":2016},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.208078Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:f41d7b9b99e6384d9e96a6cb4a2f56ab2036a7e87a39030618f1825ebec62ee2","observation_id":"f0c8b997-0e45-4fcd-b1dd-eba28ef142ce","resolution":{"observed_at":"2026-08-10T23:18:23.212597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:23.103907Z","title":"Multi-step question-driven visual ques- tion answering for remote sensing,","venue":null,"work_id":"00192ada-3fa9-477f-bbca-272f5e10c707","year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.213271Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:df992c93f400d068834cfa8b06c6706e91524c324022040ec49b8ece045d6a12","observation_id":"ea401cdc-6899-4110-a644-8fcca327b6c4","resolution":{"observed_at":"2026-08-10T23:18:23.160301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.968580Z","title":"Bi-modal transformer-based approach for visual question answering in remote sensing imagery,","venue":null,"work_id":"79fcba1e-59c3-4b4c-8f98-8caf8c873195","year":2022},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.218321Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:948244f809d26be276e084991712b186f93defe84b67eaf54523776b91dd99f3","observation_id":"7652e053-07a3-41f4-8123-ab8624cd9906","resolution":{"observed_at":"2026-08-10T23:18:23.051315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.859969Z","title":"Changes to captions: An attentive network for remote sensing change captioning,","venue":null,"work_id":"637823ad-c78a-45a2-b424-8ebf74ade90d","year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.224247Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:9d13fa3fda4baa368404fd0e971d0a19d705fe857a7e4d67666cd49cc2b1c37f","observation_id":"d79f23aa-1b6c-4153-b41b-a9432905d186","resolution":{"observed_at":"2026-08-10T23:18:22.907158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.789985Z","title":"Progressive scale-aware network for remote sensing image change captioning,","venue":null,"work_id":"519d0b8e-4cdb-4776-9b5e-9e7c58e1b389","year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.229092Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:429d56631a522758bb3554825a86c6383c3d7ea5da90b258301a6b45785d8075","observation_id":"9ddb6af0-974c-41dc-a04d-b6a1edf19bfc","resolution":{"observed_at":"2026-08-10T23:18:22.805680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.774572Z","title":"Futh-net: fusing temporal relations and holistic features for aerial video classification,","venue":null,"work_id":"a2eea124-6737-45ae-9ecf-d455120ad64e","year":2022},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.234463Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:0a641f7a48a97e16fa924246937cdc8ef83ae9881ea68e4f1c87bb295b44df18","observation_id":"12399aa5-b068-4bfb-beb3-a61dc53e7f88","resolution":{"observed_at":"2026-08-10T23:18:22.779334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.756947Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge,","venue":null,"work_id":"4dffacce-1d30-48a6-b171-b6749b7c6687","year":2019},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.240700Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:fa31fd4bf87e22fbd832c8456d96687a56297358815f4b58b268e1d937f05b02","observation_id":"9362b406-f560-4720-b98e-23397670ffe5","resolution":{"observed_at":"2026-08-10T23:18:22.762710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.739079Z","title":"Deep learning based event recognition in aerial imagery,","venue":null,"work_id":"0fef890c-9145-4943-82f4-fe5399e4cd2f","year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.247367Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:5c53e55b8f89e343626818b87c656dbff4fb7d0309d33d88972f28b2a908f875","observation_id":"76fd99e3-cf0a-4563-a1de-b0420b434339","resolution":{"observed_at":"2026-08-10T23:18:22.744621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.721881Z","title":"A decoupling paradigm with prompt learning for remote sensing image change cap- tioning,","venue":null,"work_id":"43e9d4af-22f1-4074-962f-385a7d47302b","year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.254060Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:2166a89351d155b7476f206577a10867501b625ac8521c0a5329c11e20fc6a1e","observation_id":"4ad2a81b-9a8d-4704-904f-80df22718a0b","resolution":{"observed_at":"2026-08-10T23:18:22.727137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02544","last_updated":"2024-07-16T01:40:34Z","snapshot_observed_at":"2026-08-13T04:27:18.680428Z","submitted_at":"2024-02-04T15:46:43Z","title":"LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02544","snapshot_observed_at":"2026-08-10T23:18:21.260642Z","title":"Lhrs-bot: Empowering remote sensing with vgi-enhanced large multimodal language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.260642Z"},"links":{"cited_paper":"/paper/2402.02544","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:ae873258ea1363bafb0e76578857437c368665acc5300a0dbb92f90729fd2eb3","observation_id":"1892636e-0c9b-4294-a9e2-aee3f275b794","resolution":{"observed_at":"2026-08-10T23:18:21.260642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.703055Z","title":"Geochat: Grounded large vision-language model for remote sensing,","venue":null,"work_id":"c840ffc7-5b91-451b-837a-29ef6af61542","year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.266215Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:20b5ba3444838c34456073ca6a9e8ea8e5cd9f24723671b73519194c946db274","observation_id":"806d599f-8e76-4721-a274-ab799ca5cd0e","resolution":{"observed_at":"2026-08-10T23:18:22.709468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09712","last_updated":"2024-01-18T04:10:20Z","snapshot_observed_at":"2026-08-13T04:40:10.480486Z","submitted_at":"2024-01-18T04:10:20Z","title":"SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09712","snapshot_observed_at":"2026-08-10T23:18:21.272731Z","title":"Skyeyegpt: Unifying remote sensing vision-language tasks via instruction tuning with large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.272731Z"},"links":{"cited_paper":"/paper/2401.09712","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:1fac7306d44e2ed09b9bd2cace07f97f3fe35f6a829c106aa147ae35fda951b4","observation_id":"1a1863ba-bd5f-4407-a0d8-7a0c620301cd","resolution":{"observed_at":"2026-08-10T23:18:21.272731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06234","last_updated":"2025-01-27T01:45:15Z","snapshot_observed_at":"2026-08-12T22:27:57.483365Z","submitted_at":"2024-10-08T17:45:51Z","title":"TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06234","snapshot_observed_at":"2026-08-10T23:18:21.279759Z","title":"Teochat: A large vision-language assistant for temporal earth observation data,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.279759Z"},"links":{"cited_paper":"/paper/2410.06234","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:eb8c2901a0c0225f872f6f3b96d930fbc6a62f864421310a21fc5f8875273973","observation_id":"3e974fef-266d-4b36-9be6-62a27b8b8c7d","resolution":{"observed_at":"2026-08-10T23:18:21.279759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.661808Z","title":"Rs- llava: A large vision-language model for joint captioning and question answering in remote sensing imagery,","venue":null,"work_id":"82f2eeb6-c902-40bf-8608-25653374bd38","year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.288265Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:95b10654c9b08a83964aa52fe61c468ddc70935efb580fffb93828fc4c945efe","observation_id":"4bab5494-172b-4a59-b513-4cb577f94817","resolution":{"observed_at":"2026-08-10T23:18:22.690464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15266","last_updated":"2023-07-28T02:23:35Z","snapshot_observed_at":"2026-08-13T10:45:48.484753Z","submitted_at":"2023-07-28T02:23:35Z","title":"RSGPT: A Remote Sensing Vision Language Model and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15266","snapshot_observed_at":"2026-08-10T23:18:21.294085Z","title":"Rsgpt: A remote sensing vi- sion language model and benchmark,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.294085Z"},"links":{"cited_paper":"/paper/2307.15266","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:b0e10ebdf37e7f1b6fac4d8f4d2ca2043b5323a019e2f76c174a449af9c91c18","observation_id":"0221ae97-370c-4d17-9822-1dfbd82cf01e","resolution":{"observed_at":"2026-08-10T23:18:21.294085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.588864Z","title":"Earthgpt: A universal multi-modal large language model for multi-sensor image comprehension in remote sensing domain,","venue":null,"work_id":"43acc4e6-4ad7-426b-9fbd-060c7d959a84","year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.301355Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:3befea64f7a531b04ad57ce14f0453ca41039dff5956f7d5aa8ef131adf5f28e","observation_id":"1362db8c-f70c-4af0-a999-173bbdf1a48f","resolution":{"observed_at":"2026-08-10T23:18:22.636011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.470028Z","title":"Remote sensing image change captioning with dual-branch transformers: A new method and a large scale dataset,","venue":null,"work_id":"10f7cb13-fc1e-4bc9-a255-6b02abec9208","year":2022},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.307209Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:acca24d770572dd3e879d45403032193ba83c59916f2cfba0b4fffc750ebdfcf","observation_id":"07501f7c-3e75-40cb-878c-73b447bb457e","resolution":{"observed_at":"2026-08-10T23:18:22.539895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.307122Z","title":"Era: A data set and deep learning benchmark for event recognition in aerial videos [software and data sets],","venue":null,"work_id":"e9acd6ab-7cfc-4681-8311-6743ee887999","year":2020},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.314462Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:b9256179468d56c729d6aa46459fc78213207292b0978c154725760817cd672d","observation_id":"7f315012-a026-4801-812b-b468fbf60e3c","resolution":{"observed_at":"2026-08-10T23:18:22.357789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T23:18:21.320759Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.320759Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:31098746280a37477b223a42ffdc21ce55b641e7c3de2f4add06794c4f6c7322","observation_id":"453961bf-5b70-47b7-8e70-968a953bf34f","resolution":{"observed_at":"2026-08-10T23:18:21.320759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.271890Z","title":"Zero-shot video moment retrieval from frozen vision-language models,","venue":null,"work_id":"21e4eb4e-34d5-40f1-aba8-fad2e8856d1d","year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.327714Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:854ce334c87ad847c4b4594c97ba0fbd81ea71ffed26f6e3922edf124c31ce8a","observation_id":"ad6d56c1-74cf-41cb-bd94-3a6849e34b0f","resolution":{"observed_at":"2026-08-10T23:18:22.280819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.248847Z","title":"Visual narratives: Large-scale hi- erarchical classification of art-historical images,","venue":null,"work_id":"5b3ea807-f308-4568-bd30-416c12e28f96","year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.334898Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:76fd66002d10d6b5f5d8c0fc6494916256e20c36f34322fa0b8bef82e0cf308c","observation_id":"9c85abab-b506-4dbb-ac5f-f504453a2c63","resolution":{"observed_at":"2026-08-10T23:18:22.255200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:22.079783Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"36faeca3-51f4-4f06-8ae2-953ba761411f","year":2021},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.341042Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:0519f7af3e25f00feddcf40b11b2eb8eac4e01acbbb44accfccda9d84050d8ce","observation_id":"184674d7-b23c-4a64-ad60-e2dc6ce7cb30","resolution":{"observed_at":"2026-08-10T23:18:22.162406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.990342Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"9e4027b5-6c15-43e3-b1e6-f8c5c74398d1","year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.346292Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:1b76a2217d191b037eb8619f2b0284402c445fbeb0c30a80f498d03e4c404adc","observation_id":"ea49b646-97eb-4168-8986-1375fd0d1da5","resolution":{"observed_at":"2026-08-10T23:18:22.028018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.973904Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":"23a007c6-7bca-4806-a685-98780a2e759e","year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.350968Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:5a496969da05fac320a23e885e5e1cee3ebc5f84799fdd66c857cf94d83d9a1b","observation_id":"fddb3fee-08e5-48ad-b128-9367fe93cd6c","resolution":{"observed_at":"2026-08-10T23:18:21.979100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-08-12T23:42:36.797128Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-10T23:18:21.355874Z","title":"Skysensegpt: A fine-grained instruction tuning dataset and model for remote sensing vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.355874Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:8af11767e43d33f9d83e39cc2a2d07bee2056e69bdfb1531cfeaebd1b20b5c9a","observation_id":"f3867446-ec3d-4bc5-b5ed-6bd479515b0e","resolution":{"observed_at":"2026-08-10T23:18:21.355874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.956858Z","title":"Nwpu- captions dataset and mlca-net for remote sensing image captioning,","venue":null,"work_id":"2cf97f08-a4ac-4ce8-b0b1-fbf540ddecca","year":2022},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.360954Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:a7c4068c1a608590f33f9fd2477f1a0485a3529f7669aefde106f7afebc3fa15","observation_id":"210f211f-57c8-45f8-82e3-8aea311fc432","resolution":{"observed_at":"2026-08-10T23:18:21.962185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.939061Z","title":"Multiscale spatio- temporal network for aerial video event recognition,","venue":null,"work_id":"54434dba-e5ca-4cbc-a349-c4e9b1d464fa","year":2022},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.365922Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:8a253205ebd6734f13b110e385ab729043782887db6507889df4f4249f191eed","observation_id":"f960d65f-2fc5-4c05-b7da-203a8ee61fcd","resolution":{"observed_at":"2026-08-10T23:18:21.945407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.921426Z","title":"Alleviating spatial misalignment and motion interference for uav-based video recognition,","venue":null,"work_id":"df328a1f-ff51-4c11-8e66-f75911117c4d","year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.370699Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:72be5e6ad8b1cd26c85b61063799d0b9c291c8a103a7c0a54224e8bcb0baae26","observation_id":"884a5ea8-b3bf-4a5c-9ed4-4c0d35801b68","resolution":{"observed_at":"2026-08-10T23:18:21.926977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.903816Z","title":"Multitask learning: A knowledge-based source of inductive bias,","venue":null,"work_id":"820ea0eb-5491-42fd-a6e8-cdcb6dfa2950","year":1993},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.375349Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:07ca9f3e4af8e7a4a051ba2420065892a03f99922c4145fd8590d25bf47dc874","observation_id":"d9ef3b67-f80d-40f8-a649-9074db3cdc69","resolution":{"observed_at":"2026-08-10T23:18:21.909314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.885093Z","title":"Multitask learning,","venue":null,"work_id":"ad5d6dc4-d1f1-4427-91b2-4ac894469141","year":null},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.380080Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:8c8efb28f1606e4f6e327c70bc1ad94eaf3c85c02b4802bf1ca95dc4d3796090","observation_id":"d7233d7c-ecbd-49bf-992d-7220d1f77ccf","resolution":{"observed_at":"2026-08-10T23:18:21.890641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.867149Z","title":"Multitask learning for crash analysis: A fine-tuned llm framework using twitter data,","venue":null,"work_id":"cc32214b-c535-4997-95c0-26a052004ff7","year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.384800Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:3b0a1e48053bdce207c492e377ec51c21fd17586654f4fa70dcbe147305de82d","observation_id":"73f794b3-9073-475d-a394-c26c4b5a34de","resolution":{"observed_at":"2026-08-10T23:18:21.873166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08688","last_updated":"2023-12-15T01:42:20Z","snapshot_observed_at":"2026-08-13T05:02:45.595957Z","submitted_at":"2023-12-14T07:05:42Z","title":"TigerBot: An Open Multilingual Multitask LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08688","snapshot_observed_at":"2026-08-10T23:18:21.389831Z","title":"Tigerbot: An open multilingual multitask llm,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.389831Z"},"links":{"cited_paper":"/paper/2312.08688","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:54185c41314784bd47dc0f107753012abfa1ea844444499740fb112c26679d37","observation_id":"2199e715-5976-4748-bfc8-cc11eb5bce13","resolution":{"observed_at":"2026-08-10T23:18:21.389831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.850161Z","title":"Mftcoder: Boosting code llms with multitask fine-tuning,","venue":null,"work_id":"1d72d095-e08b-4407-b90f-1137bc79f00a","year":2024},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.394659Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:367dfd8a7ac7bc3c38c8441435c922e87feb746b723215cff690eb17b8dc2922","observation_id":"ce2dd9f4-c4d0-4e63-9ac2-b06eb3a7eb98","resolution":{"observed_at":"2026-08-10T23:18:21.855590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-13T05:52:56.563579Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-10T23:18:21.398995Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.398995Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:0c86fa4d8424ae1c24c2e260e12a9dd1ce9ffc3249b05ecbeedcdb54401f4890","observation_id":"e7289dbe-7768-43e2-a089-033eeb79ff8e","resolution":{"observed_at":"2026-08-10T23:18:21.398995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.832131Z","title":"Dota: A large-scale dataset for object detection in aerial images,","venue":null,"work_id":"864639e1-0ab2-42fd-95d1-e1108f211f57","year":2018},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.404590Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:a8ce9972b7c46700910489ed6a1b8f30f800136d9c4f953d34f8e4d8200b7b0e","observation_id":"bb21a836-9d5c-4f3c-9b37-2b0d49b7ab2c","resolution":{"observed_at":"2026-08-10T23:18:21.837573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.813835Z","title":"Anchor- free oriented proposal generator for object detection,","venue":null,"work_id":"115e63d8-038a-42bb-b8f4-17e4ba15c241","year":2022},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.409442Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:a8ea7dc9c59d30b0a71addf8b69ed94ad740217eee756083d4a9eed36521d6b1","observation_id":"cd9dd48d-bcf2-4dcb-a9ee-dc8d7bbafe6c","resolution":{"observed_at":"2026-08-10T23:18:21.820206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.795253Z","title":"Fair1m: A benchmark dataset for fine-grained object recognition in high-resolution remote sensing imagery,","venue":null,"work_id":"0845c881-f6d9-455e-af69-550d14c323e4","year":2022},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.413999Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:9b2f8b65fb300f338eaf859ac705e6d69f014f4af946c935e1ae2c447666c1ce","observation_id":"a556e187-3f3e-4375-bf3f-6d507618b135","resolution":{"observed_at":"2026-08-10T23:18:21.800383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.776736Z","title":"Remote sensing image scene classifi- cation: Benchmark and state of the art,","venue":null,"work_id":"c1c43066-6805-4765-9293-1420a12fab43","year":2017},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.419113Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:ad8f03eec1f187d0d9d8241c1c074ef07082701ac86cd2350a04d81f1c10b7b5","observation_id":"0baf7aa0-97f2-4948-9f25-6ba66454b5b6","resolution":{"observed_at":"2026-08-10T23:18:21.782752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.759151Z","title":"Floodnet: A high resolution aerial imagery dataset for post flood scene understanding,","venue":null,"work_id":"91c59018-4979-4e57-98c0-51fe4799d42f","year":null},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.424505Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:24114fc8fc79c1afe2fa1c8bdb44b641e6384d639afe3d86617575216e970a9d","observation_id":"c013b11a-333a-453e-9990-53ae176d121d","resolution":{"observed_at":"2026-08-10T23:18:21.764505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.738770Z","title":"A spatial-temporal attention-based method and a new dataset for remote sensing image change detection,","venue":null,"work_id":"dd2aa5d5-3221-4616-87fb-4338e897de07","year":2020},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.429256Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:47307ed74d3e8811aa756b6bdb2d8646b79fe2f376dda35fec73faad4dd73211","observation_id":"16960b0b-0ce9-47a7-84bf-a5a805e7ea54","resolution":{"observed_at":"2026-08-10T23:18:21.744693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.720723Z","title":"A spatial hierarchical reasoning network for remote sensing visual question answering,","venue":null,"work_id":"8de3e063-8992-4281-a225-14403d4e79e2","year":2023},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.434050Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:83be2220495e600c1622b483e9823f57d9a8e18982db5bc9965d62d578c70f5a","observation_id":"d3fff566-c8d6-4717-ba45-78a27bdbc18a","resolution":{"observed_at":"2026-08-10T23:18:21.726638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:18:21.698671Z","title":"Temporal rela- tions matter: A two-pathway network for aerial video recognition,","venue":null,"work_id":"96aa5dd8-dcf4-47ed-8354-c4c0eb3e40a0","year":2021},"citing_paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:18:21.438754Z"},"links":{"citing_paper":"/paper/2412.20742"},"observation_digest":"sha256:c8c0c18b91650d9593a169eca07c582abb76e2699506f52a57763e27678e7ab6","observation_id":"f4ccce72-88d5-4d46-9aa5-cc0389180fae","resolution":{"observed_at":"2026-08-10T23:18:21.706541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20742","last_updated":"2024-12-30T06:34:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T13:55:29.561149Z","submitted_at":"2024-12-30T06:34:18Z","title":"UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 2 inbound Pith citation observations for arXiv:2412.20742."}