{"as_of":"2026-08-19T16:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2c7e0aa394ba0cc6aeb45057203a300db77d4be51fff6014c3d473d9aea095d","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:26:44.966467Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.10144/citation-record","integrity":"/paper/2501.10144/integrity","json":"/paper/2501.10144/citation-record.json","paper":"/paper/2501.10144"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.540750Z","title":"Canopy averaged chlorophyll content pre- diction using convolutional autoencoder on hyperspectral data,","venue":null,"work_id":"90e7fe10-a755-4d08-be3b-a19129f95b2e","year":2020},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.847841Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:d77d7b5f2c39524894ee26cd9111437d04b9335a1e597620b3e9de56370f5de5","observation_id":"c1838a2c-9fe3-4eb5-bfcd-0e56e5146ecd","resolution":{"observed_at":"2026-08-10T19:26:45.545801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.526915Z","title":"Enhancing deforestation monitoring in the brazilian amazon: A semi-automatic approach leveraging uncer- tainty estimation,","venue":null,"work_id":"de6a0e7c-dbc7-4a1f-90b6-bb4a3b924507","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.852903Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:00a3c3a350c33e8c006ac5bb3ddca9978a737754d594a7b9fcbd19310fc82ed8","observation_id":"1694854d-5b7e-4220-8dee-6b573e39c490","resolution":{"observed_at":"2026-08-10T19:26:45.532352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.512714Z","title":"Sen1floods11: a georeferenced dataset to train and test deep learning flood algorithms for sentinel-1,","venue":null,"work_id":"b022a762-2baa-4471-88e1-29cfc0b90b89","year":2020},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.857234Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:9cb02644cfcd320ecd05fdb57aacc5cf17ec3addbc5b5f3db09d7e1094ef58e3","observation_id":"bc850173-9504-4c33-9c38-0a9ff8a53add","resolution":{"observed_at":"2026-08-10T19:26:45.517400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-10T19:26:44.861667Z","title":"Improved base- lines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.861667Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:944262420d974ea94593aca70031eb7c179c8b1793b623acd42459904dc64487","observation_id":"dbe34249-0774-4a29-bdf4-dcb65b466d23","resolution":{"observed_at":"2026-08-10T19:26:44.861667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:44.866767Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.866767Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:57bdad10c92cac66cc2651faae4d74610b31d9580da933483e7ad7df17531393","observation_id":"4cf2e9f3-cdc3-4d4f-a818-d66cdceaaecd","resolution":{"observed_at":"2026-08-10T19:26:44.866767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:44.870831Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.870831Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:40a837b61cc77e8908331e81e14a942b8fb0c0b96ccbbf715cc874b0314b1b88","observation_id":"4b4ef0d6-8697-41fc-9267-72625460c83d","resolution":{"observed_at":"2026-08-10T19:26:44.870831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:44.875200Z","title":"Blip- 3: A family of open large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.875200Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:9c4240680df13e16fdfa1ae8610d3270101396c2e541ed5e5f27fc44d32793e9","observation_id":"eb33002a-ee4f-46f5-ad82-f8456ef1c552","resolution":{"observed_at":"2026-08-10T19:26:44.875200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.484166Z","title":"Geochat: Grounded large vision- language model for remote sensing,","venue":null,"work_id":"59f86005-bb3d-4c7a-97dd-0f9838cab0d6","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.879243Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:1a34683bbe8d823d86ea38fd42d36ddb81732843ce786eee3f60f310600a4da5","observation_id":"2af9673b-755f-4fd6-ba7a-cd1e8b138c42","resolution":{"observed_at":"2026-08-10T19:26:45.488360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.471625Z","title":"Geollava: Efficient vision-language models for temporal change detection in remote sensing,","venue":null,"work_id":"1dd79035-2cea-4715-ba6f-d0f7f95b0e7c","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.883227Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:1d7ca4b505a5c030d28c7e12e3ce05477cee642c254d96407a15d4160db239a5","observation_id":"e99ded90-b835-4b0e-adb9-5f79cfd646c5","resolution":{"observed_at":"2026-08-10T19:26:45.476126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-08-16T13:42:55.361342Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-10T19:26:44.887132Z","title":"Skysensegpt: A fine-grained instruction tuning dataset and model for remote sensing vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.887132Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:e197f7a3e2cbeaca3cfbe5a845bbbbb912d4f287404719d942e91c763178aea2","observation_id":"ca4e9245-c9bb-4459-b843-cc1052393104","resolution":{"observed_at":"2026-08-10T19:26:44.887132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03653","last_updated":"2025-05-16T15:49:37Z","snapshot_observed_at":"2026-08-17T05:51:32.442538Z","submitted_at":"2024-07-04T05:48:28Z","title":"reBEN: Refined BigEarthNet Dataset for Remote Sensing Image Analysis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03653","snapshot_observed_at":"2026-08-10T19:26:44.891341Z","title":"reben: Refined bigearth- net dataset for remote sensing image analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.891341Z"},"links":{"cited_paper":"/paper/2407.03653","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:ec9df676f35433fe764eb1daa5e68caace7eac6a19a339c6349770fcf949d4d8","observation_id":"fd2f19f5-4f7e-45d9-8907-80706657e817","resolution":{"observed_at":"2026-08-10T19:26:44.891341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12134","last_updated":"2023-11-20T19:34:58Z","snapshot_observed_at":"2026-08-16T14:41:43.392896Z","submitted_at":"2023-11-20T19:34:58Z","title":"First principles residual resistivity using locally self-consistent multiple scattering method","version":1},"cited_work":{"arxiv_id":"2311.12134","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.12134","snapshot_observed_at":"2026-08-10T19:26:45.080890Z","title":"First principles residual resistivity using locally self-consistent multiple scattering method","venue":"cond-mat.mtrl-sci","work_id":"3addaa2f-7594-4f91-a1cc-ea9e3288c1ac","year":2023},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.895190Z"},"links":{"cited_paper":"/paper/2311.12134","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:8eb8b211c03d3e7f9d396cc658e60ef106c79693a45006fd69f5ba157619b0d1","observation_id":"4863534a-e817-46a7-9594-825c2c60a759","resolution":{"observed_at":"2026-08-10T19:26:45.085727Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.459468Z","title":"Spectral reconstruction from satellite multispectral imagery using convolution and transformer joint network,","venue":null,"work_id":"3845bdf2-fd16-4a01-8943-7d50c0dee356","year":2023},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.899023Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:cedd2601128d84efa3927a78303ed74b20f4455c0747ae47652fe0c89cc891ca","observation_id":"58760e58-4351-44e1-a8ab-6582f79edd20","resolution":{"observed_at":"2026-08-10T19:26:45.463752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.447084Z","title":"Ringmo: A remote sensing foundation model with masked image modeling,","venue":null,"work_id":"59a06572-ce45-411b-932e-7f368070a1e0","year":2022},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.902304Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:f26d5c3725d4bd6969bf344a643673a8d96aae754e25ef904d5a4a6b0483e0d9","observation_id":"061acac1-f5ce-41fb-b4cb-fef4bbe9b770","resolution":{"observed_at":"2026-08-10T19:26:45.451307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.434267Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":"44fdb73c-f7a3-4e22-be77-44ba5ae878f8","year":2022},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.906082Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:bc45cfb920f36f3ffbd6f153d0b55187e6498c85a0f10a94dc535a61dd75fb95","observation_id":"2cbe90f8-8d2f-4d07-94e2-66cf27b0fd8a","resolution":{"observed_at":"2026-08-10T19:26:45.438591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01922","last_updated":"2025-04-07T21:54:56Z","snapshot_observed_at":"2026-08-13T23:11:40.805368Z","submitted_at":"2024-12-02T19:12:14Z","title":"Late-time Evolution and Instabilities of Tidal Disruption Disks","version":2},"cited_work":{"arxiv_id":"2412.01922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01922","snapshot_observed_at":"2026-08-10T19:26:45.060020Z","title":"Late-time Evolution and Instabilities of Tidal Disruption Disks","venue":"astro-ph.HE","work_id":"7c6be218-d72c-492e-b76c-cce1753bd036","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.909901Z"},"links":{"cited_paper":"/paper/2412.01922","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:c5ec2a1c92fd5d7de8c5dc8bfe139f8faa9db118bafe9d102b22b03bc50b756e","observation_id":"bda0b774-b894-48e7-aaed-7e210aad771b","resolution":{"observed_at":"2026-08-10T19:26:45.067195Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.420559Z","title":"Spectralgpt: Spectral remote sensing foundation model,","venue":null,"work_id":"6e0ec9cc-f541-4f88-8d2c-6112fb4f98b2","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.913939Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:258bca6d82b62360150dd4a4d6a8c22bfab202f8f99c879ecb15eda745bdbba0","observation_id":"41ff7c79-c082-4b5c-9f4e-158b0e998fa9","resolution":{"observed_at":"2026-08-10T19:26:45.425343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.408310Z","title":"Rsgpt: A remote sensing vision-language model and benchmark,","venue":null,"work_id":"f7950980-3575-4522-83de-63f40d68fe0f","year":2023},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.917729Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:0e5a62b2a6e907eadb5e1e9114a4cde1094106064130e6f6bae515883d1f658a","observation_id":"21f93b25-e620-4a28-beb6-81179c3601da","resolution":{"observed_at":"2026-08-10T19:26:45.412442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.290597Z","title":"Earthmarker: A visual prompting multi-modal large language model for remote sensing,","venue":null,"work_id":"c7d9cc7f-e626-456e-94f8-b71daad8e362","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.921340Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:687b33615238180e3596c7c126435338bb0ce7180c2765c5b44b7755290beef1","observation_id":"1937ae6e-5625-4d8a-b76b-53a8f2514bc6","resolution":{"observed_at":"2026-08-10T19:26:45.400090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12345","last_updated":"2024-11-19T08:54:12Z","snapshot_observed_at":"2026-08-18T05:25:03.437039Z","submitted_at":"2024-11-19T08:54:12Z","title":"Combinatorics of generalized orthogonal polynomials of type $R_{II}$","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12345","snapshot_observed_at":"2026-08-10T19:26:44.925055Z","title":"Rs-moe: Mixture of experts for remote sensing image captioning and visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.925055Z"},"links":{"cited_paper":"/paper/2411.12345","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:74401d5703ff3e3c2863ad58ec4bb899a70876d585cd7f8b89733fb8c49425e8","observation_id":"afed98c1-59ec-4a35-877e-4be148390dd5","resolution":{"observed_at":"2026-08-10T19:26:44.925055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09301","last_updated":"2024-11-14T09:23:40Z","snapshot_observed_at":"2026-08-14T13:18:03.842763Z","submitted_at":"2024-11-14T09:23:40Z","title":"LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09301","snapshot_observed_at":"2026-08-10T19:26:44.930836Z","title":"Lhrs-bot-nova: Improved multimodal large language model for remote sensing vision-language in- terpretation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.930836Z"},"links":{"cited_paper":"/paper/2411.09301","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:d0bb6e10776086604635e13477ddd4c3dbba83fb738ef1c7f0f699f172f085ed","observation_id":"fb283d58-5694-487e-bbb6-c1bfaa93ed9c","resolution":{"observed_at":"2026-08-10T19:26:44.930836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11904","last_updated":"2025-05-10T15:43:29Z","snapshot_observed_at":"2026-08-18T10:59:15.089999Z","submitted_at":"2024-11-16T05:12:11Z","title":"GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11904","snapshot_observed_at":"2026-08-10T19:26:44.935014Z","title":"Geoground: A unified large vision-language model. for remote sensing visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.935014Z"},"links":{"cited_paper":"/paper/2411.11904","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:41cc8454156cadf564b0fc4c7ecc477f8ed1030253b50ade7d089f36fe03a074","observation_id":"107ffc3c-f686-4b15-b1a2-65da33d38e76","resolution":{"observed_at":"2026-08-10T19:26:44.935014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.276444Z","title":"Skyeyegpt: Unifying remote sensing vision-language tasks via instruction tun- ing with large language model,","venue":null,"work_id":"15ed0b8d-a8a1-4ee0-8b00-d2b57d93a65e","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.939029Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:1dfc7c6b7faa5bcfccd7470095634349fc024a05062fc51495fd9745f10a37a6","observation_id":"d72f046e-e008-4199-937e-5e13bb5abb3f","resolution":{"observed_at":"2026-08-10T19:26:45.281077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.262294Z","title":"Ringmogpt: A unified remote sensing foundation model for vision, language, and grounded tasks,","venue":null,"work_id":"9eb6d007-a130-4f4b-a5d4-66d6ccb283aa","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.942758Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:8c83b80f280a92ff455fff08c186c3d8bf18131e5e73757ee685142636bf2885","observation_id":"d51d1951-6a09-4315-942c-46bc30b80357","resolution":{"observed_at":"2026-08-10T19:26:45.266758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.248560Z","title":"Teochat: A vision-language assistant for earth observation data,","venue":null,"work_id":"57432277-7187-4fd2-98b3-74e91da8de64","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.946669Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:18ec2ae44f2bd23b1bf62360537f04b5fe989cac531a03b3e07e1c11bb3c8e7b","observation_id":"f2d47d54-df15-40e7-9b89-6f41eef3f49c","resolution":{"observed_at":"2026-08-10T19:26:45.252934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12345","last_updated":"2024-07-17T06:39:52Z","snapshot_observed_at":"2026-08-16T13:33:32.468434Z","submitted_at":"2024-07-17T06:39:52Z","title":"VisionTrap: Vision-Augmented Trajectory Prediction Guided by Textual Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12345","snapshot_observed_at":"2026-08-10T19:26:44.950567Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.950567Z"},"links":{"cited_paper":"/paper/2407.12345","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:9665369daa51287507e905c1054ce7d0d30993d86f6fea9c549a0443f6d4fc19","observation_id":"b576194a-f80a-4478-a2ef-8059ee3c040e","resolution":{"observed_at":"2026-08-10T19:26:44.950567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.235391Z","title":"Functional map of the world,","venue":null,"work_id":"ad8b16f8-2ab5-42a8-a16e-eea6970ed599","year":2018},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.954718Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:9ccb96f60308aa429fcbe96f8dd0e7e913e29bcd784c70579f98736ac5499d3b","observation_id":"eeac5fb0-3a0c-4606-993f-0df4e692bf1e","resolution":{"observed_at":"2026-08-10T19:26:45.239515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.222466Z","title":"BigEarthNet: A large-scale benchmark archive for re- mote sensing image understanding,","venue":null,"work_id":"5969784f-156b-485c-a7f1-0d74b74168d8","year":2019},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.958497Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:dcefecef3368949d10404cc6b031ed91ae494fa0dc69db14d326bf73283e7463","observation_id":"5901d53d-5e2b-4278-b5c2-7c087f02401d","resolution":{"observed_at":"2026-08-10T19:26:45.227417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12345","last_updated":"2025-06-17T20:37:32Z","snapshot_observed_at":"2026-08-16T14:25:25.252287Z","submitted_at":"2024-01-22T20:20:48Z","title":"Distributionally Robust Receive Combining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12345","snapshot_observed_at":"2026-08-10T19:26:44.962285Z","title":"Earthgpt: A universal multi-modal large language model for multi-sensor image comprehension in remote sensing domain,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.962285Z"},"links":{"cited_paper":"/paper/2401.12345","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:6050d556a648fef3c3d486255f5170871a3ce59e2ab274ea5e9831e019ad640f","observation_id":"1d9f7c85-4c4c-4afb-8b45-e0d0ccc77b26","resolution":{"observed_at":"2026-08-10T19:26:44.962285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.210130Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":"890fa5fd-aae4-4f09-8186-431909aa431e","year":2019},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.966467Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:d0ebe4c823fe9c68cfb992e55fb26671a0833ae42f77682a4d08e9bacc60706e","observation_id":"8df9fe71-2f7c-403c-83cb-3bf198841104","resolution":{"observed_at":"2026-08-10T19:26:45.214254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T01:57:54.084487Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2501.10144."}