{"as_of":"2026-08-20T05:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c43d45b5c8afa715973dc486225b72b62bb935befd145ac20290f8e5e1126d23","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:46:17.694478Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.07396/citation-record","integrity":"/paper/2501.07396/integrity","json":"/paper/2501.07396/citation-record.json","paper":"/paper/2501.07396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.829348Z","title":"Automatic target recognition: State of the art survey,","venue":null,"work_id":"c52179c3-d42b-40e2-8110-c3568003be7f","year":1986},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.374768Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:a625cda4b9f17f19264e01216f74a164fe8c57ade8b61c29d236c5d46d7f9f1d","observation_id":"dc4496b5-fd0c-46ab-91f9-26c200c68b4c","resolution":{"observed_at":"2026-08-10T20:46:18.834997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.813314Z","title":"The automatic target-recognition system in saip,","venue":null,"work_id":"f87b0cfc-f0c1-4cd6-b2fd-386e5d110bdf","year":1997},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.381241Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:f4b43bc8709aa09643142146d4d97cc610181c9e73f4097c708bbb13a378307d","observation_id":"deb2b37f-8c78-4fad-99bb-31a88772cdd6","resolution":{"observed_at":"2026-08-10T20:46:18.818626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.796868Z","title":"Automatic target recognition based on simultaneous sparse representation,","venue":null,"work_id":"e93242aa-9f7a-4d07-a5a6-415029de7d0f","year":2010},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.387093Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:bf560535bc5cf3960bb9669c6a2bad77f35ba139e008f660d7786d49bcffabd7","observation_id":"628ebbc3-5f95-40f0-9ee2-26aa53bcd266","resolution":{"observed_at":"2026-08-10T20:46:18.802021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-10T20:46:17.392630Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.392630Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:bbbb96764c8e5b267adb3316c2a5550e5be80b3bd85cdd436f3373e62c835f06","observation_id":"4e6c73a9-c868-4b61-b8ca-88bb210ff7cb","resolution":{"observed_at":"2026-08-10T20:46:17.392630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.779073Z","title":"Accelerating very deep convo- lutional networks for classification and detection,","venue":null,"work_id":"30fba736-2651-4a77-969c-7b4c7ab58036","year":1943},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.398774Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:f7e9ada18b9cfadfb6e9ea732229a9244036c6ecd803af84e3c6d125ee6a1d03","observation_id":"46d17d76-732e-4fda-8706-f359b60fa1d1","resolution":{"observed_at":"2026-08-10T20:46:18.785148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.761209Z","title":"Object recognition and detection with deep learning for autonomous driving applications,","venue":null,"work_id":"e068ea46-76bf-4cab-ba0d-90a795609f5d","year":2017},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.405012Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:9ef79b69b3c06691e0fe94517ed86c140d6697e03f533be0adadec323df1c403","observation_id":"2ac91e57-5e08-4285-abd8-0f06487b36e1","resolution":{"observed_at":"2026-08-10T20:46:18.767055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.744078Z","title":"Review of current aided/automatic target acquisition technology for military target acquisition tasks,","venue":null,"work_id":"cb41456f-c602-44ee-a7b0-76da5ad33584","year":2011},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.411534Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:e1527e1e7ff990ed5d78ec040e18a5e81581f113852bac9d1df5f9fff35d6eac","observation_id":"2ee9df0e-93e5-4706-a3d3-096251c60349","resolution":{"observed_at":"2026-08-10T20:46:18.749576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.724780Z","title":"Ar- tificial intelligence for national security: the predictability problem,","venue":null,"work_id":"aea0597d-8bb1-4ab5-8e04-c5c213eecf2a","year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.416710Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:dd170de137cebf99ce1c988e480f57f64f806b0413a56ae699d7d28c66fc9492","observation_id":"d55f1fb0-da79-459d-b3b2-b17762f17f2c","resolution":{"observed_at":"2026-08-10T20:46:18.730995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.705364Z","title":"Autonomous vehicles and intelligent automation: Applications, challenges, and opportuni- ties,","venue":null,"work_id":"ba27a6d6-2c23-4fd7-9005-9cce3866f1e6","year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.421818Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:f24d8d06a9d3c16191798bb805972c38623749c0443eabedea9c45cd4c06a58f","observation_id":"fa2075fe-048a-4597-be49-ce93699e3c89","resolution":{"observed_at":"2026-08-10T20:46:18.711538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-10T20:46:17.427517Z","title":"Concrete problems in ai safety,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.427517Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:ad5b11449ae9802397c8d395275a9e1090e6fb6f7e7c8fb1d2a32efdabb98804","observation_id":"3b11ccae-5cf1-469f-a63c-e7a9d281d582","resolution":{"observed_at":"2026-08-10T20:46:17.427517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-10T20:46:17.433550Z","title":"Unsolved problems in ML safety,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.433550Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:cde1f3e6efa7053a8263146483be9c43f38a838f739088790d6c0f9f82ba932a","observation_id":"b605cf6d-5f96-4a3f-887d-4278d402d013","resolution":{"observed_at":"2026-08-10T20:46:17.433550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.687912Z","title":"Generalized out-of-distribution detection: A survey,","venue":null,"work_id":"42771fd0-eaf4-43d6-be89-11756ea5778e","year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.439485Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:c4e0a0721c978279c91da4e35f4cb48ee75294eba7e6e4a82d3f2df3c6fd35ad","observation_id":"7e493f4a-57f0-4958-b834-c7f3cf6430cd","resolution":{"observed_at":"2026-08-10T20:46:18.693809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21794","last_updated":"2025-06-18T17:03:35Z","snapshot_observed_at":"2026-08-16T13:29:26.889475Z","submitted_at":"2024-07-31T17:59:58Z","title":"Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21794","snapshot_observed_at":"2026-08-10T20:46:17.447333Z","title":"Generalized out-of-distribution detection and beyond in vision language model era: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.447333Z"},"links":{"cited_paper":"/paper/2407.21794","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:180add5131146274ce1233fbfa0165c710b2b88a00fde243adcc4bb58dd220bc","observation_id":"c93f806d-e52f-4c3d-9c85-3652a3a3388a","resolution":{"observed_at":"2026-08-10T20:46:17.447333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.668527Z","title":"Meta-uda: Unsupervised domain adaptive thermal object detection using meta- learning,","venue":null,"work_id":"65310d0f-caf0-43d1-ae87-6596b683a6e8","year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.456373Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:9fc331a173f78c64910b10d2be41e9d2e83225dcdf844fe70dd97edad1c48198","observation_id":"61e44d9c-526c-44a1-980c-317f19e760b2","resolution":{"observed_at":"2026-08-10T20:46:18.674478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01530","last_updated":"2019-12-29T21:38:54Z","snapshot_observed_at":"2026-08-12T14:09:35.242839Z","submitted_at":"2019-12-03T17:18:08Z","title":"On the Validity of Bayesian Neural Networks for Uncertainty Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01530","snapshot_observed_at":"2026-08-10T20:46:17.463672Z","title":"On the validity of bayesian neural net- works for uncertainty estimation,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.463672Z"},"links":{"cited_paper":"/paper/1912.01530","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:baa05fa7ded0c57e8567bbe3e4bef9e4d3cdd3f33bb337ac6dbd39759c9b45b1","observation_id":"887be8d0-66c2-46fd-b644-e42173d6e812","resolution":{"observed_at":"2026-08-10T20:46:17.463672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.645461Z","title":"Knowing the unknown: Open-world recognition for biodiversity datasets,","venue":null,"work_id":"0c16a490-a53d-4d2c-8d55-b90591da9fa2","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.470110Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:93d766b5eace580cb5f2020b129137a755ff021822d41d44534108682304a186","observation_id":"956611e8-b9d7-424e-b118-db9623b8799b","resolution":{"observed_at":"2026-08-10T20:46:18.654570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.07228","last_updated":"2024-12-01T17:59:04Z","snapshot_observed_at":"2026-08-19T20:46:34.368691Z","submitted_at":"2018-02-20T18:07:50Z","title":"The Malicious Use of Artificial Intelligence: Forecasting, Prevention, and Mitigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.07228","snapshot_observed_at":"2026-08-10T20:46:17.476115Z","title":"The malicious use of artificial intelligence: Forecasting, prevention, and mitigation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.476115Z"},"links":{"cited_paper":"/paper/1802.07228","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:6f56f6ee95d1bc0d7849f6632edb77c129acd929c9bd5a8d36e00626c0227525","observation_id":"afb4a997-c6af-4c7b-ab59-a2d84a370710","resolution":{"observed_at":"2026-08-10T20:46:17.476115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.626290Z","title":"The impact of cooperative perception on decision making and planning of autonomous vehicles,","venue":null,"work_id":"f28c3bc8-08c5-4ebc-9255-f62089aa624c","year":2015},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.482475Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:e4fe3f8080af4f909eff26acc8dd854cf90c6c2c81b4553aee0e467e623a1626","observation_id":"9f8c79a3-6e31-425a-a1cf-bcf827769365","resolution":{"observed_at":"2026-08-10T20:46:18.631899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.607221Z","title":"Towards open world object detection,","venue":null,"work_id":"627b39fc-0774-47da-a509-20de015537ad","year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.487875Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:46a1b118277738c0a672500a4eb0a548b1356c01ceb1721974daa9647f049ddb","observation_id":"18650a64-b00d-4e38-9f95-5c14fa8f8f0d","resolution":{"observed_at":"2026-08-10T20:46:18.612993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.586646Z","title":"Unidentified video objects: A benchmark for dense, open-world segmentation,","venue":null,"work_id":"3c21a551-2aea-4a9f-a391-4fb03bd81647","year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.494173Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:50ba1dae82e3bfa1858feb01e265d1d68ef6e7da2792aa19da7fe4456eb6c54c","observation_id":"3557120f-3e8a-499c-9c20-9c72cd041094","resolution":{"observed_at":"2026-08-10T20:46:18.593469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.564891Z","title":"Breaking the closed world assumption in text classification,","venue":null,"work_id":"968b0d3f-e7a0-44cb-bd50-d99f50b39c66","year":2016},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.500174Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:be028edd629424526f71586dc54a39fd42253f8f2189b893c62a67a3f048d3e6","observation_id":"ce836303-24dc-43b6-a461-a341b50e7740","resolution":{"observed_at":"2026-08-10T20:46:18.571725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.542274Z","title":"Dynamic few-shot visual learning with- out forgetting,","venue":null,"work_id":"3ad5fb2b-cb65-4186-8ff1-bea52174aa11","year":2018},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.505787Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:8d7b675399a63b3bd4f5e89c671dad93542f2cc0dd87420c19191fc1dc823aa5","observation_id":"ea92b599-17d7-46a9-a322-c5ba712bc5dc","resolution":{"observed_at":"2026-08-10T20:46:18.548146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.521018Z","title":"Online incremental learning algorithm for anomaly detection and prediction in health care,","venue":null,"work_id":"45e6a27c-333f-49f0-a972-4b5fe2d77f5e","year":2014},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.510843Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:ec5801995e1420c50be0ac93428364d8bd42cca0eba467aa8921253dbde8b5ab","observation_id":"8bcc5b1c-f476-4ad6-b3b0-f362cd51556f","resolution":{"observed_at":"2026-08-10T20:46:18.527791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.502839Z","title":"Detecting everything in the open world: Towards universal object detection,","venue":null,"work_id":"99039b90-9f23-416a-aa2c-ab984c3cb110","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.516029Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:713e1850670ec06b1095bc7416771a4b8d87131e2e9c51f87aabbcf2ca94b5ad","observation_id":"9cc440da-812c-4e8e-81a6-f3494dcd66f7","resolution":{"observed_at":"2026-08-10T20:46:18.508689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.484534Z","title":"Lifelong machine learning: a paradigm for continuous learn- ing,","venue":null,"work_id":"4e1e3654-8c45-4b33-a8ca-05cbd61fa0ac","year":2017},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.522741Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:eaed7cb0230e3cbcf7537c7d8fc38fba8e8b9909d015a22358df4511c156913a","observation_id":"395b5ec9-e5df-4c32-8794-52872d63dba4","resolution":{"observed_at":"2026-08-10T20:46:18.490491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.460990Z","title":"Advancing autonomy through lifelong learning: a survey of autonomous intelligent systems,","venue":null,"work_id":"2b368eea-f0e1-43b9-8918-bb4fa54623b5","year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.528493Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:e1bb5bd2a30c853810be1844be38c948a1ba6b72f5558b8ebd6ea1e8e6c10dfa","observation_id":"d5228723-27a2-4274-85bc-936f8796d8c8","resolution":{"observed_at":"2026-08-10T20:46:18.469681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.534017Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.534017Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:348676f2e47f1b5e60cf6d2b10532a4b056c4b518c6310421f75dc55694fa265","observation_id":"6e3661ee-815a-40ac-8a20-e8605608929b","resolution":{"observed_at":"2026-08-10T20:46:17.534017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10936","last_updated":"2022-07-16T01:27:59Z","snapshot_observed_at":"2026-08-18T08:41:13.372775Z","submitted_at":"2022-02-18T15:15:46Z","title":"A Survey of Vision-Language Pre-Trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10936","snapshot_observed_at":"2026-08-10T20:46:17.539061Z","title":"A survey of vision-language pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.539061Z"},"links":{"cited_paper":"/paper/2202.10936","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:70c08d20463fe61cbbc2ec6479dbe9fc4907f5d56614d5b54d6f320098233959","observation_id":"3028b6c9-a367-4e3b-8cfd-16f1f431f59b","resolution":{"observed_at":"2026-08-10T20:46:17.539061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.545977Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.545977Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:4fe4f8c601a27433236f790a4567533b7f631a593934ec673a9e2c42fc9bdcf9","observation_id":"b8fdba8b-e753-4669-865b-9acaaae85c12","resolution":{"observed_at":"2026-08-10T20:46:17.545977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.407790Z","title":"Clip and complementary meth- ods,","venue":null,"work_id":"ac67dbde-6adb-4f94-bb0d-f6babcfa7c68","year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.552208Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:201e853128e8b6049c91882bb5985a9d1be9d8decc816dd164e2c902d797b249","observation_id":"7288af76-c6fe-4578-8b7d-3f916fb0e767","resolution":{"observed_at":"2026-08-10T20:46:18.415380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10340","last_updated":"2025-03-07T04:01:59Z","snapshot_observed_at":"2026-08-16T17:56:11.084974Z","submitted_at":"2024-02-15T22:01:45Z","title":"On the Vulnerability of LLM/VLM-Controlled Robotics","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10340","snapshot_observed_at":"2026-08-10T20:46:17.557968Z","title":"On the safety concerns of deploying llms/vlms in robotics: Highlighting the risks and vulnerabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.557968Z"},"links":{"cited_paper":"/paper/2402.10340","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:ae49c7973a3e515df71b3e3085d29d469efa5b79fa00fa983d36d2384d0e211d","observation_id":"e7909ff5-7b6c-4221-ab62-1b96b31c740a","resolution":{"observed_at":"2026-08-10T20:46:17.557968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.379720Z","title":"Applications of large language models for robot navigation and scene understanding,","venue":null,"work_id":"6cb62cb7-3b24-4c58-8d2c-5ce3ed311e1e","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.563485Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:3258f1517fd7b1655788c3b163ec9679ad4cdf602f6acd9a419ddf1b2b53a8cb","observation_id":"453d7c37-b7d8-4046-85dd-a25282ffcad3","resolution":{"observed_at":"2026-08-10T20:46:18.387080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-19T17:18:24.172135Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-10T20:46:17.569537Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.569537Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:075be72fef3f2d37367770863f3c5691d0928cd3959cbaf476ba9d760519a0a9","observation_id":"a2476a74-ef01-4a2f-9994-a2999e1149e1","resolution":{"observed_at":"2026-08-10T20:46:17.569537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.353921Z","title":"Yolo-world: Real-time open-vocabulary object detection,","venue":null,"work_id":"624dab83-87bf-4e5d-9f04-5baafe6f96db","year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.574846Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:bdb289f54ae0042cd5a946ba3ca6623a4d16ee56c1ab954b92169e8ec365fc6f","observation_id":"d96ccc21-8e9b-461b-94f0-36234a8aeebb","resolution":{"observed_at":"2026-08-10T20:46:18.361176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.333473Z","title":"Towards open world recognition,","venue":null,"work_id":"dddbf669-43c4-4c98-af56-6e3ba4cbf707","year":2015},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.579856Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:25d3c4c9e8c9b226875d3e75761c203aae5568990db87c17729778ba08d924f5","observation_id":"d7c1a4f4-a43d-42f7-9a0e-0e1039cb037c","resolution":{"observed_at":"2026-08-10T20:46:18.340303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.312621Z","title":"Ow-detr: Open-world detection transformer,","venue":null,"work_id":"792bcd71-0ced-4ee2-b586-798b55bba65d","year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.585082Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:4bf959d57816a1677b4ff3b8ded59834c70c477e3bdc10b5dcac895e6971ac75","observation_id":"b9d88c8b-1109-4117-bf61-8bdc8c25937b","resolution":{"observed_at":"2026-08-10T20:46:18.319089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.292504Z","title":"Exploring vision-language foundation model for novel object captioning,","venue":null,"work_id":"6252c5d0-59f7-4d9e-93c2-ee7d1c203ff6","year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.590635Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:4677b01960050b89fde5ad89a867444df6785f507a0c6263f72bf1cc718fa500","observation_id":"0b954148-e704-47c9-ad46-6d563de1407c","resolution":{"observed_at":"2026-08-10T20:46:18.298902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.271740Z","title":"Improved open world object detection using class-wise feature space learning,","venue":null,"work_id":"d20bfad8-56eb-4252-97dd-366cbff51dbf","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.595627Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:f2873118f44fd2022d02c580b278a5a9e4b66708b0496e6fb149d1d61d3411fa","observation_id":"76597959-bab1-413f-94ff-ce60661f6881","resolution":{"observed_at":"2026-08-10T20:46:18.278186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.07848","last_updated":"2021-04-29T15:28:55Z","snapshot_observed_at":"2026-08-16T18:45:23.204190Z","submitted_at":"2021-02-15T21:03:05Z","title":"Self-Supervised Features Improve Open-World Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.07848","snapshot_observed_at":"2026-08-10T20:46:17.601016Z","title":"Self-supervised features improve open-world learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.601016Z"},"links":{"cited_paper":"/paper/2102.07848","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:893cc15ec93534da219405beb9416203f1ce202e8345a73cc76ec7a2a35b2104","observation_id":"efbc1feb-d4b8-474f-ad30-a67c0c1e6cfb","resolution":{"observed_at":"2026-08-10T20:46:17.601016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09911","last_updated":"2022-12-24T10:12:53Z","snapshot_observed_at":"2026-08-19T07:45:34.431982Z","submitted_at":"2022-05-20T00:53:43Z","title":"Can Foundation Models Wrangle Your Data?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09911","snapshot_observed_at":"2026-08-10T20:46:17.606731Z","title":"Can foundation models wrangle your data?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.606731Z"},"links":{"cited_paper":"/paper/2205.09911","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:1b626e438292be822be5e5846e1c6c4e877b5ea93aac15fae2456d19741d8950","observation_id":"b127b10a-ac6d-4846-8f55-25336d39a4df","resolution":{"observed_at":"2026-08-10T20:46:17.606731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.612848Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.612848Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:349f158f378e6c833223dcc0107302a3ba2e6df4aadcdd14669d74c49334f82c","observation_id":"a2a538d1-006f-4a65-baea-4ef941aa657d","resolution":{"observed_at":"2026-08-10T20:46:17.612848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.234845Z","title":"Dremel: interactive analysis of web- scale datasets,","venue":null,"work_id":"0ba179f2-9e0c-4bcf-b7e9-37098aa4e433","year":2010},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.618638Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:59e4a52e08c1bf45bd8c699671b61d605dbc13bc3ee3af2a11f160829b3dad72","observation_id":"8100238f-25b0-4abc-8038-659a9b11933e","resolution":{"observed_at":"2026-08-10T20:46:18.242910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.215399Z","title":"Open-set automatic target recognition,","venue":null,"work_id":"3531742c-d51e-4e04-a3a6-02ca7c5f1c23","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.623741Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:5b8b885287ef7dbebcd5586478686cdb0d2a497985ee93f7f39ac0fb9a6cf30f","observation_id":"2dd39ac8-f27e-41f9-a95c-b3e7ec337969","resolution":{"observed_at":"2026-08-10T20:46:18.222306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.195132Z","title":"Hello gpt-4o,","venue":null,"work_id":"371fa1fc-566a-46e7-9da5-015d9c47a599","year":null},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.628432Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:87ecd360fcc3c23fc1382a6aaaeab87b3973a0806fcda2d02d03497a38db22be","observation_id":"c1b8d13e-7ca8-4b87-bd24-f931dd2c8f65","resolution":{"observed_at":"2026-08-10T20:46:18.201005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.174289Z","title":"Introducing the next generation of Claude,","venue":null,"work_id":"c8006c05-eb3d-40ce-933b-ea7711a8e5e4","year":null},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.633888Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:1da5b4b8b546c6efaf39a078eee740f973de1a2300f0b3895986ed4a4a7f06f8","observation_id":"842953ae-91a4-4f14-891e-1db88ca75f28","resolution":{"observed_at":"2026-08-10T20:46:18.179771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T20:46:17.639653Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.639653Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:ea009d304147a8b07014c014bc12deb7e6ebf8fcb974712799cf8098a156bb41","observation_id":"b27e26fb-fcc0-49a8-90ed-e73ab01a0593","resolution":{"observed_at":"2026-08-10T20:46:17.639653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.645260Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.645260Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:ccac4ebf25eaa2e1e0cedd6568bcd8692bbbd98b946422b27c245aebc4d86760","observation_id":"850b3a59-bbfa-40ef-8874-53338b3d1d51","resolution":{"observed_at":"2026-08-10T20:46:17.645260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T20:46:17.650325Z","title":"Phi- 3 technical report: A highly capable language model locally on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.650325Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:7d92e178df987cc4e605953bb0a5fef4d20bfbd4d5bce92a9a7951f5acffe603","observation_id":"0f460483-556d-4f6f-9e4a-7d8a4a66c3c7","resolution":{"observed_at":"2026-08-10T20:46:17.650325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T20:46:17.656050Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.656050Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:82e76df4108ff61cc10cffd11eac14ab5d90bbdcefafa0292e666bcf0e3091cd","observation_id":"abdd08d9-1c36-4410-8b3f-a3c06f7b886e","resolution":{"observed_at":"2026-08-10T20:46:17.656050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-10T20:46:17.661661Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.661661Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:e55f7cd691e10dedf2ae2a40f98edd35506df4cd6523f2c20842c7e82afd24a2","observation_id":"baf40376-7db4-4934-b7f0-31b2c146b65d","resolution":{"observed_at":"2026-08-10T20:46:17.661661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.667544Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.667544Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:3a6054fb2685ebed65ea5c528b2597ae4c7ee9c0262a0c74fbd3ac499ca95be7","observation_id":"e70e6963-3c31-4288-8316-446f2b95e8ce","resolution":{"observed_at":"2026-08-10T20:46:17.667544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T20:46:17.674626Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.674626Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:18052ebd2a3ff49e39c68454ad682142f39e3337e6faaf3f42a9e4d9dcb0f654","observation_id":"0c7a0eb7-ceb2-47c2-a88a-fabe790fdcc5","resolution":{"observed_at":"2026-08-10T20:46:17.674626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-10T20:46:17.682505Z","title":"Openflamingo: An open-source framework for training large autoregressive vision- language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.682505Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:269ecc7b73b4062011b9cbb2f05bc74e264bf3e32836de8144631eb57856f8c0","observation_id":"db8982d9-9f25-44eb-853e-c358b5033992","resolution":{"observed_at":"2026-08-10T20:46:17.682505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.688475Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.688475Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:633979a83b58b3a9341a40e7e114537f80242a2dd07cbed13ef00203ab9cf248","observation_id":"e7b3e0cf-a358-4251-af24-08db5e931210","resolution":{"observed_at":"2026-08-10T20:46:17.688475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.114815Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"d12f8837-cb95-4abc-b865-52cdacbcdca5","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.694478Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:0fa8fd5e41248f47ed6a638a9009fa449c19146b8b6e5bb4c520c1389d6f7108","observation_id":"b119770c-7a56-4c32-8844-bbd146a65641","resolution":{"observed_at":"2026-08-10T20:46:18.123979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T08:41:52.843881Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2501.07396."}