{"as_of":"2026-08-09T18:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b57cc6b812964ff0a8d5f2e38cc716e3ecd3e1b305af6486bba39f1babbc759f","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:23:57.404158Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17669/citation-record","integrity":"/paper/2607.17669/integrity","json":"/paper/2607.17669/citation-record.json","paper":"/paper/2607.17669"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:53.207966Z","title":"To achieve this goal, extensive experiments were conducted using the VisDrone dataset, which consists of drone- captured images collected under diverse environmental conditions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.207966Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:d156384329809d5893a045168da0f2c3d74dabf41f5e86f46a1f34577d350603","observation_id":"1bef4fee-9e63-4fdf-8a7f-e180f49007cd","resolution":{"observed_at":"2026-08-01T17:23:53.207966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:53.317228Z","title":"car” and “truck","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.317228Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:c416a831f2232569cc2977e1038b68e78a278e350b18f5903259ea790268bc06","observation_id":"a561de8c-449e-4a39-98d4-a433f5833b27","resolution":{"observed_at":"2026-08-01T17:23:53.317228Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.bushor.2017.08.001","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From toys to tools: The co-evolution of technological and entrepreneurial developments in the drone industry,","venue":"Business Horizons","work_id":"96ba74aa-d74c-4b97-bce6-aeb46210eb86","year":2017},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.393449Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:f879ef8b1793380f654e30f108a903651a2bfbd4036aeeaff18017d3c0dc7f68","observation_id":"91e437f5-0d08-4921-b9f9-f2d67b8f8a84","resolution":{"observed_at":"2026-08-01T17:28:37.126410Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4018/979-8-3693-8497-8.ch004","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Edge Computing, Emerging Trends, and Drone Technology for the Business Industry,","venue":"Advances in computational intelligence and robotics book series","work_id":"809486f4-a9b1-407f-9ac4-50ef70bbf830","year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.514533Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:8164522d8f07f2404d55e276d348294fc6e653843b3ec590b90194406a78e756","observation_id":"2d9985fb-6f1b-48df-a148-1a2001dcde3d","resolution":{"observed_at":"2026-08-01T17:28:36.887832Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4018/979-8-3693-0774-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:28:36.634998Z","title":"Use of AI applications for the drone industry,","venue":null,"work_id":"e1dbda34-acbd-46af-bb68-35b13c1413c9","year":2024},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.630495Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:423f55360f5931971e8b38812169fc6ae7e4d45d258c94790370b0510a494552","observation_id":"5ea99d68-08d9-48d7-8b96-cc7597ea9923","resolution":{"observed_at":"2026-08-01T17:28:36.695040Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v36i1.19986","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UFPMP-Det:Toward Accurate and Efficient Object Detection on Drone Imagery,","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"2880d949-5630-4549-8b1e-6cd50695b722","year":2022},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:53.723953Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:51116a6a10588f6931779312961b20acc5c8c731894f20f9b968a546b6b79ca9","observation_id":"ffe00af6-5be1-4ea2-8e46-b3f4f115e446","resolution":{"observed_at":"2026-08-01T17:28:36.499900Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.106165Z","title":"DR-YOLO: An improved multi-scale small object detection model for drone aerial photography scenes based on YOLOv7,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.106165Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:725f576ca1c0409d1cf0567d32e5483de28c30bbe060ffdbf50f1730c9953698","observation_id":"8f6c5cc4-1dac-4142-be85-9343f04d42aa","resolution":{"observed_at":"2026-08-01T17:23:54.106165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.209072Z","title":"DHANet: Dual-Stream Hierarchical Interaction Networks for Multimodal Drone Object Detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.209072Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:da5db48ff21171cbd2e8b72ac83dc95c4b19078a24e1e984da84749221b7106c","observation_id":"7786534a-98a8-4136-9fe7-90803ff21054","resolution":{"observed_at":"2026-08-01T17:23:54.209072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.340464Z","title":"HiCAL: Hierarchical Consistency-Based Active Learning for Drone-View Object Detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.340464Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:acdd9771aa245db5e1ab4e23b6811b37a5fc275fdd8bc4c64a59c7c2b962c725","observation_id":"6c761c0f-a839-461f-aa63-5f075220547f","resolution":{"observed_at":"2026-08-01T17:23:54.340464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/ece3.72856","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automated Detection and Monitoring of Ground-Nesting Bee Nests Using Drone Imagery and Deep Learning,","venue":"Ecology and Evolution","work_id":"e7715a71-5262-4133-abfd-7dc95255aa83","year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.499096Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:c42d2b136aba67487cab35ad45c6224eeb600386ce2e73c6dc5dfc63ff077320","observation_id":"7780b813-e22d-437a-9a6d-86239e415759","resolution":{"observed_at":"2026-08-01T17:28:36.096574Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.579253Z","title":"SPVD-DETR: A novel real-time end-to-end object detector of sweetpotato virus disease from unmanned aerial vehicle ortho imagery,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.579253Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:ac92ec7d8997170c8da20ff565c1bced49f5dffe5e16fb4604e96d9fd0b08a40","observation_id":"cf949cc6-cfc5-42b1-a9c2-b0728cc31c7e","resolution":{"observed_at":"2026-08-01T17:23:54.579253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s41064-025-00373-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Single-tree Delineation by Instance Segmentation Using Drone-based Lidar and Multispectral Imagery: a Comparative Study in Various Forest Structures,","venue":"PFG – Journal of Photogrammetry Remote Sensing and Geoinformation Science","work_id":"65b1d8ff-81ee-480d-8012-ee6637a17047","year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.660649Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:e3b74e199eec1c97a1c7b8e168c89cd5926e66deaacd26c392956f108ed67b4e","observation_id":"65b55fb4-2438-4fd0-bfe8-a91832c9fd07","resolution":{"observed_at":"2026-08-01T17:28:35.732373Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.721644Z","title":"Advancing traffic object detection in complex environments: a deep learning object detection approach with vehicle-mounted UAV data for traffic scene perception,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.721644Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:018292c26d36e2ea8be877b536a1bee57a2a84601353f8d518352b0458fa589b","observation_id":"2472ed9d-4eb8-4b45-b26d-96e121b4702b","resolution":{"observed_at":"2026-08-01T17:23:54.721644Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/cpe.70528","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Enhancing Wildfire Preparedness and Response: A Drone Network- Based Early Warning System for Bushfires,","venue":"Concurrency and Computation Practice and Experience","work_id":"9726e7f2-0e54-4578-8fb5-53f2ed39f153","year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.773477Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:77f551106a304491683de001e0db2fe0267d274b8e773c1c5e632952fefd40ef","observation_id":"9c4bef65-df51-434f-ad6b-c79b34cae56f","resolution":{"observed_at":"2026-08-01T17:28:35.448196Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.816604Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.816604Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:20935af5c9c1ad253c49e59d1c8b0c90f72160da8fb0a340a82e9b2529793dfe","observation_id":"29689278-d1f3-4d33-9fd2-93a85acf7d06","resolution":{"observed_at":"2026-08-01T17:23:54.816604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.864472Z","title":"Fast r-cnn,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.864472Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:b517c21bd6027b5c1a03f4570d6d5cc736e2269f8969e12dbeddd53fc62cf2f9","observation_id":"a5a3bb49-a97d-4d4a-83a1-3e3a54515206","resolution":{"observed_at":"2026-08-01T17:23:54.864472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:54.989106Z","title":"Faster R-CNN: Towards real-time object detection with region proposal networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:54.989106Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:c291901e7a2ffd64358f407db9ed24da6198ac0b28a713968df6648025b353d3","observation_id":"9fa90ed1-9a0e-4886-8ac7-bb4dc822255d","resolution":{"observed_at":"2026-08-01T17:23:54.989106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:55.129813Z","title":"Mask r-cnn,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.129813Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:43040f1295d6962c2157684154a47489ea6527aec6c268305760fdd5d313ad21","observation_id":"b4eb8cc3-e27b-4979-bbbe-3202be1a270d","resolution":{"observed_at":"2026-08-01T17:23:55.129813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:55.299770Z","title":"You only look once: Unified real-time object detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.299770Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:2f6cabf1b660f5e2794ced890d382bc249c7b056e6e876f220a2220f3dc268e5","observation_id":"a3de1e62-763e-48f7-adee-090aaf353268","resolution":{"observed_at":"2026-08-01T17:23:55.299770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:55.477382Z","title":"YOLO9000: better, faster, stronger,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.477382Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:7c4b8901c5e51aba5cf6a517814d5f3e1a16d50ddae16a6c468487f0bee62114","observation_id":"973f211f-f83c-4dbf-af2d-fe795383d0d8","resolution":{"observed_at":"2026-08-01T17:23:55.477382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02767","last_updated":"2018-04-08T22:27:57Z","snapshot_observed_at":"2026-08-06T11:09:16.409556Z","submitted_at":"2018-04-08T22:27:57Z","title":"YOLOv3: An Incremental Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02767","snapshot_observed_at":"2026-08-01T17:23:55.652761Z","title":"Yolov3: An incremental improvement,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.652761Z"},"links":{"cited_paper":"/paper/1804.02767","citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:f85592c04eba4d8091cb80d94616d45c702919fa459883b3448bf7c2865456d6","observation_id":"5357f8dc-7047-4fc5-bc27-704ff6326514","resolution":{"observed_at":"2026-08-01T17:23:55.652761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10934","last_updated":"2020-04-23T02:10:02Z","snapshot_observed_at":"2026-07-06T09:14:32.318388Z","submitted_at":"2020-04-23T02:10:02Z","title":"YOLOv4: Optimal Speed and Accuracy of Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10934","snapshot_observed_at":"2026-08-01T17:23:55.764230Z","title":"Yolov4: Optimal speed and accuracy of object detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.764230Z"},"links":{"cited_paper":"/paper/2004.10934","citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:b4c9f415c54954d2429bbcfb8ee09cad51de4ece4ebf5f0d99d7959f77ee0ee4","observation_id":"23821e80-e1ce-4259-9d3c-0f7f474461d1","resolution":{"observed_at":"2026-08-01T17:23:55.764230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:55.944808Z","title":"Available online: https://github.com/ultralytics/yolov5, (accessed on: 23 November 2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:55.944808Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:cfe26c0677ce3e4bbf3b54b57c0e9a7689a97bf6c5ee23d5e925172cee6ae9da","observation_id":"dbe1a9b8-2f9b-44ba-b33c-5ed0e1099b04","resolution":{"observed_at":"2026-08-01T17:23:55.944808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02976","last_updated":"2022-09-07T07:47:58Z","snapshot_observed_at":"2026-08-09T12:24:39.057546Z","submitted_at":"2022-09-07T07:47:58Z","title":"YOLOv6: A Single-Stage Object Detection Framework for Industrial Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.02976","snapshot_observed_at":"2026-08-01T17:23:56.004512Z","title":"YOLOv6: A single-state object detection framework for industrial applications,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.004512Z"},"links":{"cited_paper":"/paper/2209.02976","citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:682097d083488cdc374e8b30dfd71bbde7dbaa52960f059adbb9c2c51a20f915","observation_id":"7d0d31c5-5f2c-4d96-8ceb-01140b2c4a26","resolution":{"observed_at":"2026-08-01T17:23:56.004512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.073594Z","title":"YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.073594Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:7f9086e6ac22a68da32e29b1574dceb79c154cc928d6466feb19e1fd8b0afc4d","observation_id":"26f2fa26-e336-4647-8d50-ccb17e873f2d","resolution":{"observed_at":"2026-08-01T17:23:56.073594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.139812Z","title":"Available online: https://docs.ultralytics.com/models/yolov8 (accessed on: 11 November 2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.139812Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:5ca8508b9cf6395b792e912827199c952a7aea06e77695efd6a7193999fcdcf0","observation_id":"b4771bab-be7c-4155-b5ed-d0afc477c915","resolution":{"observed_at":"2026-08-01T17:23:56.139812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.180031Z","title":"YOLOv9: Learning what you want to learn using programmable gradient information. European Conference on Computer Vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.180031Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:c78c79aee029da497f03a3afc8bc8db4c2b76fea09e41ecad7dab8024dae7291","observation_id":"af854cfb-0d65-4bdb-a2af-a0d718e5f420","resolution":{"observed_at":"2026-08-01T17:23:56.180031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.233855Z","title":"YOLOv10: Real-Time End-to-End Object Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.233855Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:9cb8a2ec7e29094389446c0f0a328aedde9e0082557afcd60bc4ec1c5671cc9a","observation_id":"15fb4cce-0936-424c-99cb-d196f5f53514","resolution":{"observed_at":"2026-08-01T17:23:56.233855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.285332Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.285332Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:8fa6f604cb544f6efd338a5de75f430ac25be807da3849e11b0c5d4efab3b98e","observation_id":"4e601489-88d3-4816-b315-018c761de33c","resolution":{"observed_at":"2026-08-01T17:23:56.285332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.592520Z","title":"Ssd: Single shot multibox detector,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.592520Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:9aff37fd12473dad541a768b5637020e54f09b7dc3782ca0efce2a58d18a15bf","observation_id":"9e8fe89e-42c4-4984-ac15-445d47cbcd43","resolution":{"observed_at":"2026-08-01T17:23:56.592520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12524","last_updated":"2025-02-18T04:20:14Z","snapshot_observed_at":"2026-07-06T20:38:20.545914Z","submitted_at":"2025-02-18T04:20:14Z","title":"YOLOv12: Attention-Centric Real-Time Object Detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12524","snapshot_observed_at":"2026-08-01T17:23:56.453859Z","title":"YOLOv12: Attention-Centric Real-Time Object Detectors,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.453859Z"},"links":{"cited_paper":"/paper/2502.12524","citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:d8fea7729c674e52a59eebdca6d8d38a065040f7cbc5ccf23784830d9206ad44","observation_id":"236e03c3-f614-4183-bfa5-5ac4db9d31af","resolution":{"observed_at":"2026-08-01T17:23:56.453859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.529197Z","title":"Available online: https://github.com/ultralytics/ultralytics, (accessed on: 14 January 2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.529197Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:2c179f4596a2aac2d533d19b7e3350cbb93b7fd86c7bca2ee4b7dfe72adbd1ea","observation_id":"cdc16677-0d7a-4c62-a637-fba3676c3fd6","resolution":{"observed_at":"2026-08-01T17:23:56.529197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i4.32433","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LogicAD: Explainable Anomaly Detection via VLM-based Text Feature Extraction,","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"25f710f0-2e5a-4109-aacd-217fa1791683","year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.787092Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:ed8c53a21068c32ee2928b63711e07061bbe8609e14249d8460b3134c9499f74","observation_id":"c9db5f4a-4918-4b80-b4d7-a056a1dbd40f","resolution":{"observed_at":"2026-08-01T17:28:35.060257Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.659843Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.659843Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:3583a69b04685fc5e99a63ad428227835b5850f9e86669d35846d13e94d8725e","observation_id":"00eb6df5-d678-4810-9610-2cd2cb655595","resolution":{"observed_at":"2026-08-01T17:23:56.659843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.723448Z","title":"Single-shot refinement neural network for object detection,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.723448Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:8aaf0d1b0c31fc3904041cce1cf641d97dd71e820cdfd0beb4770da7da624b9f","observation_id":"9cbf7331-363f-49e8-8783-208d3c961756","resolution":{"observed_at":"2026-08-01T17:23:56.723448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.979126Z","title":"Strong and Weak Prompt Engineering for Remote Sensing Image-Text Cross- Modal Retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.979126Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:39e2bd91a469de89f03c442d7f95df2e7dbd4b46608c51de32a40ab68488a383","observation_id":"f289f90c-614a-42d5-94c4-ad1b7882dcf2","resolution":{"observed_at":"2026-08-01T17:23:56.979126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:56.859865Z","title":"GADNet: Improving image–text matching via graph-based aggregation and disentanglement,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.859865Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:2ab8fc9c6598ab8b36d2bffaf341bef193aa5471f344def8a8702e640011d782","observation_id":"f1ca4c81-3974-4047-8027-aadede2e1f62","resolution":{"observed_at":"2026-08-01T17:23:56.859865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/cpe.8345","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A System of Multimodal Image-Text Retrieval Based on Pre-Trained Models Fusion,","venue":"Concurrency and Computation Practice and Experience","work_id":"18be75ba-3714-496f-bb67-72f70dfe73aa","year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.929475Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:315d184e6b76bcc078f49a0918598de76d3cec9a5a4a66c0877468d47fddac2e","observation_id":"c6628848-d655-4f8f-86d3-7d88aaf3cfc2","resolution":{"observed_at":"2026-08-01T17:28:34.854372Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:57.135380Z","title":"Make It Count: Text-to-Image Generation with an Accurate Number of Objects,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.135380Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:0a88f58349a05c09d66925941ded34e8c8b630ea9f488e205890fb430b582177","observation_id":"430f971a-7a95-459d-beb4-e9672928593d","resolution":{"observed_at":"2026-08-01T17:23:57.135380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:57.021176Z","title":"Local-enhanced representation for text-based person search,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.021176Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:612953b013fa108ad5da389a63b3e4d3804eec704ec2dba789efab779e73cbff","observation_id":"3dd9d87d-5f50-4b14-9640-fee2d161228d","resolution":{"observed_at":"2026-08-01T17:23:57.021176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41598-025-31803-7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An efficient YOLOv12-based framework for detecting extremely small-scale objects,","venue":"Scientific Reports","work_id":"ba072487-bd8f-4edd-9130-8623281608bc","year":2025},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.320522Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:3ec3d26289c3cc48341ee394b8d6457ef64ba88f41050f2015b36e317c5c054b","observation_id":"007992c8-c938-4784-8bd6-d749e67fb5c1","resolution":{"observed_at":"2026-08-01T17:28:34.568750Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:57.178288Z","title":"Perception-Guided Jailbreak Against Text-to-Image Models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.178288Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:52d463c4f1c0a3ac9cd8526d0c604f0fdaf3310098a72914e40269c729c69412","observation_id":"4b51e30a-843d-48bb-874b-615a899ae47f","resolution":{"observed_at":"2026-08-01T17:23:57.178288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.35784/acs_7850","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A text-guided vision model for enhanced recognition of small instances,","venue":"Applied Computer Science","work_id":"0b0541f8-3162-46d4-bbd5-6efa32a15b60","year":2026},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.404158Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:22151882e9640729725fc4a673f488d03c2b296f425209d1d9be85eede27d675","observation_id":"652c627b-c5d6-4e04-a238-d3b93bfe4cb5","resolution":{"observed_at":"2026-08-01T17:28:34.357222Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:57.269204Z","title":"YOLO-World: Real-Time Open-Vocabulary Object Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.269204Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:533b1fa32c83ef38c56b830cb9de6378e3f53479f3cc3d7449f5427df5bcc323","observation_id":"e0bbfa59-d679-45f3-8b82-42f17126eac7","resolution":{"observed_at":"2026-08-01T17:23:57.269204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:23:57.354010Z","title":"CSPNet: A new backbone that can enhance learning capability of CNN,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.354010Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:569fb209a89aab1f7b1ee9ab2e646cf0abcd781a361bbe6f1d6d2695b8d91f26","observation_id":"8b6f9ad4-2dbf-4374-81ab-cd0b863bb924","resolution":{"observed_at":"2026-08-01T17:23:57.354010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-07-06T19:38:22.461739Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-01T17:23:56.368162Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:56.368162Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:96aa3822ae38cebb7fff0917256a671757de285e135cc1e2994ce552def3d842","observation_id":"4ae386db-caf3-40e9-abdd-a6908ac7d767","resolution":{"observed_at":"2026-08-01T17:23:56.368162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i25.34821","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"1c69ccac-8bde-47df-8a4c-10473451ee7c","year":null},"citing_paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T17:23:57.221809Z"},"links":{"citing_paper":"/paper/2607.17669"},"observation_digest":"sha256:69a66da9fe441bd9e9fde0e543877d5a79a22a8c7d5ca792c85649c69bbe98e9","observation_id":"6b6c01c8-a10a-4cd7-b64e-4f48188c240d","resolution":{"observed_at":"2026-08-01T17:28:34.717629Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.17669","last_updated":"2026-07-20T08:21:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T12:25:13.966752Z","submitted_at":"2026-07-20T08:21:12Z","title":"Attention from Above: A Multimodal Model for Drone-Based Object Localization"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2607.17669."}