{"as_of":"2026-08-09T04:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:290eb302438d4fe9b7aab867adadde6e4e939b757686cc7e92a87ab989485123","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:27:33.138881Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.15470/citation-record","integrity":"/paper/2510.15470/integrity","json":"/paper/2510.15470/citation-record.json","paper":"/paper/2510.15470"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:25.249563Z","title":"Overview and current status of remote sensing applications based on unmanned aerial vehicles (uavs),","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:25.249563Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:9f3c6866e0bceab86eecd7cc5bb263b2bdfa76e766951f1cc3726cc6c0ab27c5","observation_id":"b0c0aa15-cc85-4c71-a286-484f31741ef5","resolution":{"observed_at":"2026-08-04T09:27:25.249563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:25.347496Z","title":"Unmanned aerial systems for photogram- metry and remote sensing: A review - sciencedirect,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:25.347496Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:37bebf7ab20ba05a23192d5d012848c7b750b661150e7648f50326a6e5ae6527","observation_id":"9a324bb2-db7c-440f-824b-071e0ab3a1d3","resolution":{"observed_at":"2026-08-04T09:27:25.347496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:25.479710Z","title":"Uavs challenge to assess water stress for sustainable agriculture,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:25.479710Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:b29f9b1db75b7f597d111e92d3baddb90247453e80db0ccb39a6d78fa9e9f83f","observation_id":"2dc5533e-70c2-4138-9b5c-7f339c05fd3e","resolution":{"observed_at":"2026-08-04T09:27:25.479710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:25.621007Z","title":"Sustainable agriculture by increasing nitrogen fertilizer efficiency using low-resolution camera mounted on unmanned aerial vehicles","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:25.621007Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:d753d7b31fe30f6e50410c719a3315cfa33ebb5cb7072ef4bc8421e58a3725fd","observation_id":"b8765432-905a-40af-8f8a-1a490c021249","resolution":{"observed_at":"2026-08-04T09:27:25.621007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:25.820139Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:25.820139Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:7b33de140b281717b5291e48bd6b67740e052bfbd773b3fc290ed377d3aaa329","observation_id":"3e896907-0e14-4f67-8316-2bcf1ac1e3ba","resolution":{"observed_at":"2026-08-04T09:27:25.820139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:25.881936Z","title":"Visible-thermal UA V tracking: A large-scale benchmark and new baseline,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:25.881936Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:43e0feabc22ced6316b242c2fbcfa4cf0098c59061d98eb30ec50771e1725d9a","observation_id":"90b5870b-ae9f-4d53-ac0c-6c1efecb6d73","resolution":{"observed_at":"2026-08-04T09:27:25.881936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:25.983511Z","title":"High-resolution feature pyramid network for small object detection on drone view,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:25.983511Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:12661894bf1d795cfa42f0db2b14348326bf3c66c816c02ff97c19ec980e5257","observation_id":"4b1acb93-97e2-4dce-84b4-eaff330f7baa","resolution":{"observed_at":"2026-08-04T09:27:25.983511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04936","last_updated":"2024-04-02T21:45:06Z","snapshot_observed_at":"2026-07-06T14:03:17.645948Z","submitted_at":"2022-10-10T18:09:35Z","title":"EarthNets: Empowering AI in Earth Observation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04936","snapshot_observed_at":"2026-08-04T09:27:26.139458Z","title":"Earthnets: Empowering AI in earth observation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:26.139458Z"},"links":{"cited_paper":"/paper/2210.04936","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:927fd5188f3ab3b46c961158f020b9f60e51553552542c9f9aa936faeff787f8","observation_id":"43aab4db-a5c4-463e-bdf8-2b815cc304d3","resolution":{"observed_at":"2026-08-04T09:27:26.139458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:26.317328Z","title":"Sdanet: Semantic- embedded density adaptive network for moving vehicle detection in satellite videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:26.317328Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:d13fb48d49979b4a534fac5216bacab745bc035c0a722fb5c96b2a9dcee6bf20","observation_id":"a8e3df58-a671-41e1-b783-544495bf167e","resolution":{"observed_at":"2026-08-04T09:27:26.317328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:26.493314Z","title":"Pareto refocusing for drone-view object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:26.493314Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:9f2a455fcf7b7872b3586a5dce4ee4da7ebd1a95568fa7ba852d5a0a3fb25283","observation_id":"e5ee1637-38b1-4c68-bf0c-e4ad8138e9e0","resolution":{"observed_at":"2026-08-04T09:27:26.493314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:26.657760Z","title":"Temporal-spatial feature interac- tion network for multi-drone multi-object tracking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:26.657760Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:94358fa19abd8a76f61f98df2e979203c25d034dd003de16bc3d044332d5251e","observation_id":"4436b924-fa26-430b-96de-42e4be59cc48","resolution":{"observed_at":"2026-08-04T09:27:26.657760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:26.801948Z","title":"Cross-drone transformer network for robust single object tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:26.801948Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:dec4b0008843237fd0e066870d2f250419cae3d19fdf0097be891c458372803f","observation_id":"7c74a6b5-40d5-44cb-b2e5-442fca50f8a0","resolution":{"observed_at":"2026-08-04T09:27:26.801948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:26.921765Z","title":"Transformer- based spatio-temporal unsupervised traffic anomaly detection in aerial videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:26.921765Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:8a378e997383a090a8cb324bcf1c6dde2ee6bb9df640a8a13b4e80390f467ab9","observation_id":"2ef94245-84c3-4cb3-a8e7-e4fe1b743173","resolution":{"observed_at":"2026-08-04T09:27:26.921765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:27.051963Z","title":"Visual contextual semantic reasoning for cross-modal drone image-text retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:27.051963Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:b49ae585540e92bee6ede1d41ff4ebbcf73436b145fbe784ff30b3edcbc64071","observation_id":"f9d4e355-cd8d-4900-8728-6c95121940a6","resolution":{"observed_at":"2026-08-04T09:27:27.051963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:27.245911Z","title":"Deep saliency smoothing hashing for drone image retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:27.245911Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:9f7ead434bdc7bf9191965154d7fce42234cb7ce0fbe4ca28ec807020c08b9cd","observation_id":"9441b470-f639-4d38-9f0a-322d8002046a","resolution":{"observed_at":"2026-08-04T09:27:27.245911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:27.420894Z","title":"Uav-human: A large benchmark for human behavior understanding with unmanned aerial vehicles,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:27.420894Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:cfe22ea8e776889f1423101a5439a24ae123d20ca526465775c350ce406bbf06","observation_id":"1bb93069-d2d8-40de-92e8-c24abffa9d10","resolution":{"observed_at":"2026-08-04T09:27:27.420894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:27.545556Z","title":"Multi-modal transformer for video retrieval,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:27.545556Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:f88749128aa533e95dd9f765e8a5438a2ee8db3552fcc4e0f528b1dfd0ad81f6","observation_id":"47de33d5-058a-4de1-ad42-b20c3d5df04c","resolution":{"observed_at":"2026-08-04T09:27:27.545556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12545","last_updated":"2024-02-28T02:24:09Z","snapshot_observed_at":"2026-07-06T15:57:36.128928Z","submitted_at":"2023-07-24T06:22:37Z","title":"Towards Video Anomaly Retrieval from Video Anomaly Detection: New Benchmarks and Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12545","snapshot_observed_at":"2026-08-04T09:27:27.637380Z","title":"Towards video anomaly retrieval from video anomaly detection: New benchmarks and model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:27.637380Z"},"links":{"cited_paper":"/paper/2307.12545","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:0ff7070b06e3624054c752ac2f1a859d82de8c800d81083a51cc958bb4e49bfa","observation_id":"6ee3c2bb-ee3c-4523-b65a-165f8d75eb13","resolution":{"observed_at":"2026-08-04T09:27:27.637380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:27.694022Z","title":"Multilevel semantic interaction alignment for video-text cross-modal retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:27.694022Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:a8d92ba0b8cb9c6293a96e4a2402af8492047952da214b509fa44ed673bffc38","observation_id":"da72a306-d5d3-4c31-b58a-599f17bb7e8a","resolution":{"observed_at":"2026-08-04T09:27:27.694022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:27.786681Z","title":"Videoclip: Contrastive pre- training for zero-shot video-text understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:27.786681Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:e440d5c3bccf819be976387f98348ecff90a7f4fea27071d11977754f032d0c8","observation_id":"60aa7b8b-24f2-4e87-a95e-39345f62f1d4","resolution":{"observed_at":"2026-08-04T09:27:27.786681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:27.859844Z","title":"T2VLAD: global-local sequence alignment for text-video retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:27.859844Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:0aa0b3aebba1368ed1d79c5e329c4ec94e8e9b6f229fac96c65536c967e5400c","observation_id":"93c71b1d-601f-4056-8acf-fcd1f85765aa","resolution":{"observed_at":"2026-08-04T09:27:27.859844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-07T09:11:01.956830Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-04T09:27:27.954552Z","title":"Clip4clip: An empirical study of CLIP for end to end video clip retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:27.954552Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:b4220439fec04bd31362fcd912b5b12a25d82fa1f6130f380a8dc062652af75d","observation_id":"f26efacf-4cd4-448b-b021-45248dea36ad","resolution":{"observed_at":"2026-08-04T09:27:27.954552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:28.055281Z","title":"Centerclip: Token clustering for efficient text-video retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:28.055281Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:578dc3b6bffc8c16b0e0b458ad6f21cc9288c7edf511b106a792ae19e270af17","observation_id":"d77365a2-c24e-47af-8c97-2dfa1d583892","resolution":{"observed_at":"2026-08-04T09:27:28.055281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:28.138599Z","title":"X-pool: Cross-modal language-video attention for text-video retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:28.138599Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:a5a0629b10d9786b76b84ee142613c0d36f801b49205e698833d61a64c83fcf6","observation_id":"b3ed3792-c2ec-42b0-9593-42dd6fb4828e","resolution":{"observed_at":"2026-08-04T09:27:28.138599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:28.203192Z","title":"X-CLIP: end-to- end multi-grained contrastive learning for video-text retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:28.203192Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:d778838eaa966c60677629362a62220aede5674b16f74c8207dd159639f2e604","observation_id":"6c5e0c6e-f8a6-4630-a73f-a9b81851972e","resolution":{"observed_at":"2026-08-04T09:27:28.203192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:28.288426Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:28.288426Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:0adfc8482baf4119cd6043a84b8c71a11105923c0f5dd6f7cc81271d2f194f6f","observation_id":"d5c3f83a-82f4-4d47-98b6-37f333a9780c","resolution":{"observed_at":"2026-08-04T09:27:28.288426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:28.419476Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:28.419476Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:12ed913e97954313c9431294e3bff0976bf1630ae6c777f9af51add62ac30125","observation_id":"c9803a14-b0eb-430d-a80d-598ef9db6fcb","resolution":{"observed_at":"2026-08-04T09:27:28.419476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:28.518305Z","title":"Align and tell: Boosting text-video retrieval with local alignment and fine-grained supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:28.518305Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:787b3b61582589343dceca10ef94f47cdabeb8d29e9751e606ea99ee3112f6e7","observation_id":"951f7b00-d963-43fd-98f4-5b50d3095524","resolution":{"observed_at":"2026-08-04T09:27:28.518305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:28.605498Z","title":"Ts2-net: Token shift and selection transformer for text-video retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:28.605498Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:7f169e2e04dd28ac814f555e7e46c30ee44026874219e942321250bdeea01935","observation_id":"c2c5b1f2-781e-4669-9972-6dbc07a29a33","resolution":{"observed_at":"2026-08-04T09:27:28.605498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:28.703271Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:28.703271Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:a7410d7c45fbb724b3af406ea6780eeb75aaf7a6c3aca4d551b511e050892b86","observation_id":"8f527a65-d759-4557-84a5-aa1fdfbb1fb7","resolution":{"observed_at":"2026-08-04T09:27:28.703271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:28.794358Z","title":"Modeling uncertainty with hedged instance embeddings,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:28.794358Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:4c8874f60870b741cd386bded5481c0b066f39ce0673003a0e38aee35a09a500","observation_id":"ee628d70-cb9f-4f04-8bbf-bb9e9d5be3f5","resolution":{"observed_at":"2026-08-04T09:27:28.794358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:28.894178Z","title":"Probabilistic face embeddings,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:28.894178Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:f0826e9d9c081203a5b43ec3d9c57e1ff6314849a252972b4e985c0668ae94f0","observation_id":"f782ef05-09e4-4362-ad43-99079a6f13f7","resolution":{"observed_at":"2026-08-04T09:27:28.894178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:28.981464Z","title":"Data uncertainty learning in face recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:28.981464Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:4e5d49d6fbb9bb4750c99bd1315963ac49f87eb31101807e2ffd0f7b334dc1cf","observation_id":"c6bab12d-53b6-4083-9e3a-1ab732218cdd","resolution":{"observed_at":"2026-08-04T09:27:28.981464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:29.110889Z","title":"View- invariant probabilistic embedding for human pose,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:29.110889Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:93f547f5fc403d4517b08a6bcf50fc3faf8cf683eeca51034e31c40f59732e56","observation_id":"bb41864a-658f-4ba8-8766-69d9eb7510e5","resolution":{"observed_at":"2026-08-04T09:27:29.110889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:29.293239Z","title":"Probabilistic embeddings for cross-modal retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:29.293239Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:7d8756b70271f6de89cb8ed6c10f895e5bcf73cab2044d7bf08932aeb4909c0c","observation_id":"873e0b6f-5d08-406b-bf91-ed57d0c74aef","resolution":{"observed_at":"2026-08-04T09:27:29.293239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:29.457803Z","title":"UATVR: uncertainty-adaptive text-video retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:29.457803Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:cc61eb90fde4997381986b0f1439bc27bbd0fff3682b45968de6f01180f58d48","observation_id":"fa5eb562-b6de-4f19-8e39-63fa6dc94db5","resolution":{"observed_at":"2026-08-04T09:27:29.457803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02483","last_updated":"2023-03-04T19:07:48Z","snapshot_observed_at":"2026-08-03T23:42:46.115267Z","submitted_at":"2023-03-04T19:07:48Z","title":"FAME-ViL: Multi-Tasking Vision-Language Model for Heterogeneous Fashion Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02483","snapshot_observed_at":"2026-08-04T09:27:29.616204Z","title":"Fame-vil: Multi-tasking vision-language model for heterogeneous fashion tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:29.616204Z"},"links":{"cited_paper":"/paper/2303.02483","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:dd19dad6ae0ace839886fff3d0f73deeb7296ecd97bc33e65855fd5ba467f2e8","observation_id":"1b20c5da-334b-4528-b4f4-4aed9c1dc539","resolution":{"observed_at":"2026-08-04T09:27:29.616204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09737","last_updated":"2023-06-07T06:28:18Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:55:43Z","title":"Position-guided Text Prompt for Vision-Language Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09737","snapshot_observed_at":"2026-08-04T09:27:29.766288Z","title":"Position-guided text prompt for vision-language pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:29.766288Z"},"links":{"cited_paper":"/paper/2212.09737","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:f9dfbc36cbd3dfa8166995ed98d9ddaa345d84c36a231a2f057061ee28f38636","observation_id":"e4161197-3ad7-4cc3-96fb-2cad8ccf6042","resolution":{"observed_at":"2026-08-04T09:27:29.766288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00719","last_updated":"2023-04-03T05:07:49Z","snapshot_observed_at":"2026-07-06T15:11:11.523214Z","submitted_at":"2023-04-03T05:07:49Z","title":"Multi-Modal Representation Learning with Text-Driven Soft Masks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00719","snapshot_observed_at":"2026-08-04T09:27:29.897347Z","title":"Multi-modal representation learning with text- driven soft masks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:29.897347Z"},"links":{"cited_paper":"/paper/2304.00719","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:d5bc5b7961d175245e9ae06e472d8b60f26dd8c1fee898ba35ac07b2bd499e9f","observation_id":"55782fe3-41b3-400b-84f8-223174cbb07d","resolution":{"observed_at":"2026-08-04T09:27:29.897347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12959","last_updated":"2023-01-30T14:58:23Z","snapshot_observed_at":"2026-08-06T12:09:51.640955Z","submitted_at":"2023-01-30T14:58:23Z","title":"GALIP: Generative Adversarial CLIPs for Text-to-Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12959","snapshot_observed_at":"2026-08-04T09:27:30.021535Z","title":"GALIP: generative adversarial clips for text-to-image synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:30.021535Z"},"links":{"cited_paper":"/paper/2301.12959","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:31b99df3f4c47fcc6d2d84d0359df1759a27cabb7bd9d10c1c6737da15e092ba","observation_id":"a8fa8345-6409-4780-8603-142a90d5912b","resolution":{"observed_at":"2026-08-04T09:27:30.021535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09117","last_updated":"2023-06-29T15:30:25Z","snapshot_observed_at":"2026-08-07T16:33:27.387505Z","submitted_at":"2022-11-16T18:59:02Z","title":"MAGE: MAsked Generative Encoder to Unify Representation Learning and Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09117","snapshot_observed_at":"2026-08-04T09:27:30.136040Z","title":"MAGE: masked generative encoder to unify representation learning and image synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:30.136040Z"},"links":{"cited_paper":"/paper/2211.09117","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:c622738a706672e28d3d38c61fa78e7ff093e100228b9e089bce93b8238e0554","observation_id":"b90c1fea-d017-40a4-8b86-c7722c51034b","resolution":{"observed_at":"2026-08-04T09:27:30.136040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:30.270733Z","title":"Towards accurate text-based image captioning with content diversity exploration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:30.270733Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:3d97e95d766cc05680d7a4950a5598e5efc123b4eb5373eae9e309db436e2a65","observation_id":"afae6587-692c-4e98-8b8d-1a7523cd624b","resolution":{"observed_at":"2026-08-04T09:27:30.270733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:30.415898Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:30.415898Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:ea90b47b9b48d48de9eb84738e1cf3b86c32d8d84d69a5bdf8ef1de9b34cbccf","observation_id":"7bd18602-762d-4dad-9fc4-9408ba13c2ab","resolution":{"observed_at":"2026-08-04T09:27:30.415898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:30.692071Z","title":"Deep visual-semantic alignments for generating image descriptions,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:30.692071Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:1faafd90f901151a7318647e795b2ce02bd2b15c9ade9a6833ca96a2cd640260","observation_id":"18f86d71-9ce3-48b6-b2e6-24ba3afd280c","resolution":{"observed_at":"2026-08-04T09:27:30.692071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:30.775799Z","title":"Visual semantic reasoning for image-text matching,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:30.775799Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:083c724a3c356e4874f918d49d68297a10cec6c65d4d3c9f43e5404019ca3091","observation_id":"f4c571ea-4557-4e20-be37-90c37aa54e39","resolution":{"observed_at":"2026-08-04T09:27:30.775799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:30.892132Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:30.892132Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:a8f156f41823f3b42b661a19274bba25008ad94eb9b190e41a79ff6f57564a2e","observation_id":"872d62fc-edf7-4732-b12e-326a1ae016c6","resolution":{"observed_at":"2026-08-04T09:27:30.892132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:31.011422Z","title":"Bridging video-text retrieval with multiple choice questions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:31.011422Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:40304807cc3882a5f4f6741ad2619b3fe043131d61434d538025f93754c13076","observation_id":"7e3137e0-7a29-4ed9-b12a-65283ea13786","resolution":{"observed_at":"2026-08-04T09:27:31.011422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:31.132987Z","title":"Visual abductive reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:31.132987Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:c7f86d8b17eed5d5ab85422d2a21804a3175cb7e133e75362a970a519ed446cf","observation_id":"ba364f4b-3f3f-4c41-ae53-b72a7cf8fd04","resolution":{"observed_at":"2026-08-04T09:27:31.132987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:31.248812Z","title":"Membridge: Video-language pre-training with memory- augmented inter-modality bridge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:31.248812Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:a8ad53eb3e72f813aa8f818eea05f1dc27b4afd3825197c3b76e872fb558a9a2","observation_id":"a46d115a-6ce9-4df6-97c3-439448401aeb","resolution":{"observed_at":"2026-08-04T09:27:31.248812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:31.384176Z","title":"A straightforward framework for video retrieval using CLIP,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:31.384176Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:261b62113af3e4c05df9041a3e0e277e771ce26ca968310a4289b02b3cea1c88","observation_id":"923334b6-6923-4ac6-834c-51880dc0bc68","resolution":{"observed_at":"2026-08-04T09:27:31.384176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:31.477161Z","title":"Hisa: Hierarchically semantic associating for video temporal grounding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:31.477161Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:a0cd0a15fd4a7e2a3689b426ecf2835650e456fcf99e806303ced683d7172aad","observation_id":"23ff43d9-5430-4dac-8342-1a89a74d838c","resolution":{"observed_at":"2026-08-04T09:27:31.477161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:31.592455Z","title":"Concept-aware video captioning: Describing videos with effective prior information,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:31.592455Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:18863c0f4977651904a04640a8f903103aa2fff253d75f5db3d1c84051ba504d","observation_id":"65e664f4-4038-4b80-b2f6-896b07ce172f","resolution":{"observed_at":"2026-08-04T09:27:31.592455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:31.709425Z","title":"Hierarchical representation network with auxiliary tasks for video captioning and video question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:31.709425Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:cea6487a7b6910a7de13ead6aa8f347aa119ceb6848de12b990c623003e1aea1","observation_id":"002c68af-697b-402a-9c69-ac0050ef0f40","resolution":{"observed_at":"2026-08-04T09:27:31.709425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:31.812435Z","title":"Cross-attentional spatio-temporal semantic graph networks for video question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:31.812435Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:a073fc9a16d2ad4b7aaaf6714abbbe7062e268676db722cb1c5785b26323362a","observation_id":"d73c0d86-0663-4861-82f5-e8790bd60c9a","resolution":{"observed_at":"2026-08-04T09:27:31.812435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:31.925922Z","title":"Adaptive spatio- temporal graph enhanced vision-language representation for video QA,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:31.925922Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:966699ab9a858e95ff40e818819724305909da435833eaf84b20531f79d971fa","observation_id":"420785a2-87ff-4ebc-9995-d7fa2e27604e","resolution":{"observed_at":"2026-08-04T09:27:31.925922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:32.061616Z","title":"Exploring language hierarchy for video grounding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:32.061616Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:9277e32edcd5985548eeda7a6b5ff8a4a7879f8ac4dbd97270e1dcdaca19b36b","observation_id":"5a1d09eb-1f79-4419-a6dc-d1e6056ac403","resolution":{"observed_at":"2026-08-04T09:27:32.061616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-04T09:27:32.099327Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:32.099327Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:a34cfca1cb8084dbecd970ebe71ab9203bc7f9c16e1f2f42bd7f6f0f3dfe50ea","observation_id":"d75c092c-1544-43d0-a39e-b17988689ab7","resolution":{"observed_at":"2026-08-04T09:27:32.099327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:32.180909Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:32.180909Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:2623258a206ead6a2b943112df0e9c4907fc03bbbeb869d1073cd1e47f847739","observation_id":"66a2ca70-a2d6-4263-b222-c076b00d3a6c","resolution":{"observed_at":"2026-08-04T09:27:32.180909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.11394","last_updated":"2020-06-25T10:23:08Z","snapshot_observed_at":"2026-08-08T20:57:20.412004Z","submitted_at":"2020-01-30T15:25:54Z","title":"ERA: A Dataset and Deep Learning Benchmark for Event Recognition in Aerial Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.11394","snapshot_observed_at":"2026-08-04T09:27:32.357873Z","title":"ERA: A dataset and deep learning benchmark for event recognition in aerial videos,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:32.357873Z"},"links":{"cited_paper":"/paper/2001.11394","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:4d46366e622eb12a8e3b1a823e24c7a73748f5453ff65cc39d7105b3a633f800","observation_id":"a18ce8eb-18a6-408f-8d67-a1f5f22e59de","resolution":{"observed_at":"2026-08-04T09:27:32.357873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-04T09:27:32.462871Z","title":"Sharegpt4v: Improving large multi-modal models with better captions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:32.462871Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:873060242b6bf68acfa957baca3a58ad1373cfc91979b753edb6757f28021d59","observation_id":"68194454-ded6-4e32-918d-2dfbe69aee6b","resolution":{"observed_at":"2026-08-04T09:27:32.462871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:32.572859Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:32.572859Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:7ea15c60b23e69fb1840fce00118c8b2e84b3cbe39528de42251cb8555f31df6","observation_id":"470f4a6b-2dfe-4047-8fdb-ddbf8073072c","resolution":{"observed_at":"2026-08-04T09:27:32.572859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:32.630351Z","title":"SGDR: stochastic gradient descent with warm restarts,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:32.630351Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:483d5cb087e72f177820602452303806f1f0344aa8ef40697ef7871aaaa63469","observation_id":"f834c26c-f347-4705-9ba6-bb0f73c85096","resolution":{"observed_at":"2026-08-04T09:27:32.630351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07111","last_updated":"2022-03-14T13:55:33Z","snapshot_observed_at":"2026-08-06T20:50:04.667147Z","submitted_at":"2022-03-14T13:55:33Z","title":"Disentangled Representation Learning for Text-Video Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07111","snapshot_observed_at":"2026-08-04T09:27:32.734611Z","title":"Disentangled repre- sentation learning for text-video retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:32.734611Z"},"links":{"cited_paper":"/paper/2203.07111","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:78f4eb232963c20014f76f118d21821d2de08e29e02cd800a158e0f9cbd278b3","observation_id":"75667931-de7d-47aa-a09f-601be6a4bd2d","resolution":{"observed_at":"2026-08-04T09:27:32.734611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:32.792332Z","title":"Unified coarse-to-fine alignment for video-text retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:32.792332Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:3b1316cc7fe63e2834327767f68e6686d969b1ec5570585eb1d90bb41ef2e594","observation_id":"aef1d775-333c-4235-b609-b219180a5b23","resolution":{"observed_at":"2026-08-04T09:27:32.792332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:32.873537Z","title":"Text is MASS: modeling as stochastic embedding for text- video retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:32.873537Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:a809b33dcedac62893de477d27e8e31b838b23591544a1d0ae844f3281dd62fb","observation_id":"7db79281-f41a-4fcb-9d0b-321f8338fdf3","resolution":{"observed_at":"2026-08-04T09:27:32.873537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:32.954982Z","title":"DGL: dynamic global-local prompt tuning for text-video retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:32.954982Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:da4adcaa04f8c6776fcb842e6936910aa88f7817bee4f0fc3487825aba13328b","observation_id":"6e4f03fb-4a4a-41b7-b328-e08aab1cbf7c","resolution":{"observed_at":"2026-08-04T09:27:32.954982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:33.087130Z","title":"Text-video retrieval with global-localsemantic consistent learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:33.087130Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:294dd0de11ab047951c6a0e3cf35772f819ec5fca022c943ba39112423afb15a","observation_id":"0777012d-2953-4d31-9fae-33978252ff21","resolution":{"observed_at":"2026-08-04T09:27:33.087130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:27:33.138881Z","title":"Tempme: Video temporal token merging for efficient text-video re- trieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:33.138881Z"},"links":{"citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:6e797b4218f5cd4b8ef04ac8ac2cdef10f1c6184d52370a9bac62dd7dc1ad40f","observation_id":"e1a50d70-ce7a-42e3-ae7c-798b52a53934","resolution":{"observed_at":"2026-08-04T09:27:33.138881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T16:33:53.114091Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2510.15470."}