Pith. sign in

Paper Citation Record · LEDGER

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis

As of 10 August 2026, this Paper Citation Record lists 100 of 146 outbound references and 3 inbound Pith citation observations for arXiv:2502.01785.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.01785 v1

Coverage vector

measured 100 of 146 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T14:32:36.915707Z

measured 103 of 103 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-31T18:28:55.336300Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-19T02:06:58.769990Z

Reference resolution

100 of 146 outbound references displayed

  • verified exact1
  • verified fuzzy17
  • unresolved78
  • parse uncertain4
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a7623565-8729-4681-a66c-db3503da4085 · outbound

This paper cites an unresolved cited work.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.626516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.626516Z digest=sha256:685145a1c9a05705c75235e0470954f4854180d935e0f14213cf6ef99b2cc1b4

Observation c87b2a3c-41eb-4dfb-ac1e-e75e00c57c5a · outbound

This paper cites an unresolved cited work.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Unresolved cited work

Reference 2

Resolution
parse uncertain
no resolver link, observed 2026-08-09T14:32:36.630438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.630438Z digest=sha256:c5a7c57e05b1ed76eacef9367ca2d0bb1f0463d31172dc272ea75f76406277d3

Observation a3efb222-2be9-4a49-b967-a47dac57022c · outbound

This paper cites Aquarium dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Aquarium dataset,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.633834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.633834Z digest=sha256:c671d44547664cd788c33c937db954d4bf63987b9a61d5355dbf1c35ea65394c

Observation 8800c6c8-56ff-4aa8-a823-22f9e0836bda · outbound

This paper cites Hk reef fish Images.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Hk reef fish Images

Reference 6

Resolution
parse uncertain
no resolver link, observed 2026-08-09T14:32:36.637273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.637273Z digest=sha256:9fcdd9111a1c6c9b494dadb4a6d703eedc6fca1718f19db7eac74778fa1f27bd

Observation 94fa62e8-fe2e-4dab-9fde-1417a961572f · outbound

This paper cites Marine Animal Images,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Marine Animal Images,

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.640036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.640036Z digest=sha256:ffcc8230f7a8d14c1cebfcf19e0e8ba45ed1e9805de6e9b81f9292274cb5bf0a

Observation 23e42243-6f4a-4a70-a598-a95a63d4caf3 · outbound

This paper cites Sea Animals Image Dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Sea Animals Image Dataset,

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.642906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.642906Z digest=sha256:8cb6b4cb1ca4a358ada6bef2e5f28979d2733e2cf894968aeb92843d3b22844c

Observation c952f362-ade7-47d3-a003-d0d858e0164c · outbound

This paper cites Shutterstock Image.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Shutterstock Image

Reference 9

Resolution
parse uncertain
no resolver link, observed 2026-08-09T14:32:36.646014Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.646014Z digest=sha256:35922bbb5e9eacf582cbd8a2568d634d25cffe9adbe102f646fce68b637dbed9

Observation 47a556ea-647a-4411-9271-1fa0bf902a6a · outbound

This paper cites Underwater trash detection dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Underwater trash detection dataset,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.648670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.648670Z digest=sha256:7bbbad46efac7a26ac2398deba11c4dd1ffa3be8199be8b44678f5ff4f059e66

Observation 180749ba-659e-41cc-90ee-97d79edf866e · outbound

This paper cites an unresolved cited work.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Unresolved cited work

Reference 11

Resolution
parse uncertain
no resolver link, observed 2026-08-09T14:32:36.651735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.651735Z digest=sha256:21c30ff6135f3b38b6126cbd27aa4ad4c9aace7b0458e66d92ae4dcbd042b63a

Observation b8ccc24f-67eb-4e13-a3da-e4e649ade122 · outbound

This paper cites Ozfish dataset - machine learning dataset for baited remote underwater video stations,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Ozfish dataset - machine learning dataset for baited remote underwater video stations,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.654717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.654717Z digest=sha256:b9a8b40e7b4c4b263fe058b1581cf002ce8d3eacc8aab4e0d4c269cb2a9e46fe

Observation 55668029-b596-45eb-a669-fa47922d02bb · outbound

This paper cites URPC dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis URPC dataset,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.657477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.657477Z digest=sha256:753a180cb8e037a5f15ce1d77e2f6537fd702b41e7addc9b9b33d674c35a59ca

Observation 51654ac3-bd56-4c84-97a1-2eb7f19ca817 · outbound

This paper cites Oceanic life dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Oceanic life dataset,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.660289Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.660289Z digest=sha256:b07c8f14e0b1612365229fa4a9b1830145f7b9e7c3b52e54696ec7dd2c29bc4b

Observation 1a73677d-6521-408f-9fa6-6a1e7973d005 · outbound

This paper cites A novel coral reef classification method combining radiative transfer model with deep learning,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A novel coral reef classification method combining radiative transfer model with deep learning,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.662643Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.662643Z digest=sha256:42155ee82bb1b1a975034a66409826b2225692ae0a29fa335df4c43da2defe31

Observation cec7effd-60be-4200-b6dc-9b7c8dbd6b91 · outbound

This paper cites Utb180: A high-quality benchmark for underwater tracking,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Utb180: A high-quality benchmark for underwater tracking,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.665444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.665444Z digest=sha256:375e1ba8a0a37ace66766d4bed34a00466489b2e64ed06cc75d6db13f5996484

Observation 9300b776-b3d7-44e9-b2dd-a602e9963a90 · outbound

This paper cites Computer vision in aquaculture: a case study of juvenile fish counting,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Computer vision in aquaculture: a case study of juvenile fish counting,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.671749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.671749Z digest=sha256:73decdd2c705d2141c32c13d8aec1e2287fb3879216405915905be2a0c760e41

Observation 2e1c90a1-044f-462f-aa73-69aa84ba5dbb · outbound

This paper cites BEiT: BERT Pre-Training of Image Transformers.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis BEiT: BERT Pre-Training of Image Transformers

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.674570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.674570Z digest=sha256:138881c007dda11f416be7692d0188bc1361e48ee7b158fb07795d992a0eb949

Observation bfcd744d-174f-40b8-b0a2-0931af034881 · outbound

This paper cites Deep learning for detection and counting of nephrops norvegicus from underwater videos,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Deep learning for detection and counting of nephrops norvegicus from underwater videos,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.677852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.677852Z digest=sha256:e2be6ad357a36be1d7267a765998069d50e3df5a5eef189874baac51da5aaecb

Observation 59fd532a-a257-45db-bfb0-2094e82de18a · outbound

This paper cites Semi-supervised visual tracking of marine animals using autonomous underwater vehicles,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Semi-supervised visual tracking of marine animals using autonomous underwater vehicles,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.680909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.680909Z digest=sha256:78c58f554620fd2fe6a5b07cb2db2b8cf4198954b5892b8bc6ff430c1de54761

Observation 0b00b0e6-bfed-4e58-8d84-6149038bfb76 · outbound

This paper cites Emerging properties in self-supervised vision transformers,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Emerging properties in self-supervised vision transformers,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.683636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.683636Z digest=sha256:2976c219be2b37a8897e848449bebb24c421240f1fd77a262799e28624eb7377

Observation 348a7bb7-4057-4279-b001-1d827671b5c3 · outbound

This paper cites Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.686746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.686746Z digest=sha256:5973b3a147dea58907ec09b8f4802efcbcb15d35bd67e6cd55b550b8a873a03d

Observation 0991f7f5-7d7d-441e-a956-30e4d119329c · outbound

This paper cites You only look one-level feature,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis You only look one-level feature,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.689964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.689964Z digest=sha256:24e570d24ee729bbff8a8b0adc800deb9afb1c3bfa7415a243b34b5a616763c1

Observation b9717a93-9b5d-4982-aa5e-e08f42101cf9 · outbound

This paper cites A simple frame- work for contrastive learning of visual representations,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A simple frame- work for contrastive learning of visual representations,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.692992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.692992Z digest=sha256:6f08d19bf8f5dd94596d5fe70c42cf77b62a2543b5533221609e82545411e6f3

Observation 71baa9a0-4529-4d42-87d1-5c54eec0666b · outbound

This paper cites Masked-attention mask transformer for universal image segmenta- tion,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Masked-attention mask transformer for universal image segmenta- tion,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.696050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.696050Z digest=sha256:ade82379a90455849c7aba5e912263a1082f3d264c2a5597f85b85602c572297

Observation 3b12c543-ff46-4d4c-b085-253b247f6969 · outbound

This paper cites Flow: A dataset and benchmark for floating waste detection in inland waters,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Flow: A dataset and benchmark for floating waste detection in inland waters,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.699016Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.699016Z digest=sha256:90e18dd35efc63deac40976e24d996178225e71d13ae950eec42952e4185ee1c

Observation 762cf6b8-571b-4312-bb0d-d0ba5db4837e · outbound

This paper cites Marine fouling images,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Marine fouling images,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.701853Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.701853Z digest=sha256:e0bc3fe5cee553bede597ac4916c68bef2dfcdcc3408e7f5d6a07a63415bcd7a

Observation 1a0e60f8-7863-401d-88f0-2ca8392e82ed · outbound

This paper cites Underwater image dehazing via unpaired image-to-image translation,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Underwater image dehazing via unpaired image-to-image translation,

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.704626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.704626Z digest=sha256:459afe8b3d7f56411ffffec9d3e268319761b6cf7e8e50d7b09e15dfe2971ac3

Observation a5f7111a-94d9-4800-9833-27d3853d5c9d · outbound

This paper cites Pdffigures 2.0: Mining figures from research papers,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Pdffigures 2.0: Mining figures from research papers,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.707293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.707293Z digest=sha256:a89fc808dac5e57293ffe7ec3441941543f238cbd6f3e02d5707be993ba2bff9

Observation 40c137d1-aeae-431c-aa46-f1fa105d62a6 · outbound

This paper cites Class-balanced loss based on effective number of samples,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Class-balanced loss based on effective number of samples,

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.710254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.710254Z digest=sha256:582cb97d3fb9592775f11e3c58ba4155d70437d1348b07b3a7e89963ba64b8c0

Observation 9a275941-10a9-4cbf-9abe-96618b519670 · outbound

This paper cites Ocean acidification’s impact on marine ecosystems,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Ocean acidification’s impact on marine ecosystems,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.713114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.713114Z digest=sha256:30dcd215e594ae776c1ce73105e3ec3e3154b906369deeafb414806633461d58

Observation 30c9fec3-b67a-4239-b902-4828e85cf336 · outbound

This paper cites Imagenet: A large-scale hierarchical image database,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Imagenet: A large-scale hierarchical image database,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.715962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.715962Z digest=sha256:4d9b3371de38d6e0c7f4e44315e97422b3e4175fd866caa8b4827c7d12a5edcf

Observation de822310-ede3-49d6-8d53-e416f2129c37 · outbound

This paper cites Aquagan: Restoration of underwater images,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Aquagan: Restoration of underwater images,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.719199Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.719199Z digest=sha256:3a7eb5ca58c60a1ebce4ec63ba392b89081b2bf8214679a465b430f599fec727

Observation f20bf7a3-acd5-433d-b828-55399b798ec1 · outbound

This paper cites Corals classification,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Corals classification,

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.721905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.721905Z digest=sha256:536efefa5f95f26eefe62f543b0b55abc05964e2a81f904140d49c5d16f3ba8b

Observation 500d7e85-c7da-46fb-bccc-f460c10e8b74 · outbound

This paper cites The wonders of coral reefs,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The wonders of coral reefs,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.724884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.724884Z digest=sha256:5d6d591dc2499487245439fdb58b99d81c6f126b90fcedb0329fc581fd318fdb

Observation 3f73a9a1-ac4e-44d1-be7d-045cc08ede7e · outbound

This paper cites Climate change impacts on marine ecosystems,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Climate change impacts on marine ecosystems,

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.727626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.727626Z digest=sha256:79945ca17aca674b2d39b9715392398f8eb4fd0c46588301c78fbf6f71e01f25

Observation 8c996df8-45d9-46c5-b76a-0ac86bcf5916 · outbound

This paper cites An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.730768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.730768Z digest=sha256:67ca96eebdd6f8c57f2deeb16f10a508862cb7dc2e66a171f5a9088155bb75ac

Observation a9323ed7-0784-46cb-9bef-39d7f192137d · outbound

This paper cites Rebuilding marine life,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Rebuilding marine life,

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.733726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.733726Z digest=sha256:cc83be173a6d04af1821e03db4004a9f2b07968a5058e9f31b56600f8b2ac15e

Observation 1c9a36e0-c379-42d4-96ea-341af39a75ad · outbound

This paper cites The decline of australia’s great barrier reef,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The decline of australia’s great barrier reef,

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.737018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.737018Z digest=sha256:39352c0c107efb38506dfd422c7684e04ca0688445f1b7091e714cf801a1e634

Observation 18c1a540-400a-457f-847b-478fbbd01ab3 · outbound

This paper cites Instances as queries,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Instances as queries,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.739889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.739889Z digest=sha256:4c44bc4c82579e1ab71d8236f5e0d64659994804a41334c2f53f6db6360f3ffe

Observation c2d21c43-58da-4424-b42d-51fcb3a19cc0 · outbound

This paper cites Tood: Task- aligned one-stage object detection,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Tood: Task- aligned one-stage object detection,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.743121Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.743121Z digest=sha256:7f7503b0951a93d342793c358158471d7ec702e6c4991b622e1f758334f69677

Observation 426c4690-d77e-4913-8bf5-66fa5cd2f9b7 · outbound

This paper cites Robotic detection of marine litter using deep visual detection models,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Robotic detection of marine litter using deep visual detection models,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.745823Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.745823Z digest=sha256:8df987f09feb53a3180f42e68aa252e63ed49d338260073e4d336d45398d7101

Observation fcf42488-f30a-418e-b20f-b05f7e3f435b · outbound

This paper cites A Cookbook of Self-Supervised Learning.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A Cookbook of Self-Supervised Learning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.749163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.749163Z digest=sha256:a8477f02257450e5f340ce1f393e55db8ee43e4b230064a9da8210f25da83f1a

Observation 56906724-5095-4515-97ee-a5e1c0b9833a · outbound

This paper cites A survey on underwater computer vision,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A survey on underwater computer vision,

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.753333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.753333Z digest=sha256:f45a85dda2fee5ab4d3b5b5e74a75ce3124983a93d0dcb54c1a0099ef9444234

Observation 64137cee-7599-4a0d-b3f9-7b11abdcfca3 · outbound

This paper cites The mpa guide: A framework to achieve global goals for the ocean,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The mpa guide: A framework to achieve global goals for the ocean,

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.756027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.756027Z digest=sha256:df947aae0cafb2cc5e6200f3ece8681f06995988ab53a54ec7a4ad06d45b70ae

Observation 90b4e61a-51b3-447e-b1f1-313bb1993b36 · outbound

This paper cites Coral species classification dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Coral species classification dataset,

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.758696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.758696Z digest=sha256:b6ccebf828684ef720c4bd99429d9a6ef2c637f4dcd7b834d62d66c64f725b76

Observation 6bccf84c-7d08-4b99-8987-05a126d9f6ea · outbound

This paper cites MarineDet: Towards Open-Marine Object Detection.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis MarineDet: Towards Open-Marine Object Detection

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.761385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.761385Z digest=sha256:cb29a01e6c013109ebb54cd2eaa5ba57c85e1db6afe6a4071b877e6b333b9ed9

Observation 316d164b-ad10-47d9-b40c-bed3483cfd47 · outbound

This paper cites A global map of human impact on marine ecosystems,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A global map of human impact on marine ecosystems,

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.764531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.764531Z digest=sha256:a0abee72fe7aeb6f1143b2a9d34c7a1a699cc749c16e475d27d2fce2042fe14d

Observation bf34b609-6bc7-48bf-9cf9-defb93dbcd7e · outbound

This paper cites Umotma: Underwa- ter multiple object tracking with memory aggregation,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Umotma: Underwa- ter multiple object tracking with memory aggregation,

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.767425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.767425Z digest=sha256:4f9e9741861a632352426a793a40066c1e9aaa0583afd032e9f3506eb94c32e4

Observation ab414238-5b81-4b92-8d95-736c377fa729 · outbound

This paper cites Deep residual learning for image recognition,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Deep residual learning for image recognition,

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.770140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.770140Z digest=sha256:17f038bdc20d295325e9b79d3771a984fe3506f2becbd2d0341786f06c5a9650

Observation 3d3b705d-0061-4f7d-b812-571a752517ca · outbound

This paper cites TrashCan: A Semantically-Segmented Dataset towards Visual Detection of Marine Debris.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis TrashCan: A Semantically-Segmented Dataset towards Visual Detection of Marine Debris

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.773388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.773388Z digest=sha256:64caee4789e1d6f90f7d0b4e0066ac5bf4c7cc594bc383c8754ed3f9c18500c6

Observation 3c9bbe8f-f382-452d-a73a-13757db85ea2 · outbound

This paper cites Usod10k: A new benchmark dataset for underwater salient object detection,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Usod10k: A new benchmark dataset for underwater salient object detection,

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.776525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.776525Z digest=sha256:b18d0891412dee0a5865624a2cd14490586d7f245613df36f2313f92a6981752

Observation c6671dfa-2c0e-4c4c-a11b-f2388cceea81 · outbound

This paper cites Underwater image restoration based on convolutional neural network,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Underwater image restoration based on convolutional neural network,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.779115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.779115Z digest=sha256:b0f1f103ba86a9212edda42ab0186c9744195b9cbae22629fa069db0a67a5ae5

Observation 03dd49a2-4348-491a-8aa9-0b077ea42aab · outbound

This paper cites Contrastive semi- supervised learning for underwater image restoration via reliable bank,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Contrastive semi- supervised learning for underwater image restoration via reliable bank,

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.782150Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.782150Z digest=sha256:5ec58a4dab190b516fd8d73082f2c2c4bf230b7bba136e1d6c45f7e09a459a48

Observation 8f5e206a-6f99-42a6-9991-53923eb3721f · outbound

This paper cites Semantic Segmentation of Underwater Imagery: Dataset and Benchmark,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Semantic Segmentation of Underwater Imagery: Dataset and Benchmark,

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.784940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.784940Z digest=sha256:9c6d6bbac268c5d5ff157c29c09d3879cb1d8557117e417fde3720e7d6aef7c6

Observation ccc5361a-80ca-4607-8f2c-59374c7800f5 · outbound

This paper cites Fast underwater image enhance- ment for improved visual perception,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Fast underwater image enhance- ment for improved visual perception,

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.787653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.787653Z digest=sha256:a0c6fcbf3b6b103c1001e2bbfbb58352faba662e146537bed451cdeb629065c2

Observation 911a9ecc-ba17-49e3-afc6-69e9564a74f5 · outbound

This paper cites Svam: Saliency-guided visual attention modeling by autonomous underwater robots,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Svam: Saliency-guided visual attention modeling by autonomous underwater robots,

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.790223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.790223Z digest=sha256:c72817d263f2dafbb10482cd190211bd128ca74b32b400811d8e24570c285d33

Observation 9bce04d4-14b0-42fe-b087-e1923fbc736c · outbound

This paper cites Fish detection and species classification in underwater environments using deep learning with temporal information,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Fish detection and species classification in underwater environments using deep learning with temporal information,

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.792974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.792974Z digest=sha256:75c52c589e70e75cd3c76420a0c5335f293f27d4f09fcd33767b61d2259041ac

Observation 1daeb3c8-5e51-4117-b49d-db6c4ef07798 · outbound

This paper cites The effects of fishing on marine ecosystems,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The effects of fishing on marine ecosystems,

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.796011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.796011Z digest=sha256:f5eb8eaae7f5acc0d4fa04359b063d4a8ecd11ee2861cb156032cbbde0006f38

Observation d46d7758-5dd3-4068-84fd-193522080267 · outbound

This paper cites FathomNet: A global image database for enabling artificial intelligence in the ocean,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis FathomNet: A global image database for enabling artificial intelligence in the ocean,

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.798523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.798523Z digest=sha256:001ddb4d0043136749d3e089a9b744f69ee8b25bd4af9e2b3869646b459e6343

Observation 4a06a3c6-98bc-4e48-82c7-0cbeaf5f4520 · outbound

This paper cites The Fishnet Open Images Database: A Dataset for Fish Detection and Fine-Grained Categorization in Fisheries.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The Fishnet Open Images Database: A Dataset for Fish Detection and Fine-Grained Categorization in Fisheries

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.801409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.801409Z digest=sha256:93605bb93c0cb5e39d87764aaa8a76fe841e65143e2a1b4ec0fd5dfc3157cf21

Observation b031326b-93e4-4d64-95f4-54c7ca229f19 · outbound

This paper cites Mask transfiner for high-quality instance segmentation,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Mask transfiner for high-quality instance segmentation,

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.804496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.804496Z digest=sha256:6c05ea90e8425a3afcc075c1e43fe1b9d1d0c4e266d16523d7d296e0fef54c07

Observation e06573d6-d230-40f7-aa23-3b897fd40d43 · outbound

This paper cites Fishnet: A large- scale dataset and benchmark for fish recognition, detection, and func- tional trait prediction,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Fishnet: A large- scale dataset and benchmark for fish recognition, detection, and func- tional trait prediction,

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.807399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.807399Z digest=sha256:7e50660b4dd083cc996083e2c899789e4a92420c5bbfaa979dbe38b90119dcb3

Observation 208094de-2ee8-4c8b-8ba8-3e7b0b5f4a67 · outbound

This paper cites Maple: Multi-modal prompt learning,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Maple: Multi-modal prompt learning,

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.810526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.810526Z digest=sha256:8f1466b3ff6f587017c42e8ec4ea17fa1be8042e5fa0a9d4ba131802ff0aa70d

Observation 3e16c40a-51be-44c6-b797-604099439eae · outbound

This paper cites Segment anything,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Segment anything,

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.813221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.813221Z digest=sha256:e95dff6337ec65284361baaaa5d9aeb9963119864a9728e4b0505efa372380da

Observation 33eaf291-67a2-441d-afaa-bb022cd47266 · outbound

This paper cites Pointrend: Image segmentation as rendering,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Pointrend: Image segmentation as rendering,

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.815838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.815838Z digest=sha256:33452af72da394c464d5493b5ebca35470b38d35757eb80b6ff7cac194f20af3

Observation 4590d7d0-9482-4cec-8924-c946925a1efe · outbound

This paper cites Detection and tracking of underwater fish using the fair multi-object tracking model: A comparative analysis 28 of yolov5s and dla-34 backbone models,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Detection and tracking of underwater fish using the fair multi-object tracking model: A comparative analysis 28 of yolov5s and dla-34 backbone models,

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.819028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.819028Z digest=sha256:be4f05dccab582fa97ef7cd6532a0acceda89e23296cdca676db4a24c511f299

Observation 0dd826fd-eef8-4196-b5e1-c284d5881ce4 · outbound

This paper cites Watergan: Unsupervised generative network to enable real-time color correction of monocular underwater images,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Watergan: Unsupervised generative network to enable real-time color correction of monocular underwater images,

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.821852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.821852Z digest=sha256:b4db9b655a93b9faf92db09ca2d25dca771cce7b44c73c6629ca1f1d0792979f

Observation a9709e53-7887-4d09-b06f-088c6e232839 · outbound

This paper cites Deep learning for visual recognition and detection of aquatic animals: A review,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Deep learning for visual recognition and detection of aquatic animals: A review,

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.824430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.824430Z digest=sha256:ecaedf444aa924633d55894aa432c22356e5665b9fdbdf608d7e969920ee3dfd

Observation 73459cd0-2871-4342-b7f5-17a21c1029e8 · outbound

This paper cites Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.827013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.827013Z digest=sha256:2218a300fb7d404f0dfa257c1e755ebd979bd858f36e6c39ac020de48264bd5b

Observation 28464894-6440-4b66-ba4b-6d739362e442 · outbound

This paper cites Citetracker: Correlating image and text for visual tracking,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Citetracker: Correlating image and text for visual tracking,

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.829761Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.829761Z digest=sha256:d2ce64a2d94cf537a32d7bede96dcbf2d052cb68510b093d3de174c7ea7f1d2d

Observation 1af0c70c-95e4-4bc5-ae4f-476ff02b4339 · outbound

This paper cites Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.832435Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.832435Z digest=sha256:b80e0221ae24e0a5aac3bb4f4d05b20343fe0d932c4836678d1e33dd698ca860

Observation d2eba434-bde2-4ebd-916a-022a565d7df7 · outbound

This paper cites Underwater object tracker: Uostrack for marine organism grasping of underwater vehicles,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Underwater object tracker: Uostrack for marine organism grasping of underwater vehicles,

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.835426Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.835426Z digest=sha256:0f5b1747c82c3306e31ef882a859e581a4247f319392679eea15596e7d0bafe1

Observation f0f2188d-ac82-419c-b871-b5adb2d117e5 · outbound

This paper cites Watermask: Instance segmentation for underwater imagery,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Watermask: Instance segmentation for underwater imagery,

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.837946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.837946Z digest=sha256:36efb99822c3552933af73e43dbbecc80d75786e524e2b850bc430ddd8b6c43b

Observation c4a48a4b-95c6-419c-9c52-1d2d897fd228 · outbound

This paper cites An end-to-end transformer model for crowd localization,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis An end-to-end transformer model for crowd localization,

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.840987Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.840987Z digest=sha256:dd7ddc2c9c08521a52138df0ba07ef2d962a9b3242e7fd906d84469342e2aac1

Observation 1a87815a-f789-40f2-96dc-9a69d893d544 · outbound

This paper cites Focal loss for dense object detection,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Focal loss for dense object detection,

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.843537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.843537Z digest=sha256:5caa71c0ff6ff336b832ec771e477ddbdac504138de5f1f922685ea78a20ba27

Observation 19a79aa2-3491-40b8-bd43-a8a2826cd236 · outbound

This paper cites Microsoft coco: Common objects in context,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Microsoft coco: Common objects in context,

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.846217Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.846217Z digest=sha256:583414745460b1dbebb2babf91f61039f716e02dc138fe594ce7f41ed1301186

Observation 7723e8b4-d64e-4a59-9944-8b999e9e2755 · outbound

This paper cites A new dataset, poisson gan and aquanet for underwater object grabbing,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A new dataset, poisson gan and aquanet for underwater object grabbing,

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.093642Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.848549Z digest=sha256:e52c88decc0219b805924f8078224cb3c29e12aec850313cea098e3e2cebef17

Observation 7acd1826-3099-4266-86c2-f367c95665c5 · outbound

This paper cites Cffi-vit: Enhanced vision transformer for the accurate classification of fish feeding intensity in aquaculture,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Cffi-vit: Enhanced vision transformer for the accurate classification of fish feeding intensity in aquaculture,

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.084785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.850991Z digest=sha256:f37c7e453fb1ff4346b949938d19ca336d5fdbf4972597318c6852035a65199b

Observation 6bcf1e9c-644e-493f-81a6-b56f53836847 · outbound

This paper cites Dp-fishnet: Dual-path pyramid vision transformer-based underwater fish detection network,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Dp-fishnet: Dual-path pyramid vision transformer-based underwater fish detection network,

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.077140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.853552Z digest=sha256:f95b4c489dac3f95e276ade8b63153538906d45a2f7bcca3644436c4a831c87f

Observation ca511ec4-e457-4f88-9d7a-789a3aedf3ae · outbound

This paper cites A convnet for the 2020s,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A convnet for the 2020s,

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.856470Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.856470Z digest=sha256:b2aef032f8dd6b33725cc4a726062c983a56cc4b9c83d12974b9974028389433

Observation acd1329e-dddb-4ea0-aa59-f6279af9f167 · outbound

This paper cites Decoupled Weight Decay Regularization.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Decoupled Weight Decay Regularization

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.858811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.858811Z digest=sha256:d7f103fa1b981c8c98eafc248cd2c4ade72bee61c8629ab015683b087d123479

Observation 069660ee-76e8-4e92-afab-4079bd8575b7 · outbound

This paper cites Multi-scale adversarial network for underwater image restoration,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Multi-scale adversarial network for underwater image restoration,

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.064575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.861944Z digest=sha256:3e6854d98988375912f5a3e0776c2ba9d125dc2eace671d57d3a3cb03606eff5

Observation 51d646f3-3c80-4d0c-a80a-21494bf11e9d · outbound

This paper cites Enhancing clip with gpt-4: Harnessing visual de- scriptions as prompts,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Enhancing clip with gpt-4: Harnessing visual de- scriptions as prompts,

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.056746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.864764Z digest=sha256:2afcae1d82cdd574b7062db3e624837f7a878f299f2f153982c2ec5ca94cd680

Observation b04fd5dc-3c7c-4844-a807-10f71e41747e · outbound

This paper cites Australasian freshwater fish faunas: diversity, interrela- tionships, radiations and conservation,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Australasian freshwater fish faunas: diversity, interrela- tionships, radiations and conservation,

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.048317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.867519Z digest=sha256:e9e74a548258e9e59205ed92652624a865b92e9845c5be6abd04a144883e345e

Observation 4796e597-07a3-4eef-8652-e6fc2eacf5a7 · outbound

This paper cites The rich biodiversity of ocean ecosystems,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The rich biodiversity of ocean ecosystems,

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.039272Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.870239Z digest=sha256:2aa5be74afdea7c9e49e6471b114d9601d91779a1e468f69e58aa7e52701e868

Observation 33ac7f0a-4366-473a-8b13-52a3a1997867 · outbound

This paper cites Coral identification and counting with an autonomous underwater vehicle,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Coral identification and counting with an autonomous underwater vehicle,

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.030196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.873073Z digest=sha256:39875f4450b6a58db07fe8a805cc7984b9662d69e1c4c0af45cdb20bbc4061ed

Observation 3b6459ab-5ff4-4b4a-8fd5-fb4df344f9ea · outbound

This paper cites Innovative approaches to coral conservation,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Innovative approaches to coral conservation,

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.020750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.875777Z digest=sha256:f90a12b6593cd4be0f5eba53daef8730f2a09cf60494eaff94d59b82cdbf3cd8

Observation e932bc13-e4fd-4df5-8bfc-7260d0bddea8 · outbound

This paper cites Embodiedgpt: Vision-language pre-training via embodied chain of thought,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Embodiedgpt: Vision-language pre-training via embodied chain of thought,

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.878540Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.878540Z digest=sha256:46baf0af59c256db870f513b26d07603451b9b4a1f18bc3ad5ddd3ccc9db6c35

Observation 880b1daf-c74c-43d9-b6c6-5a159c22f79a · outbound

This paper cites I2mvformer: Large language model generated multi-view document supervision for zero-shot image clas- sification,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis I2mvformer: Large language model generated multi-view document supervision for zero-shot image clas- sification,

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.006804Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.881512Z digest=sha256:a548cd69aeee6ff2240da987ac9dcb18a9cf06aad3274d0da1b08c2262d8e35c

Observation 7b9ef932-39d9-4c42-b4f1-ce53034e8268 · outbound

This paper cites Dinov2: Learning robust visual features without supervision,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Dinov2: Learning robust visual features without supervision,

Reference 92

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.997871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.884725Z digest=sha256:fcd04bc0a3f4b58697d14ae719977f7e5970e394aac4142c26908068c266e6c7

Observation 9b5108d4-f5ba-40b2-91c2-12858626e74a · outbound

This paper cites Comprehensive underwater object tracking benchmark dataset and underwater image enhancement with gan,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Comprehensive underwater object tracking benchmark dataset and underwater image enhancement with gan,

Reference 93

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.989347Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.887504Z digest=sha256:7a86af3430d14e4e85e9c3f2d9d64745aeb82147c12eb844bf69611ed5e3645f

Observation 7422b08a-c12e-4521-991a-55f6ad7018cc · outbound

This paper cites Detection of marine animals in a new underwater dataset with varying visibility,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Detection of marine animals in a new underwater dataset with varying visibility,

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.979823Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.890340Z digest=sha256:13f4597a7b0b13657b84e719fb677f31570ccd3f2aebd51828242bcb4639cd9b

Observation 49d56bc5-c136-481f-8bcd-511227916225 · outbound

This paper cites U-shape transformer for underwater image enhancement,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis U-shape transformer for underwater image enhancement,

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.970732Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.893275Z digest=sha256:50288b1fde4223cd2bdd622009f3719048c9ff7e772c4ccb967d68631dce96fa

Observation 69fe3a9a-a28d-4d8b-bcc0-4ddb767773cf · outbound

This paper cites Detecting and recognizing marine animals using advanced deep learning models,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Detecting and recognizing marine animals using advanced deep learning models,

Reference 96

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.961600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.895935Z digest=sha256:e0812fdd8c00b5de261f1b2c1420b5c6dcb8825ecf53530f0cdc41a4fd2f6a3c

Observation 6a27b01f-f93c-49ed-bc56-1dab46adf87e · outbound

This paper cites Learning transferable visual models from natural language supervision,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Learning transferable visual models from natural language supervision,

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.898402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.898402Z digest=sha256:8affdc794af809dc2b89e887206ebabfbc6d833c3e726ffde29bb6c888f37185

Observation 90e98c48-440b-4ba3-9e18-60c09a5ef48b · outbound

This paper cites Language models are unsupervised multitask learners,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Language models are unsupervised multitask learners,

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.901178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.901178Z digest=sha256:99e165244ab6a1c320c5e0d88c9c3a6e6bbf37dbc4cde9c803bc71a5d2814bb1

Observation 5b3c42de-8b8f-4b57-95b4-8fa6b4b82b2b · outbound

This paper cites Faster r-cnn: Towards real-time object detection with region proposal networks,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Faster r-cnn: Towards real-time object detection with region proposal networks,

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.903871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.903871Z digest=sha256:da2501118d5a84e391203c8106ad7ad62cb6b775595d65835255d1732d57b957

Observation a51dc73d-938a-41d6-9c5e-f8e34eb545cd · outbound

This paper cites A realistic fish-habitat dataset to evaluate algorithms for underwater visual analysis,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A realistic fish-habitat dataset to evaluate algorithms for underwater visual analysis,

Reference 100

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.937123Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.906899Z digest=sha256:9fab91fa5f5e917270d379299d88a3d4676e6f60bf6590da5417c07372c99af9

Observation bf59f670-0f08-411c-aaff-d07bae9af006 · outbound

This paper cites Overcoming Annotation Bottlenecks in Underwater Fish Segmentation: A Robust Self-Supervised Learning Approach.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Overcoming Annotation Bottlenecks in Underwater Fish Segmentation: A Robust Self-Supervised Learning Approach

Reference 101

Resolution
verified exact
local_arxiv, observed 2026-08-09T14:32:37.293130Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.909779Z digest=sha256:c466b39e1d432f8e9b0121957b856cdf8a5dcf6014124af2626b3ecc3d157217

Observation 207e0873-07df-4895-bb9d-5c84d536270f · outbound

This paper cites Computer vision and deep learning for fish classification in underwater habitats: A survey,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Computer vision and deep learning for fish classification in underwater habitats: A survey,

Reference 102

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.927506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:32:36.913016Z digest=sha256:142ed1e2e1e6e80484f5c915145d3b4567ed148e8a13c004f8542abe2f2e0546

Observation 025d8646-f340-4a52-8d95-994acbff08a1 · outbound

This paper cites Nlx-gpt: A model for natural language explanations in vision and vision-language tasks,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Nlx-gpt: A model for natural language explanations in vision and vision-language tasks,

Reference 103

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.915707Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.915707Z digest=sha256:38ec43f38661adb459f7b3238538efacb0945618d11ff587608875bfb91d48cc

Pith citing papers

Observation 835b0549-c4ff-4923-99f6-cd84e49684ec · inbound

AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock cites this paper.

AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-19T02:06:58.772657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-19T02:03:46.331803Z digest=sha256:a3fd2d60457919ebd4d833bb5e1d6b9c06b8cfbaee3558184f1ae96396ee1a44

Observation 3e79eda9-a4fc-43ff-abde-a0ccd1ac9cae · inbound

Label-efficient underwater species classification with logistic regression on frozen foundation model embeddings cites this paper.

Label-efficient underwater species classification with logistic regression on frozen foundation model embeddings AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-11T22:51:23.115841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-08T02:19:09.609298Z digest=sha256:bd9e76e4ed8ef8dd0581631528a58c4f1db0bad33b81a1d65ee68419010b4ebc

Observation 3f1cd8d7-5200-4278-aef5-7452f7ab6fd0 · inbound

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG cites this paper.

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-31T18:28:55.336300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T18:28:55.336300Z digest=sha256:d76cf9491b9a89a8a8a111ffaae8750f20c13ccb724c3cc1c0ee4b5ea902aa58