{"as_of":"2026-08-09T20:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a914eb0fba4b0bd863fa4f36dc2c88e66c93604e039cf9229641e4a077f21ba","coverage":[{"denominator":146,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:32:36.915707Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T18:28:55.336300Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T02:06:58.769990Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"cited_work":{"arxiv_id":"2502.01785","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01785","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aquaticclip: A vision-language foundation model for underwater scene analysis","venue":null,"work_id":"6cda2bd1-bb67-4ac4-8403-158922565a02","year":2025},"citing_paper":{"arxiv_id":"2507.22101","last_updated":"2026-05-05T13:51:40Z","snapshot_observed_at":"2026-07-06T22:04:49.159747Z","submitted_at":"2025-07-29T17:59:48Z","title":"AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T02:03:46.331803Z"},"links":{"cited_paper":"/paper/2502.01785","citing_paper":"/paper/2507.22101"},"observation_digest":"sha256:de71373e3850ffb4f2b53e689c60b75eb2f654c6994b4b38db68c2b5d7948cc3","observation_id":"835b0549-c4ff-4923-99f6-cd84e49684ec","resolution":{"observed_at":"2026-05-19T02:06:58.772657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"cited_work":{"arxiv_id":"2502.01785","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01785","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aquaticclip: A vision-language foundation model for underwater scene analysis","venue":null,"work_id":"6cda2bd1-bb67-4ac4-8403-158922565a02","year":2025},"citing_paper":{"arxiv_id":"2604.00313","last_updated":"2026-04-15T20:28:57Z","snapshot_observed_at":"2026-07-06T22:51:22.254518Z","submitted_at":"2026-03-31T23:27:09Z","title":"Label-efficient underwater species classification with logistic regression on frozen foundation model embeddings","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T02:19:09.609298Z"},"links":{"cited_paper":"/paper/2502.01785","citing_paper":"/paper/2604.00313"},"observation_digest":"sha256:d93d64cdf85d3de09535fff01c1c4540bfc293d287bc40005e9395bc604975dc","observation_id":"3e79eda9-a4fc-43ff-abde-a0ccd1ac9cae","resolution":{"observed_at":"2026-05-11T22:51:23.115841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01785","snapshot_observed_at":"2026-07-31T18:28:55.336300Z","title":"Aquaticclip: A vision-language foundation modelforunderwatersceneanalysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24313","last_updated":"2026-07-27T11:57:55Z","snapshot_observed_at":"2026-08-07T02:25:03.860012Z","submitted_at":"2026-07-27T11:57:55Z","title":"Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T18:28:55.336300Z"},"links":{"cited_paper":"/paper/2502.01785","citing_paper":"/paper/2607.24313"},"observation_digest":"sha256:d4c821a54fe8401e42687a64e3594f86d7092b80a8b1f1be29002f1571d07e99","observation_id":"3f1cd8d7-5200-4278-aef5-7452f7ab6fd0","resolution":{"observed_at":"2026-07-31T18:28:55.336300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01785/citation-record","integrity":"/paper/2502.01785/integrity","json":"/paper/2502.01785/citation-record.json","paper":"/paper/2502.01785"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.626516Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.626516Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:21328873aa9b96d993e6a5f518bf0d0bf3f366e31e5316c39ae9ba6544baef8c","observation_id":"a7623565-8729-4681-a66c-db3503da4085","resolution":{"observed_at":"2026-08-09T14:32:36.626516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.630438Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.630438Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:a22dde869b9a12bae9ee1077d56a3eba7f9dd39ccac90fa82c16309cf0ed73aa","observation_id":"c87b2a3c-41eb-4dfb-ac1e-e75e00c57c5a","resolution":{"observed_at":"2026-08-09T14:32:36.630438Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.633834Z","title":"Aquarium dataset,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.633834Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:ec608f42b99e17dd9ade24c2d40728d09ade34e5035d689330a7c2835aaf0859","observation_id":"a3efb222-2be9-4a49-b967-a47dac57022c","resolution":{"observed_at":"2026-08-09T14:32:36.633834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.637273Z","title":"Hk reef fish Images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.637273Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:16c4acf6b002fa9bc04f0686e165c8c129f237c6b0ad4273c31a38cac3b30931","observation_id":"8800c6c8-56ff-4aa8-a823-22f9e0836bda","resolution":{"observed_at":"2026-08-09T14:32:36.637273Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.640036Z","title":"Marine Animal Images,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.640036Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:314f932a85ab697d40c65d4eff1849018fced2c2b07e47a8015230e2a214d726","observation_id":"94fa62e8-fe2e-4dab-9fde-1417a961572f","resolution":{"observed_at":"2026-08-09T14:32:36.640036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.642906Z","title":"Sea Animals Image Dataset,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.642906Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:41245080a9b38249305e13be60cf507b8e498254645d26b53bbcbbbe6fe22f54","observation_id":"23e42243-6f4a-4a70-a598-a95a63d4caf3","resolution":{"observed_at":"2026-08-09T14:32:36.642906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.646014Z","title":"Shutterstock Image","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.646014Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:3b1b50fdbeded80ac634a3a7741e11cf4ad563529f918487ceacaefd8c57f7c1","observation_id":"c952f362-ade7-47d3-a003-d0d858e0164c","resolution":{"observed_at":"2026-08-09T14:32:36.646014Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.648670Z","title":"Underwater trash detection dataset,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.648670Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:f91e3d94db298a5176057b588789a46e5040b0594a4e2b6648732a1877d3dcb6","observation_id":"47a556ea-647a-4411-9271-1fa0bf902a6a","resolution":{"observed_at":"2026-08-09T14:32:36.648670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.651735Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.651735Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:349a304788c8412e3137ed668cab646948db48079aa4d3956a7af266d65cd7fa","observation_id":"180749ba-659e-41cc-90ee-97d79edf866e","resolution":{"observed_at":"2026-08-09T14:32:36.651735Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.654717Z","title":"Ozfish dataset - machine learning dataset for baited remote underwater video stations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.654717Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:970fc565643e7d6b116a6b39190e1229128d0823b98bd0e48653a41d516ea7e8","observation_id":"b8ccc24f-67eb-4e13-a3da-e4e649ade122","resolution":{"observed_at":"2026-08-09T14:32:36.654717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.657477Z","title":"URPC dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.657477Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:2f4e0f46d09b6d292dd5a73ba12bff45ce45953bb4e81c0edb91c85c1b091663","observation_id":"55668029-b596-45eb-a669-fa47922d02bb","resolution":{"observed_at":"2026-08-09T14:32:36.657477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.660289Z","title":"Oceanic life dataset,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.660289Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:060a7ca9f5254e2ae93ae32813cedf71ae150df34bc3b5468fa75ca71f913dc8","observation_id":"51654ac3-bd56-4c84-97a1-2eb7f19ca817","resolution":{"observed_at":"2026-08-09T14:32:36.660289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.662643Z","title":"A novel coral reef classification method combining radiative transfer model with deep learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.662643Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:add3824c679f990f6720498a444ad032465a9ba2126db36931365acc6d934fc3","observation_id":"1a73677d-6521-408f-9fa6-6a1e7973d005","resolution":{"observed_at":"2026-08-09T14:32:36.662643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.665444Z","title":"Utb180: A high-quality benchmark for underwater tracking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.665444Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:0ea80690e6570db7a848ff3fbd6a55e19588dfef3fd9bd20eab3dd80fb597611","observation_id":"cec7effd-60be-4200-b6dc-9b7c8dbd6b91","resolution":{"observed_at":"2026-08-09T14:32:36.665444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.671749Z","title":"Computer vision in aquaculture: a case study of juvenile fish counting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.671749Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:cc3cc8c7e5c3e95eb95fcfa4e789ddbfe520eb7aa36e6f0c7b67b855abbeb90f","observation_id":"9300b776-b3d7-44e9-b2dd-a602e9963a90","resolution":{"observed_at":"2026-08-09T14:32:36.671749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-09T14:32:36.674570Z","title":"Beit: Bert pre-training of image transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.674570Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:90d3311adf45014ecd1d4f0165e421a65cfc98b9d0aa83d672113c90545871aa","observation_id":"2e1c90a1-044f-462f-aa73-69aa84ba5dbb","resolution":{"observed_at":"2026-08-09T14:32:36.674570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.677852Z","title":"Deep learning for detection and counting of nephrops norvegicus from underwater videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.677852Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:324de65649d1c91a86b61f4487a9916a2d5ff187d6d5e183034ed7b8eeea2333","observation_id":"bfcd744d-174f-40b8-b0a2-0931af034881","resolution":{"observed_at":"2026-08-09T14:32:36.677852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.680909Z","title":"Semi-supervised visual tracking of marine animals using autonomous underwater vehicles,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.680909Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:9a920d1eb25e6b78270b0c71aa4516e27d7414458bfabed834ab1cde72c20633","observation_id":"59fd532a-a257-45db-bfb0-2094e82de18a","resolution":{"observed_at":"2026-08-09T14:32:36.680909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.683636Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.683636Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:0e7debf25fcde499cd2da2ec30bbd2ac5f713f154f3e074d46852063a5d27c5f","observation_id":"0b00b0e6-bfed-4e58-8d84-6149038bfb76","resolution":{"observed_at":"2026-08-09T14:32:36.683636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.686746Z","title":"Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.686746Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:d0d600b1351be5697a19d2acf952463de2fe45e5d62c30169060554334291c4e","observation_id":"348a7bb7-4057-4279-b001-1d827671b5c3","resolution":{"observed_at":"2026-08-09T14:32:36.686746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.689964Z","title":"You only look one-level feature,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.689964Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:8e675ceda639994eb8f21bfca9fc8c92614307fa1c3466049bf99a02078f6406","observation_id":"0991f7f5-7d7d-441e-a956-30e4d119329c","resolution":{"observed_at":"2026-08-09T14:32:36.689964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.692992Z","title":"A simple frame- work for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.692992Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:cfff3760894bddd4f8a9837ba8a099553638812d5f4f5597a799cdafff61759a","observation_id":"b9717a93-9b5d-4982-aa5e-e08f42101cf9","resolution":{"observed_at":"2026-08-09T14:32:36.692992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.696050Z","title":"Masked-attention mask transformer for universal image segmenta- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.696050Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:1f24424023d831cb8abe79f0632ffd9b0899af9b6d5c50aff7b98cf1f0a78288","observation_id":"71baa9a0-4529-4d42-87d1-5c54eec0666b","resolution":{"observed_at":"2026-08-09T14:32:36.696050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.699016Z","title":"Flow: A dataset and benchmark for floating waste detection in inland waters,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.699016Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:221fa27541538f27d36ffa2c5287013d865b44c2b87d838aff493e1056a4c639","observation_id":"3b12c543-ff46-4d4c-b085-253b247f6969","resolution":{"observed_at":"2026-08-09T14:32:36.699016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.701853Z","title":"Marine fouling images,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.701853Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:afa78fbb1cd066ddcc718ba9b061cd06e30d369a55f7664821c6892939dd0294","observation_id":"762cf6b8-571b-4312-bb0d-d0ba5db4837e","resolution":{"observed_at":"2026-08-09T14:32:36.701853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.704626Z","title":"Underwater image dehazing via unpaired image-to-image translation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.704626Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:3001aa79b273dfc4005fab822d705ed04e386a22007a1324c69d552c25475651","observation_id":"1a0e60f8-7863-401d-88f0-2ca8392e82ed","resolution":{"observed_at":"2026-08-09T14:32:36.704626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.707293Z","title":"Pdffigures 2.0: Mining figures from research papers,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.707293Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:25c29f944c140e903100debbb0a0587c518d22d73f47f7f744c5912be62c16cc","observation_id":"a5f7111a-94d9-4800-9833-27d3853d5c9d","resolution":{"observed_at":"2026-08-09T14:32:36.707293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.710254Z","title":"Class-balanced loss based on effective number of samples,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.710254Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:fb9a5a9654232d97f413503b14c105e94093f1b231e403a4bc99ebf96fe49947","observation_id":"40c137d1-aeae-431c-aa46-f1fa105d62a6","resolution":{"observed_at":"2026-08-09T14:32:36.710254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.713114Z","title":"Ocean acidification’s impact on marine ecosystems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.713114Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:60440a7dd4b1ecdc3afb933a4d74a699bacefd580b231ea4e20fc9ca610cd105","observation_id":"9a275941-10a9-4cbf-9abe-96618b519670","resolution":{"observed_at":"2026-08-09T14:32:36.713114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.715962Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.715962Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:a8de1057a031aab85e98cbca68f3ac7685f885e64d291919ed188016a79b6ef0","observation_id":"30c9fec3-b67a-4239-b902-4828e85cf336","resolution":{"observed_at":"2026-08-09T14:32:36.715962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.719199Z","title":"Aquagan: Restoration of underwater images,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.719199Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:62e94007d58b5a748953c2aa4b5167010bdd7949ac7c44f14a42f25951ac06ee","observation_id":"de822310-ede3-49d6-8d53-e416f2129c37","resolution":{"observed_at":"2026-08-09T14:32:36.719199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.721905Z","title":"Corals classification,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.721905Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:bf219d556ec7f9383e970dccab61f1c8220c71b3bb84a5c3911e499a634ab993","observation_id":"f20bf7a3-acd5-433d-b828-55399b798ec1","resolution":{"observed_at":"2026-08-09T14:32:36.721905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.724884Z","title":"The wonders of coral reefs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.724884Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:24237de87c1d977c0a7b5966929e2f6da5be8b11696b1e645f87784a72ef82e3","observation_id":"500d7e85-c7da-46fb-bccc-f460c10e8b74","resolution":{"observed_at":"2026-08-09T14:32:36.724884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.727626Z","title":"Climate change impacts on marine ecosystems,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.727626Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:39e7f39ebb80ebad6d4658042cf3d207da10d635e0c1dfc420821acb6621bdbb","observation_id":"3f73a9a1-ac4e-44d1-be7d-045cc08ede7e","resolution":{"observed_at":"2026-08-09T14:32:36.727626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T14:32:36.730768Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.730768Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:6eefeb86406b24ef2c5d32772ee69782b9fd3b83048ad53312a3480020b163cd","observation_id":"8c996df8-45d9-46c5-b76a-0ac86bcf5916","resolution":{"observed_at":"2026-08-09T14:32:36.730768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.733726Z","title":"Rebuilding marine life,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.733726Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:b7aebfca2fd7ba5b021a386d0b8107fc214f5f86c746b32b65a19400b41003c1","observation_id":"a9323ed7-0784-46cb-9bef-39d7f192137d","resolution":{"observed_at":"2026-08-09T14:32:36.733726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.737018Z","title":"The decline of australia’s great barrier reef,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.737018Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:4e44aaa03ba50ff321f3c176482ae5e5bc1b650268a8f08665c3442f03d13741","observation_id":"1c9a36e0-c379-42d4-96ea-341af39a75ad","resolution":{"observed_at":"2026-08-09T14:32:36.737018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.739889Z","title":"Instances as queries,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.739889Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:108145ab47692d83704a4e63fa177e07432da291b0d3602827ea68b6bdddc615","observation_id":"18c1a540-400a-457f-847b-478fbbd01ab3","resolution":{"observed_at":"2026-08-09T14:32:36.739889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.743121Z","title":"Tood: Task- aligned one-stage object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.743121Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:79f5ae270f7539b4018eca9d4a161fca0ff98c4be5f9fcf125c353401e848330","observation_id":"c2d21c43-58da-4424-b42d-51fcb3a19cc0","resolution":{"observed_at":"2026-08-09T14:32:36.743121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.745823Z","title":"Robotic detection of marine litter using deep visual detection models,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.745823Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:a8eb36a94bbeaaa9ba162ad08064ce0ed8b8c47d16e0b3a847d20928c05e84df","observation_id":"426c4690-d77e-4913-8bf5-66fa5cd2f9b7","resolution":{"observed_at":"2026-08-09T14:32:36.745823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12210","last_updated":"2023-06-28T14:15:22Z","snapshot_observed_at":"2026-08-09T08:10:39.086440Z","submitted_at":"2023-04-24T15:49:53Z","title":"A Cookbook of Self-Supervised Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12210","snapshot_observed_at":"2026-08-09T14:32:36.749163Z","title":"A cookbook of self-supervised learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.749163Z"},"links":{"cited_paper":"/paper/2304.12210","citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:3f4466d2f459ea1ce3192feb63ce0b9ff45fcd575124ef930b5a476328e28d87","observation_id":"fcf42488-f30a-418e-b20f-b05f7e3f435b","resolution":{"observed_at":"2026-08-09T14:32:36.749163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.753333Z","title":"A survey on underwater computer vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.753333Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:214bba5fd62624273f535a1e84a867cf8ffad87745f216ee27f351d3e2b991b9","observation_id":"56906724-5095-4515-97ee-a5e1c0b9833a","resolution":{"observed_at":"2026-08-09T14:32:36.753333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.756027Z","title":"The mpa guide: A framework to achieve global goals for the ocean,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.756027Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:b6a3a2cb709a04efa37ba3d08b5c1e855b27da5d99ee8c4c6b3c39e4e6a07746","observation_id":"64137cee-7599-4a0d-b3f9-7b11abdcfca3","resolution":{"observed_at":"2026-08-09T14:32:36.756027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.758696Z","title":"Coral species classification dataset,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.758696Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:7dbce2cdc3c0accdde0f538cb12661ae3843a1e1ed16242f0c350e7b3c91dead","observation_id":"90b4e61a-51b3-447e-b1f1-313bb1993b36","resolution":{"observed_at":"2026-08-09T14:32:36.758696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01931","last_updated":"2023-10-03T10:13:42Z","snapshot_observed_at":"2026-08-06T16:33:47.186709Z","submitted_at":"2023-10-03T10:13:42Z","title":"MarineDet: Towards Open-Marine Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01931","snapshot_observed_at":"2026-08-09T14:32:36.761385Z","title":"Marinedet: Towards open-marine object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.761385Z"},"links":{"cited_paper":"/paper/2310.01931","citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:1c72ffe705f79ddd331adfd4857ebccddcb315d8df1dd0a24f55f154dbfe2630","observation_id":"6bccf84c-7d08-4b99-8987-05a126d9f6ea","resolution":{"observed_at":"2026-08-09T14:32:36.761385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.764531Z","title":"A global map of human impact on marine ecosystems,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.764531Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:e282b4a09d31d20a5ed3070da638b8fd04b3f8e528a9c8fb5fb9d6ddc3b71dd1","observation_id":"316d164b-ad10-47d9-b40c-bed3483cfd47","resolution":{"observed_at":"2026-08-09T14:32:36.764531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.767425Z","title":"Umotma: Underwa- ter multiple object tracking with memory aggregation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.767425Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:7b6e2120e49c04babaf0cda7bf461ac03d351b5f9a0386b1ed397a2e71c26658","observation_id":"bf34b609-6bc7-48bf-9cf9-defb93dbcd7e","resolution":{"observed_at":"2026-08-09T14:32:36.767425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.770140Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.770140Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:073f4d107d0e0b71b9d22d36a9b08055ebbc78ced2e5db9481884e1e54c45528","observation_id":"ab414238-5b81-4b92-8d95-736c377fa729","resolution":{"observed_at":"2026-08-09T14:32:36.770140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08097","last_updated":"2020-07-16T04:19:06Z","snapshot_observed_at":"2026-07-06T09:38:41.713097Z","submitted_at":"2020-07-16T04:19:06Z","title":"TrashCan: A Semantically-Segmented Dataset towards Visual Detection of Marine Debris","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08097","snapshot_observed_at":"2026-08-09T14:32:36.773388Z","title":"Trashcan: A semantically- segmented dataset towards visual detection of marine debris,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.773388Z"},"links":{"cited_paper":"/paper/2007.08097","citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:b368d91799c3bf7fef7eba40fef3312f0579d4febea7fb970447d493e9ec7bdc","observation_id":"3d3b705d-0061-4f7d-b812-571a752517ca","resolution":{"observed_at":"2026-08-09T14:32:36.773388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.776525Z","title":"Usod10k: A new benchmark dataset for underwater salient object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.776525Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:fd1564da5e5ad1f25118b2259c471cf84d953c60225903187cbb7cf804862215","observation_id":"3c9bbe8f-f382-452d-a73a-13757db85ea2","resolution":{"observed_at":"2026-08-09T14:32:36.776525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.779115Z","title":"Underwater image restoration based on convolutional neural network,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.779115Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:428383c4184ff4dc8ce2c81aa959909363508f23a8704fcc1d59779f026ef582","observation_id":"c6671dfa-2c0e-4c4c-a11b-f2388cceea81","resolution":{"observed_at":"2026-08-09T14:32:36.779115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.782150Z","title":"Contrastive semi- supervised learning for underwater image restoration via reliable bank,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.782150Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:5a234cf92ac6386af7c79646754d342d2cafd9a4589d2a21ffbd13dc4cec92c2","observation_id":"03dd49a2-4348-491a-8aa9-0b077ea42aab","resolution":{"observed_at":"2026-08-09T14:32:36.782150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.784940Z","title":"Semantic Segmentation of Underwater Imagery: Dataset and Benchmark,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.784940Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:c90d3582c9357f9f28cad516cd9d48e7a85946d7537cf9ca0a60369ced6d11c0","observation_id":"8f5e206a-6f99-42a6-9991-53923eb3721f","resolution":{"observed_at":"2026-08-09T14:32:36.784940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.787653Z","title":"Fast underwater image enhance- ment for improved visual perception,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.787653Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:794d1e5111ae0a0cfdcb252a5d98270b364a11e1748ac4cedb0e08dd4dece9e9","observation_id":"ccc5361a-80ca-4607-8f2c-59374c7800f5","resolution":{"observed_at":"2026-08-09T14:32:36.787653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.790223Z","title":"Svam: Saliency-guided visual attention modeling by autonomous underwater robots,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.790223Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:2df5021679787143cc06351b84e08e1e964206de3dd714837826b39cad7c081d","observation_id":"911a9ecc-ba17-49e3-afc6-69e9564a74f5","resolution":{"observed_at":"2026-08-09T14:32:36.790223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.792974Z","title":"Fish detection and species classification in underwater environments using deep learning with temporal information,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.792974Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:63c6e1a2f4facab5b1ca2a9ff3f196a788c1aa15987f2b1f7875d8b76c3e16aa","observation_id":"9bce04d4-14b0-42fe-b087-e1923fbc736c","resolution":{"observed_at":"2026-08-09T14:32:36.792974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.796011Z","title":"The effects of fishing on marine ecosystems,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.796011Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:9713b516a0a3aff1d83147d8e7b365d7799861e0e54b9bad97e0eb6443c67f73","observation_id":"1daeb3c8-5e51-4117-b49d-db6c4ef07798","resolution":{"observed_at":"2026-08-09T14:32:36.796011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.798523Z","title":"FathomNet: A global image database for enabling artificial intelligence in the ocean,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.798523Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:d6f66ccb1149c888596633ce7fc1b06786bfe4dea17a2bc719680645b69fd26d","observation_id":"d46d7758-5dd3-4068-84fd-193522080267","resolution":{"observed_at":"2026-08-09T14:32:36.798523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09178","last_updated":"2021-06-16T23:53:18Z","snapshot_observed_at":"2026-08-04T06:57:44.202338Z","submitted_at":"2021-06-16T23:53:18Z","title":"The Fishnet Open Images Database: A Dataset for Fish Detection and Fine-Grained Categorization in Fisheries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09178","snapshot_observed_at":"2026-08-09T14:32:36.801409Z","title":"The fishnet open images database: A dataset for fish detection and fine-grained categorization in fisheries,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.801409Z"},"links":{"cited_paper":"/paper/2106.09178","citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:1d763e092a8353848cdf01ccf29baf296a4fef503b0a50477e87e0f53efe83f9","observation_id":"4a06a3c6-98bc-4e48-82c7-0cbeaf5f4520","resolution":{"observed_at":"2026-08-09T14:32:36.801409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.804496Z","title":"Mask transfiner for high-quality instance segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.804496Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:aab0f563d3effb605724dc0740a1f4a376061d620d22102d9b469439138297d2","observation_id":"b031326b-93e4-4d64-95f4-54c7ca229f19","resolution":{"observed_at":"2026-08-09T14:32:36.804496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.807399Z","title":"Fishnet: A large- scale dataset and benchmark for fish recognition, detection, and func- tional trait prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.807399Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:545795102f6d10f27bc5bc04c9fcf5aaf6af75946158cf67a3c22b3bed07c762","observation_id":"e06573d6-d230-40f7-aa23-3b897fd40d43","resolution":{"observed_at":"2026-08-09T14:32:36.807399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.810526Z","title":"Maple: Multi-modal prompt learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.810526Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:0c46f613a179ba04ee51374889e895751af340a4cd5e902a4fedb7656f5c9675","observation_id":"208094de-2ee8-4c8b-8ba8-3e7b0b5f4a67","resolution":{"observed_at":"2026-08-09T14:32:36.810526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.813221Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.813221Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:f867ef4dc263d815b7c26d9325bd285eea39ca9c88af7f32f2cecd14c4204e74","observation_id":"3e16c40a-51be-44c6-b797-604099439eae","resolution":{"observed_at":"2026-08-09T14:32:36.813221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.815838Z","title":"Pointrend: Image segmentation as rendering,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.815838Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:7a1e15f4dd48a58108e0c186ab771dc09bd38837a18aafca07819e6ad55a4378","observation_id":"33eaf291-67a2-441d-afaa-bb022cd47266","resolution":{"observed_at":"2026-08-09T14:32:36.815838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.819028Z","title":"Detection and tracking of underwater fish using the fair multi-object tracking model: A comparative analysis 28 of yolov5s and dla-34 backbone models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.819028Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:eb858e11e870ab990a01f94d739ad4554b324266ab1f4051bb194e05cd9ab8e1","observation_id":"4590d7d0-9482-4cec-8924-c946925a1efe","resolution":{"observed_at":"2026-08-09T14:32:36.819028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.821852Z","title":"Watergan: Unsupervised generative network to enable real-time color correction of monocular underwater images,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.821852Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:c9789eca5c15d2f9757294a58cb681eb4066fec9c6063bfdf2429566767406d5","observation_id":"0dd826fd-eef8-4196-b5e1-c284d5881ce4","resolution":{"observed_at":"2026-08-09T14:32:36.821852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.824430Z","title":"Deep learning for visual recognition and detection of aquatic animals: A review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.824430Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:0ca4ee737e519bbf6bf354c50b26caeed5ce3624b4091c6be6fc2ac127634c5c","observation_id":"a9709e53-7887-4d09-b06f-088c6e232839","resolution":{"observed_at":"2026-08-09T14:32:36.824430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.827013Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.827013Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:67817f3b329615d325d9b09b7d1742db0c74cb712993be1c0f0e23318571db92","observation_id":"73459cd0-2871-4342-b7f5-17a21c1029e8","resolution":{"observed_at":"2026-08-09T14:32:36.827013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.829761Z","title":"Citetracker: Correlating image and text for visual tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.829761Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:2341c5c3d731b33af8358d42bc1aa3824622465c246110fd7f02a8d638231737","observation_id":"28464894-6440-4b66-ba4b-6d739362e442","resolution":{"observed_at":"2026-08-09T14:32:36.829761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05208","last_updated":"2022-03-14T08:53:07Z","snapshot_observed_at":"2026-08-07T07:07:45.501871Z","submitted_at":"2021-10-11T12:17:32Z","title":"Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05208","snapshot_observed_at":"2026-08-09T14:32:36.832435Z","title":"Supervision exists everywhere: A data efficient contrastive language- image pre-training paradigm,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.832435Z"},"links":{"cited_paper":"/paper/2110.05208","citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:844fd89f475586b9259250ee09a769a28598d962a493fbba5e4187ce0052b920","observation_id":"1af0c70c-95e4-4bc5-ae4f-476ff02b4339","resolution":{"observed_at":"2026-08-09T14:32:36.832435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.835426Z","title":"Underwater object tracker: Uostrack for marine organism grasping of underwater vehicles,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.835426Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:7a49a8dec7208428731ac6f233ba76d3f0490b83aba9aaf3f604d0581d3291d8","observation_id":"d2eba434-bde2-4ebd-916a-022a565d7df7","resolution":{"observed_at":"2026-08-09T14:32:36.835426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.837946Z","title":"Watermask: Instance segmentation for underwater imagery,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.837946Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:a9d8bdfd8f6176d6ca654571cee8c6e93875493f4926e27e9a98abc6baf34c53","observation_id":"f0f2188d-ac82-419c-b871-b5adb2d117e5","resolution":{"observed_at":"2026-08-09T14:32:36.837946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.840987Z","title":"An end-to-end transformer model for crowd localization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.840987Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:668828c95735aad038eae2ceb61169e051604baade7edc62cc6c2563adb11f67","observation_id":"c4a48a4b-95c6-419c-9c52-1d2d897fd228","resolution":{"observed_at":"2026-08-09T14:32:36.840987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.843537Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.843537Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:e51444f9c68b2721bfee174daaeb63dac75c5c4acf6b0e3fb19a4c017e16e82e","observation_id":"1a87815a-f789-40f2-96dc-9a69d893d544","resolution":{"observed_at":"2026-08-09T14:32:36.843537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.846217Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.846217Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:a20070beedee2a2be18aff895183fa0e783bccb2c16f8709a67e6e86e2d79bfa","observation_id":"19a79aa2-3491-40b8-bd43-a8a2826cd236","resolution":{"observed_at":"2026-08-09T14:32:36.846217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:38.090243Z","title":"A new dataset, poisson gan and aquanet for underwater object grabbing,","venue":null,"work_id":"67f250c6-f2eb-41e2-a626-9ed295ca6556","year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.848549Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:5ca3d5022ab4522031726b3f42b938e7ba5fdce90c8c88f693e175d92d264dd3","observation_id":"7723e8b4-d64e-4a59-9944-8b999e9e2755","resolution":{"observed_at":"2026-08-09T14:32:38.093642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:38.081984Z","title":"Cffi-vit: Enhanced vision transformer for the accurate classification of fish feeding intensity in aquaculture,","venue":null,"work_id":"475ce6a4-d460-47d8-b40a-001a88c1d7be","year":2024},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.850991Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:092084b209dbc1dd24195551d375323c6547ba471a830cceaaf5334ba92e5239","observation_id":"7acd1826-3099-4266-86c2-f367c95665c5","resolution":{"observed_at":"2026-08-09T14:32:38.084785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:38.074343Z","title":"Dp-fishnet: Dual-path pyramid vision transformer-based underwater fish detection network,","venue":null,"work_id":"ab6d5ef2-56a8-4878-b181-0d88755f6965","year":2024},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.853552Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:3dff97d5fa32196fa15428fbe4eba3369909e3ba91b733b7285e285189b1f454","observation_id":"6bcf1e9c-644e-493f-81a6-b56f53836847","resolution":{"observed_at":"2026-08-09T14:32:38.077140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.856470Z","title":"A convnet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.856470Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:149e1d81a3182bc5cf31f7f817c38d8479d2fb516d0a7cbfbb6058edfbd866db","observation_id":"ca511ec4-e457-4f88-9d7a-789a3aedf3ae","resolution":{"observed_at":"2026-08-09T14:32:36.856470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-09T14:32:36.858811Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.858811Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:107ae6268944a18799ba04749b751339fe30e940e2d6ff92a33816861dd6373f","observation_id":"acd1329e-dddb-4ea0-aa59-f6279af9f167","resolution":{"observed_at":"2026-08-09T14:32:36.858811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:38.061716Z","title":"Multi-scale adversarial network for underwater image restoration,","venue":null,"work_id":"4b622769-41f2-49be-be56-3de2e34f066b","year":2019},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.861944Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:44576897932b3fb49a746a1b1b52e52a96a80bc0dfa27f5427cb31534e294a1c","observation_id":"069660ee-76e8-4e92-afab-4079bd8575b7","resolution":{"observed_at":"2026-08-09T14:32:38.064575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:38.053997Z","title":"Enhancing clip with gpt-4: Harnessing visual de- scriptions as prompts,","venue":null,"work_id":"86c1900d-e034-4b97-8793-efd650fefbcd","year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.864764Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:02b0adce5e25ca910088be6c9a6997fe9236a42ff881718d6a779c5f4929b5e6","observation_id":"51d646f3-3c80-4d0c-a80a-21494bf11e9d","resolution":{"observed_at":"2026-08-09T14:32:38.056746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:38.044988Z","title":"Australasian freshwater fish faunas: diversity, interrela- tionships, radiations and conservation,","venue":null,"work_id":"fb8a6ceb-6a2e-4eaf-948f-2b8ba3048c4d","year":2006},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.867519Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:428719fb9052d55b9445fa49b9b8abfee473f9bad1c8c0bdb3317a1eae14a55b","observation_id":"b04fd5dc-3c7c-4844-a807-10f71e41747e","resolution":{"observed_at":"2026-08-09T14:32:38.048317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:38.036052Z","title":"The rich biodiversity of ocean ecosystems,","venue":null,"work_id":"0992a5b3-eda7-45b4-8c8c-03c047bf5bb5","year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.870239Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:c6328fe911e5f61609a3fa0373c59a14e979561d78577054ea3c9851e27718b8","observation_id":"4796e597-07a3-4eef-8652-e6fc2eacf5a7","resolution":{"observed_at":"2026-08-09T14:32:38.039272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:38.026522Z","title":"Coral identification and counting with an autonomous underwater vehicle,","venue":null,"work_id":"973adfab-b0a5-4e30-9880-2e7a8643481d","year":2018},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.873073Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:79ea92bf655dc998826badd78d0722dc808b0c6af72d80c6b6f73a5726e68bb3","observation_id":"33ac7f0a-4366-473a-8b13-52a3a1997867","resolution":{"observed_at":"2026-08-09T14:32:38.030196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:38.017466Z","title":"Innovative approaches to coral conservation,","venue":null,"work_id":"36d8beb9-6771-4127-8364-15267c91ca7c","year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.875777Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:80a22548cfa2cb6947d74b689dd9c12c0ecfff265c75d957ccfe47bd00f4d147","observation_id":"3b6459ab-5ff4-4b4a-8fd5-fb4df344f9ea","resolution":{"observed_at":"2026-08-09T14:32:38.020750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.878540Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.878540Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:df49299e9087adf6a98aa20cc8c74b8f17b531d182f435aee34f4b60a30ccbc0","observation_id":"e932bc13-e4fd-4df5-8bfc-7260d0bddea8","resolution":{"observed_at":"2026-08-09T14:32:36.878540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:38.003455Z","title":"I2mvformer: Large language model generated multi-view document supervision for zero-shot image clas- sification,","venue":null,"work_id":"22031d42-34be-46ad-a4ac-13b08b9df828","year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.881512Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:c2dc4fd93340869ba2b035884492c3b1d7e22c68b52c30633f6dbe8b7fcbf14c","observation_id":"880b1daf-c74c-43d9-b6c6-5a159c22f79a","resolution":{"observed_at":"2026-08-09T14:32:38.006804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:37.994686Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":"50eddd17-3589-4bb0-af97-d1d36b69fb7d","year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.884725Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:b5b447fbba0bd4d3a47bec62365d8a5bcd3ba31fb4f0e6bfc3c0c0f4dd9385d3","observation_id":"7b9ef932-39d9-4c42-b4f1-ce53034e8268","resolution":{"observed_at":"2026-08-09T14:32:37.997871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:37.986181Z","title":"Comprehensive underwater object tracking benchmark dataset and underwater image enhancement with gan,","venue":null,"work_id":"10b97940-d1f7-4c3e-8203-6f71c719dc65","year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.887504Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:34660f34b6c32e01cc8497620a36868fc84f55d0c859fb6ef4b9143703338c1a","observation_id":"9b5108d4-f5ba-40b2-91c2-12858626e74a","resolution":{"observed_at":"2026-08-09T14:32:37.989347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:37.976411Z","title":"Detection of marine animals in a new underwater dataset with varying visibility,","venue":null,"work_id":"4b73fadd-0549-41c7-bfda-479bec993999","year":2019},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.890340Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:13e0d19da9115125f330c747dbbe60b2d6a262e3023368ffb3a6e2c5b7a2dea6","observation_id":"7422b08a-c12e-4521-991a-55f6ad7018cc","resolution":{"observed_at":"2026-08-09T14:32:37.979823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:37.967279Z","title":"U-shape transformer for underwater image enhancement,","venue":null,"work_id":"b26c7ab5-36c7-4d1b-8405-c3605832616d","year":2023},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.893275Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:a8f05f4cb9980153309c22cf5b7dc8797667eef146c44d24e169ac671026c1f0","observation_id":"49d56bc5-c136-481f-8bcd-511227916225","resolution":{"observed_at":"2026-08-09T14:32:37.970732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:37.958000Z","title":"Detecting and recognizing marine animals using advanced deep learning models,","venue":null,"work_id":"cdcf35f6-dd95-4432-a7b9-35a590229b33","year":2024},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.895935Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:bc9087f36c9cceb94eae15c0a0148541b0d9653dee1dd507b0be27ae96e8a3c4","observation_id":"69fe3a9a-a28d-4d8b-bcc0-4ddb767773cf","resolution":{"observed_at":"2026-08-09T14:32:37.961600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.898402Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.898402Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:38f7a5e5f90b62f0e615cb030cb42ccbed9ea1018e76d26279d904ec8f556766","observation_id":"6a27b01f-f93c-49ed-bc56-1dab46adf87e","resolution":{"observed_at":"2026-08-09T14:32:36.898402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.901178Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.901178Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:7248b2348303da7562cfa950b713a4b54c29989e4d6bfb95db1c2424dcee4465","observation_id":"90e98c48-440b-4ba3-9e18-60c09a5ef48b","resolution":{"observed_at":"2026-08-09T14:32:36.901178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.903871Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.903871Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:dc4b9bd47bec9c392971cf894d80ec9cdfe027dca4f158ae2acf586c5655b9e1","observation_id":"5b3c42de-8b8f-4b57-95b4-8fa6b4b82b2b","resolution":{"observed_at":"2026-08-09T14:32:36.903871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:37.933553Z","title":"A realistic fish-habitat dataset to evaluate algorithms for underwater visual analysis,","venue":null,"work_id":"8b0a29a7-9e43-4a24-b21c-4cb260c4f8cb","year":2020},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.906899Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:d0628d17dc1dbcf6458d2bc999bf62a3add4b4171fe7ba65bcdd4fcd75433727","observation_id":"a51dc73d-938a-41d6-9c5e-f8e34eb545cd","resolution":{"observed_at":"2026-08-09T14:32:37.937123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05390","last_updated":"2025-02-26T04:28:37Z","snapshot_observed_at":"2026-08-08T17:59:58.996439Z","submitted_at":"2022-06-11T01:20:48Z","title":"Overcoming Annotation Bottlenecks in Underwater Fish Segmentation: A Robust Self-Supervised Learning Approach","version":2},"cited_work":{"arxiv_id":"2206.05390","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.05390","snapshot_observed_at":"2026-08-09T14:32:37.289205Z","title":"Overcoming Annotation Bottlenecks in Underwater Fish Segmentation: A Robust Self-Supervised Learning Approach","venue":"cs.CV","work_id":"8bf03dfa-d269-468e-9cec-534429d688b9","year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.909779Z"},"links":{"cited_paper":"/paper/2206.05390","citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:26a68df06fb8c500996a00551d58027464cd310c325c9b5a66542afdf314eced","observation_id":"bf59f670-0f08-411c-aaff-d07bae9af006","resolution":{"observed_at":"2026-08-09T14:32:37.293130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:37.924794Z","title":"Computer vision and deep learning for fish classification in underwater habitats: A survey,","venue":null,"work_id":"54bd84b1-7acc-49e1-806e-2c0709ff0df8","year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.913016Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:c6792df2b50f694c1790484a97d3193f78ea3cb3e5eaf5dc725ce472fe7bac34","observation_id":"207e0873-07df-4895-bb9d-5c84d536270f","resolution":{"observed_at":"2026-08-09T14:32:37.927506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:32:36.915707Z","title":"Nlx-gpt: A model for natural language explanations in vision and vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-09T14:32:36.915707Z"},"links":{"citing_paper":"/paper/2502.01785"},"observation_digest":"sha256:ffc855530c96d7fd38cf6bc7bb903ec75951e8b230d041e9134420b4a478a7d3","observation_id":"025d8646-f340-4a52-8d95-994acbff08a1","resolution":{"observed_at":"2026-08-09T14:32:36.915707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01785","last_updated":"2025-02-03T19:56:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:27:02.856064Z","submitted_at":"2025-02-03T19:56:16Z","title":"AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":4,"unresolved":78,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":146},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 146 outbound references and 3 inbound Pith citation observations for arXiv:2502.01785."}