{"as_of":"2026-08-14T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05ed06153e5d0fab994b3c7ec43b01969ffd8346e53542563f71240c7e5baca6","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:29:26.022916Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.10575/citation-record","integrity":"/paper/2506.10575/integrity","json":"/paper/2506.10575/citation-record.json","paper":"/paper/2506.10575"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:33.731807Z","title":"Flamingo: a visual language model for few- shot learning.Advances in Neural Information Processing Systems, 35:23716–23736, 2022","venue":null,"work_id":"d9325859-7a20-4160-af23-fd3afe851a2a","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:20.912833Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:0ea535f00ffbe57328294d853af848c83ba1d0a251a87116944bd219cd74816f","observation_id":"24aece88-8079-4a30-ba7c-32df2a373b82","resolution":{"observed_at":"2026-08-07T04:29:33.806086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:33.592564Z","title":"Laso: Label-set operations networks for multi-label few-shot learning","venue":null,"work_id":"2f0b53b3-0d77-4b4f-966c-eee8a963fba0","year":2019},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:20.985698Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:6bd0902578f5e65f0e109a700e393de00e9538ac341b4618f37a36adc6cd90aa","observation_id":"1552687b-5962-46d6-aecc-2cb2e60d956b","resolution":{"observed_at":"2026-08-07T04:29:33.647913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:33.446468Z","title":"Structured semantic transfer for multi-label recognition with partial labels","venue":null,"work_id":"e3bec574-5dfc-4156-aa91-457637a9b7ba","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.065735Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:f84149432dcf715bed70e886db76a5f2f83f1b7f88bc1a71391e17edbd88e38f","observation_id":"5efae362-3a40-4e91-b222-daec85b6a6d3","resolution":{"observed_at":"2026-08-07T04:29:33.518040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:33.194849Z","title":"Recurrent attentional reinforcement learning for multi-label image recognition","venue":null,"work_id":"f38f7a0b-230b-4432-a854-b7f7a2a2d4fe","year":2018},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.140117Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:a576ae9716ab93365613f37a06098567bb8bf5cb646853785f3e748f5c51966d","observation_id":"a6051b62-25ce-4961-a61e-9d26f9b257e2","resolution":{"observed_at":"2026-08-07T04:29:33.309046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:32.935915Z","title":"Learning semantic-specific graph representation for multi-label image recognition","venue":null,"work_id":"e4203bfa-e044-4d2d-91c8-b49e0fc787b1","year":2019},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.302799Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:4b6215df313ecd6cd33b331cdc49f3069bfa35710bd68cfd678adc1b3decfafd","observation_id":"048f16a2-88e9-4802-8a94-4b8d63e5d365","resolution":{"observed_at":"2026-08-07T04:29:33.067742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:32.661385Z","title":"Multi- label image recognition with graph convolutional networks","venue":null,"work_id":"8011913c-95e8-4c17-a150-bac7830f8214","year":2019},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.394607Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:2066786700f60306e3db63540dea59b7ee0c3d94d2aba4c81a4b0d12616dcb3d","observation_id":"39eed48b-0cdf-4cb1-824d-24101b2bda98","resolution":{"observed_at":"2026-08-07T04:29:32.749727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:21.467483Z","title":"Stargan v2: Diverse image synthesis for multiple domains","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.467483Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:4672981abce1b380ec2014297e4479b4017f56b31848addb0b9c172b823aac43","observation_id":"235e497b-5f42-4b70-a15f-61e19b4031f5","resolution":{"observed_at":"2026-08-07T04:29:21.467483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:32.335862Z","title":"Nus-wide: a real-world web image database from national university of singapore","venue":null,"work_id":"78c3e094-dcc6-426d-99af-36500038c481","year":2009},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.545489Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:21e79b1bc1343f668391039f908e44436a69deba78e401d4f4f035bbccd56f4f","observation_id":"5945c96b-80b9-4135-8f0b-7f51c38f2fa0","resolution":{"observed_at":"2026-08-07T04:29:32.482326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02390","last_updated":"2023-08-20T13:08:34Z","snapshot_observed_at":"2026-08-14T10:35:01.978550Z","submitted_at":"2022-10-05T17:05:56Z","title":"Bayesian Prompt Learning for Image-Language Model Generalization","version":3},"cited_work":{"arxiv_id":"2210.02390","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.02390","snapshot_observed_at":"2026-08-07T04:29:27.454953Z","title":"Bayesian Prompt Learning for Image-Language Model Generalization","venue":"cs.CV","work_id":"af65bf33-0c9c-460d-8f31-b89a71c0445f","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.628262Z"},"links":{"cited_paper":"/paper/2210.02390","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:86dfe4ec7c9bc37392f54e2c3adabef822e644d5bf26d3425a556fa6501a9a68","observation_id":"e41dbda1-01c0-46d6-9b8d-a374b62d3df8","resolution":{"observed_at":"2026-08-07T04:29:27.519841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:32.177234Z","title":"Learning a deep convnet for multi-label classification with partial labels","venue":null,"work_id":"1eb4c916-d320-42f4-ab39-53a39c595f78","year":2019},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.708820Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:2572ad7c7d81b9bf52978d9bc534509c9d173a3851fb5c2197a4211166624ecc","observation_id":"422915f3-7be1-4344-8f8b-0645292626ed","resolution":{"observed_at":"2026-08-07T04:29:32.223302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:32.045732Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"633b69b6-4e0d-4515-8040-4437ad0e231e","year":2010},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.758256Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:6a943622bbf2d8b243830f367095f805fe20c5ac321b24d0b0a1b52f93d58bc4","observation_id":"1dea58b2-387b-4247-b1cb-07baa7981e5a","resolution":{"observed_at":"2026-08-07T04:29:32.110623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:31.921836Z","title":"Learning federated visual prompt in null space for mri reconstruction","venue":null,"work_id":"27b63fa5-cf80-481d-ae2c-1c1cf879d02d","year":2023},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.841049Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:443574bd84b5ac30043514990f9911e40a165b674264a24bb39e24ba8485e3c5","observation_id":"df16fc1f-6483-4425-bf26-883dbb59b702","resolution":{"observed_at":"2026-08-07T04:29:31.979476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:31.738302Z","title":"Diverse data augmentation with diffusions for effective test-time prompt tuning","venue":null,"work_id":"011b2144-533f-42bf-843f-7f87a878f117","year":2023},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.916666Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:c2d8051476c7f7578adba21bbcb0b3e0ba218b51018493f53e0948c816b9e810","observation_id":"c93a5f1e-5710-4697-bdcc-ae4a8987fc02","resolution":{"observed_at":"2026-08-07T04:29:31.848906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.4894","last_updated":"2014-04-14T19:21:13Z","snapshot_observed_at":"2026-07-06T03:31:09.551860Z","submitted_at":"2013-12-17T19:00:50Z","title":"Deep Convolutional Ranking for Multilabel Image Annotation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.4894","snapshot_observed_at":"2026-08-07T04:29:22.002407Z","title":"Deep convolutional ranking for multilabel image annotation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.002407Z"},"links":{"cited_paper":"/paper/1312.4894","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:7a1e9e7973771f809251a87581dcd58210612e1c8f59b0a0924fc3d2d6b17edb","observation_id":"1cc7885b-241b-46f2-bae0-8af644ddc3e6","resolution":{"observed_at":"2026-08-07T04:29:22.002407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:31.613613Z","title":"Gener- ative adversarial networks.Communications of the ACM, 63(11):139–144, 2020","venue":null,"work_id":"1ffe3757-ef81-4fa7-830c-023514345c0f","year":2020},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.076053Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:27ecdd73a69b0bbb0307704e4ce4a51f140d6e674795323514c2be954c5641eb","observation_id":"925ea13d-e7ed-4268-9490-fc6d23eebb5b","resolution":{"observed_at":"2026-08-07T04:29:31.670788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09778","last_updated":"2023-08-18T23:43:42Z","snapshot_observed_at":"2026-08-13T13:40:10.478545Z","submitted_at":"2022-11-17T18:52:19Z","title":"I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision","version":4},"cited_work":{"arxiv_id":"2211.09778","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.09778","snapshot_observed_at":"2026-08-07T04:29:27.180364Z","title":"I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision","venue":"cs.CV","work_id":"c0fbfda9-5656-4639-93b3-bc12a8abaf3c","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.172146Z"},"links":{"cited_paper":"/paper/2211.09778","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:0d0938fc204cc749b5f3e7feb1aec8ff3edc69b87de9832b6e843ef635d96d5f","observation_id":"a135c362-b34c-441a-b0e1-d298e75e8688","resolution":{"observed_at":"2026-08-07T04:29:27.334748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12739","last_updated":"2022-12-20T05:45:27Z","snapshot_observed_at":"2026-08-13T13:36:55.594288Z","submitted_at":"2022-11-23T07:00:11Z","title":"Texts as Images in Prompt Tuning for Multi-Label Image Recognition","version":2},"cited_work":{"arxiv_id":"2211.12739","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.12739","snapshot_observed_at":"2026-08-07T04:29:26.971212Z","title":"Texts as Images in Prompt Tuning for Multi-Label Image Recognition","venue":"cs.CV","work_id":"1aaa8d3c-bc51-4613-aa37-b0c5096b813a","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.246265Z"},"links":{"cited_paper":"/paper/2211.12739","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:737acabe213068af69bd9cb67844647c0e9f2bafbb79bb57d5b4a9b9e0e84e80","observation_id":"43de6bae-3c0d-4fa4-8064-fc9267afba04","resolution":{"observed_at":"2026-08-07T04:29:27.005782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-07T04:29:22.304194Z","title":"Imagen video: High definition video generation with diffusion models.arXiv preprint arXiv:2210.02303, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.304194Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:0494ed54e30ea2637352de982d67b0a7587107c1626f24c38fa020caa9542fc1","observation_id":"54d438c6-cdf6-4d65-82f8-29d6c4fc8afe","resolution":{"observed_at":"2026-08-07T04:29:22.304194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01598","last_updated":"2024-12-04T07:36:46Z","snapshot_observed_at":"2026-08-13T04:49:43.768081Z","submitted_at":"2024-01-03T07:59:17Z","title":"Learning Prompt with Distribution-Based Feature Replay for Few-Shot Class-Incremental Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01598","snapshot_observed_at":"2026-08-07T04:29:22.377613Z","title":"Learning prompt with distribution-based feature replay for few-shot class-incremental learning.arXiv preprint arXiv:2401.01598, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.377613Z"},"links":{"cited_paper":"/paper/2401.01598","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:b8ca15bce390c6a2b01badb2d3b28708c29bc1cf7802b19971e8336e6e8ef36f","observation_id":"cac53a72-af1a-4bcd-8974-9ffe1b0e1fef","resolution":{"observed_at":"2026-08-07T04:29:22.377613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:31.436062Z","title":"Class concept rep- resentation from contextual texts for training-free multi-label recognition","venue":null,"work_id":"8904807b-226e-4a19-8f3b-eb1a47eb1294","year":2024},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.437023Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:4f522ab2ae6916489d65d2b729afcfdc9b65cf2bbe60fbbcc21618c185b05d54","observation_id":"759e43e3-18a9-41aa-9f15-c2db223297a5","resolution":{"observed_at":"2026-08-07T04:29:31.536598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:31.166473Z","title":"Enhancing clip conceptual embedding through knowl- edge distillation, 2024","venue":null,"work_id":"55c0545e-dbe6-4f07-95fd-5da5f3c87e6c","year":2024},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.529549Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:b6b82c9ee46aa50b9fe5ba70952220c23e5cca40485d504557272c8aff082231","observation_id":"151bea06-1562-4acc-b5f9-115f8abc2da4","resolution":{"observed_at":"2026-08-07T04:29:31.301209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T04:29:22.608769Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.608769Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:11ec723e0e145dcc2a7faeb20b2e58c63b853c7be5e449e47748deb9ec71a84b","observation_id":"99c04b5b-f88f-4d51-95c0-fcaf71f40039","resolution":{"observed_at":"2026-08-07T04:29:22.608769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T04:29:22.693267Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.693267Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:7339b2fab932f91790ec8b0538806047805ad94bb2e5e5c71f8c214c6d073a2f","observation_id":"52dbb060-3b2b-477f-a02b-be5cbc2d169c","resolution":{"observed_at":"2026-08-07T04:29:22.693267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:30.957609Z","title":"Openimages: A public dataset for large-scale multi-label and multi-class image classification.Dataset available from https://github","venue":null,"work_id":"94ecdd9f-f25c-481a-8204-10d32f1d49af","year":2017},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.787514Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:10a184f75c0f26b8efaa0f8eb210d3f5784cdc22b4203f354054db2fed7f194f","observation_id":"d2f91786-85d5-485a-b6e4-ee057a6ffe95","resolution":{"observed_at":"2026-08-07T04:29:30.991687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:22.866684Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.866684Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:cb45ec5cb1f8c8fb8ebf4601b9440040fcc8085408dfb0ae12b8d7b7ccbb3dc8","observation_id":"9325cba4-ff10-48d2-a049-c1ef4caf4611","resolution":{"observed_at":"2026-08-07T04:29:22.866684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:22.937312Z","title":"Compositional visual generation with composable diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.937312Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:0a6a87ccf4458a48f51d02408cd517b8f67eea8ceab25303258787b0b5d474dc","observation_id":"8f654f19-4017-4f3f-9870-981ca8d86a5f","resolution":{"observed_at":"2026-08-07T04:29:22.937312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:30.761028Z","title":"Multi-label image classification via knowledge distillation from weakly-supervised detection","venue":null,"work_id":"6e2b1f37-e0f6-4fd1-b8d4-68e27342b81e","year":2018},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.992006Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:5e8755ae16085455fc048f7636f97867fc3ecb3eaa9a2246ed035d027782b7f3","observation_id":"174fc98a-68c0-4902-95e4-34ca7f7c42b2","resolution":{"observed_at":"2026-08-07T04:29:30.851628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T04:29:23.154171Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.154171Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:1510f61d6f272755f37cbc28fc67f57053d998df387e02fda7f971f16181f431","observation_id":"940ac585-f768-4090-b721-ff3dd2c0cd50","resolution":{"observed_at":"2026-08-07T04:29:23.154171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-08-13T05:43:28.614772Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-07T04:29:23.300405Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models.arXiv preprint arXiv:2302.08453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.300405Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:32fff4e7cc083a62b5d52e082ec5c30f80b19258a3703ad32f3754bb6d43044a","observation_id":"60b3b8b3-01c9-4ce7-8665-67607d9997c3","resolution":{"observed_at":"2026-08-07T04:29:23.300405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:30.553439Z","title":"Discriminative region-based multi- label zero-shot learning","venue":null,"work_id":"2a39eb02-edfb-42d9-8a6b-eecd55d13132","year":2021},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.497066Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:2192ee5b193691767c6631f8281ecbf52105096f1191c47941cff599a1d1ed25","observation_id":"e145ff17-4e59-44aa-8190-0fecda34f588","resolution":{"observed_at":"2026-08-07T04:29:30.640677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-07T04:29:23.648601Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.648601Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:7646b8ec16004cafde147867fa3c3e9902081488e840c996f9318530f1cbed29","observation_id":"4bd800af-6817-439b-aa85-83e068109af3","resolution":{"observed_at":"2026-08-07T04:29:23.648601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00575","last_updated":"2022-11-01T16:36:01Z","snapshot_observed_at":"2026-08-13T13:52:07.502933Z","submitted_at":"2022-11-01T16:36:01Z","title":"Text-Only Training for Image Captioning using Noise-Injected CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00575","snapshot_observed_at":"2026-08-07T04:29:23.701411Z","title":"Text-only train- ing for image captioning using noise-injected clip.arXiv preprint arXiv:2211.00575, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.701411Z"},"links":{"cited_paper":"/paper/2211.00575","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:8bef226b96cd504a0968acd4ecef787fe80852dda41fcc70b6d3eed06f88d4a2","observation_id":"09055feb-c934-45bb-b5b2-a5b9304eaafe","resolution":{"observed_at":"2026-08-07T04:29:23.701411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:23.757452Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.757452Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:1003c556696aa9958a64166dec1f2b15d89d6870e94c09a04996c46bec3b4c68","observation_id":"9c55f7d6-eb43-4fbc-9bec-9eddc3062d8f","resolution":{"observed_at":"2026-08-07T04:29:23.757452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:30.341623Z","title":"Semantic-aware representation blending for multi-label image recognition with partial labels","venue":null,"work_id":"3ad59562-c746-4cb9-b46b-5add8d4906c2","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.827478Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:85f1167076f28337c1d8d0d290ba43d636810a00f5a77086afcd3003b0c2e2c9","observation_id":"ad348d85-18e1-4a2d-8f9e-f92ce3949f50","resolution":{"observed_at":"2026-08-07T04:29:30.451465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:23.905795Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.905795Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:cdf8502e42c03371fd07bb95f1c13a205e5486d663c40945e3979e977794204d","observation_id":"c98aeb9a-3e22-4866-98ec-8e79f405e115","resolution":{"observed_at":"2026-08-07T04:29:23.905795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T04:29:23.971618Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.971618Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:9af63dbcad5b6d961da1993264dd01650aefc2fafece416b3bdf2082a04237b2","observation_id":"93cbaf98-1dac-440e-8fe9-4168ea114428","resolution":{"observed_at":"2026-08-07T04:29:23.971618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08381","last_updated":"2024-09-12T20:02:51Z","snapshot_observed_at":"2026-08-12T22:45:58.158867Z","submitted_at":"2024-09-12T20:02:51Z","title":"Rethinking Prompting Strategies for Multi-Label Recognition with Partial Annotations","version":1},"cited_work":{"arxiv_id":"2409.08381","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.08381","snapshot_observed_at":"2026-08-07T04:29:26.642807Z","title":"Rethinking Prompting Strategies for Multi-Label Recognition with Partial Annotations","venue":"cs.CV","work_id":"4761f59a-223d-46f6-b7f4-03abce87f5dd","year":2024},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.067977Z"},"links":{"cited_paper":"/paper/2409.08381","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:b2e220fe3883ff993f9b21d7d5a2a244143d5c4b8b72049eb4e2f352097c9bd6","observation_id":"67c2f28a-8042-4ba4-83f8-7b31737b9bfc","resolution":{"observed_at":"2026-08-07T04:29:26.741089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:24.140777Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.140777Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:c67a430ca87c52cf1bd4f08dcfaadb95f3e5053142fabcce2aaddd49bcf9fc6b","observation_id":"3e5370b9-3067-4406-b06a-7fa346309749","resolution":{"observed_at":"2026-08-07T04:29:24.140777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12242","last_updated":"2023-03-15T17:52:27Z","snapshot_observed_at":"2026-08-13T14:38:54.124751Z","submitted_at":"2022-08-25T17:45:49Z","title":"DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12242","snapshot_observed_at":"2026-08-07T04:29:24.201454Z","title":"Dreambooth: Fine tuning text-to- image diffusion models for subject-driven generation.arXiv preprint arXiv:2208.12242, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.201454Z"},"links":{"cited_paper":"/paper/2208.12242","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:116d613f6fda48e32d016b2d65a76207b2080ebf0a1c153b4e36715e6a3f6230","observation_id":"6e4f146f-2784-4af2-8e8a-503d755e9b84","resolution":{"observed_at":"2026-08-07T04:29:24.201454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:24.328312Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in Neural Information Processing Systems, 35:36479–36494, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.328312Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:95ee20afb3c6a4ebd69d081ffcb7dd25c4da15c5b3565a38943eef466751215f","observation_id":"4f3c9b3c-79d2-489f-ab99-da2bca4e214d","resolution":{"observed_at":"2026-08-07T04:29:24.328312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:30.094817Z","title":"Meta-learning for multi-label few-shot classification","venue":null,"work_id":"4883593a-dbb7-4e1f-bdf0-1bb635fdeda2","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.397782Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:6e34b40ffaadab5cff4b07ba3047b3280e2265806d86aae8fde142deff98ef5d","observation_id":"b82ffa68-b37d-4f30-be73-b103de74c0ae","resolution":{"observed_at":"2026-08-07T04:29:30.155597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:29.854301Z","title":"D2c: Diffusion-decoding models for few-shot conditional generation.Advances in Neural Information Processing Systems, 34:12533–12548, 2021","venue":null,"work_id":"efec1adb-c51a-4652-a3a7-7e20326aaf03","year":2021},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.456552Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:43945eb92bb1caaeac33af2635e3034f109aa2dbd803c8d3b84865c0780b3f52","observation_id":"92e242d5-05a3-4554-919b-970c885771cd","resolution":{"observed_at":"2026-08-07T04:29:29.964146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09541","last_updated":"2022-06-20T02:36:54Z","snapshot_observed_at":"2026-08-13T15:20:33.353652Z","submitted_at":"2022-06-20T02:36:54Z","title":"DualCoOp: Fast Adaptation to Multi-Label Recognition with Limited Annotations","version":1},"cited_work":{"arxiv_id":"2206.09541","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.09541","snapshot_observed_at":"2026-08-07T04:29:26.436518Z","title":"DualCoOp: Fast Adaptation to Multi-Label Recognition with Limited Annotations","venue":"cs.CV","work_id":"d73e06de-9302-4564-ac8b-d53fc884f0bb","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.565152Z"},"links":{"cited_paper":"/paper/2206.09541","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:47c6b1952a9360b7a43f14661af7e91f22b370f036dfefc55a09ce0718443e10","observation_id":"2bce9440-2692-46ef-9e32-e27523688dcd","resolution":{"observed_at":"2026-08-07T04:29:26.503407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:29.620212Z","title":"Vl-adapter: Parameter- efficient transfer learning for vision-and-language tasks","venue":null,"work_id":"0117fa6a-e776-4bcb-8243-79d8fe7f6fde","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.669507Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:1e95bc0bbd1bd633513dafb620492afc757cc81a66655dbeaa10cb95f03efa40","observation_id":"6fdb1315-0afe-44f3-9465-a167a5c433b5","resolution":{"observed_at":"2026-08-07T04:29:29.756867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T04:29:24.742090Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.742090Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:e16d7c8fb29b92228a76490a7e7ec3e7541ce673c9b153e72a8e274cedb8500c","observation_id":"af3ca6be-ea1e-4188-859c-f811ac3a0582","resolution":{"observed_at":"2026-08-07T04:29:24.742090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:29.390685Z","title":"Schwing, and Heng Ji","venue":null,"work_id":"68ff7015-78de-4afd-8ff2-bfb5a0c8cb21","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.822899Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:f79a1425b4e582804b2ec407a15164938cdd7f6d0e7b25f58767ae76114e4f98","observation_id":"69079c93-4405-4a67-b3dd-facb53320b39","resolution":{"observed_at":"2026-08-07T04:29:29.467747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:29.167556Z","title":"Cnn-rnn: A unified framework for multi-label image classification","venue":null,"work_id":"92ec02cc-6167-42cc-85d7-c03b03edd559","year":2016},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.906797Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:22e0410d378055956ed4c1d586f9ce7158bd04ddae06806a5dd86440cc360632","observation_id":"22bd1813-84d4-49b2-b047-f7026cd06b86","resolution":{"observed_at":"2026-08-07T04:29:29.250117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:28.950256Z","title":"Beyond object proposals: Random crop pooling for multi-label image recognition.IEEE Transactions on Image Processing, 25(12):5678–5688, 2016","venue":null,"work_id":"4d9bac83-cb11-4c9a-93e7-60a5b389cef8","year":2016},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.011815Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:93fe1e27e62c54b681b3a09a1c72f132dcd6c1bc880c2c902f18b1bf594e775b","observation_id":"174fdf45-c604-41ac-b7e2-25289eee0a40","resolution":{"observed_at":"2026-08-07T04:29:29.090608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:28.662683Z","title":"Multi-label classification with label graph superimposing","venue":null,"work_id":"41bed999-6162-466c-b2b9-c9f7d16158cb","year":2020},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.068637Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:a7bff6fe27e520ed9d21f105526aa09063491dba7bb1c65158235a7862587fc0","observation_id":"dce809da-2730-4619-affa-4980c9be33dd","resolution":{"observed_at":"2026-08-07T04:29:28.742045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:28.413928Z","title":"Multi-label image recognition by recurrently discovering attentional regions","venue":null,"work_id":"ae0cc5bc-366c-466a-b00d-52ba310a14b5","year":2017},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.215372Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:5ddeb9b91eeb46b0eb3dfd5a417a170d13853863cafaa980650241b824f469e4","observation_id":"48618230-4984-4bd0-acf7-75eadd39a688","resolution":{"observed_at":"2026-08-07T04:29:28.509634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06926","last_updated":"2024-05-11T06:11:42Z","snapshot_observed_at":"2026-08-13T16:26:41.305511Z","submitted_at":"2024-05-11T06:11:42Z","title":"TAI++: Text as Image for Multi-Label Image Classification by Co-Learning Transferable Prompt","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06926","snapshot_observed_at":"2026-08-07T04:29:25.323228Z","title":"Tai++: Text as image for multi-label image classification by co-learning transferable prompt.arXiv preprint arXiv:2405.06926, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.323228Z"},"links":{"cited_paper":"/paper/2405.06926","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:6e644a8e81718c2573bad7f09da8acc90965ab7089ce6c70c45763322b01fae8","observation_id":"fb074065-6d3a-4991-9b4d-40e4d1514758","resolution":{"observed_at":"2026-08-07T04:29:25.323228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:28.129122Z","title":"Orderless recurrent models for multi-label classification","venue":null,"work_id":"89ff5ca3-4a86-466d-a0e3-8f505ba065c7","year":2020},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.508076Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:d072492d4e8faae6851792230694d55d710a2c2d4455852d1698e9371424c5e9","observation_id":"dbdbd1f7-a38c-4168-9111-1df0ebb44a80","resolution":{"observed_at":"2026-08-07T04:29:28.291057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:27.886933Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification","venue":null,"work_id":"4bf0c1d5-34d0-4927-be89-93fc022e13c7","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.657227Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:386c1baf3721effd7f7c1786099271a492ebdf82807330493773bd1a16a25369","observation_id":"7ca2c462-991a-4087-9e94-b6d750d30dbb","resolution":{"observed_at":"2026-08-07T04:29:28.026308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:27.652117Z","title":"Transformer-based dual relation graph for multi-label image recognition","venue":null,"work_id":"74c164e5-94c6-4ee2-8ac5-00f8d2805f54","year":2021},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.787028Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:c34edc655fffb068f2b40c3cb6660d916f7feac24b52755ce72be265274bc018","observation_id":"34f917ba-feac-407e-b5f9-f4cd954240b7","resolution":{"observed_at":"2026-08-07T04:29:27.754042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:25.856436Z","title":"Con- ditional prompt learning for vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.856436Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:94df815c953da6f1660fcdbd0c01e8598aa364a73b048ea645998807758746f8","observation_id":"786f5b84-e50e-41b7-84be-a94a0819c3be","resolution":{"observed_at":"2026-08-07T04:29:25.856436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:25.936192Z","title":"Learning to prompt for vision-language models.International Journal of Computer Vision, 130(9):2337–2348, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.936192Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:85a6a99cdbeca71b84bc8b5283c545ecb10bd55d0d46114d676ed17bccb04b79","observation_id":"2320c6c6-4efe-499d-b709-e6fc9b5d7e67","resolution":{"observed_at":"2026-08-07T04:29:25.936192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14865","last_updated":"2025-08-13T06:38:43Z","snapshot_observed_at":"2026-08-13T15:34:21.281646Z","submitted_at":"2022-05-30T06:05:21Z","title":"Prompt-aligned Gradient for Prompt Tuning","version":4},"cited_work":{"arxiv_id":"2205.14865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.14865","snapshot_observed_at":"2026-08-07T04:29:26.183084Z","title":"Prompt-aligned Gradient for Prompt Tuning","venue":"cs.CV","work_id":"1bf11ef7-e269-46e4-9f7f-946101cd12dc","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:26.022916Z"},"links":{"cited_paper":"/paper/2205.14865","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:6181cc18d1a4f49cac932f4dc89905061034cfcb5387f8b9fbc23b79ee408cb4","observation_id":"c164c584-c577-4927-b2c5-dd84080dafe2","resolution":{"observed_at":"2026-08-07T04:29:26.267957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T05:45:06.211025Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":6,"verified_fuzzy":29},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2506.10575."}