{"as_of":"2026-08-10T03:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5923bc828e22e82819fc4f765a6aaeb36b846cab68f911a6e3918b42696ea673","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:27:47.245370Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08410/citation-record","integrity":"/paper/2507.08410/integrity","json":"/paper/2507.08410/citation-record.json","paper":"/paper/2507.08410"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.747091Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.747091Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:d23a03e87622e2864024976a4a0beb12aa5e62a4da4ec77000ba4400d39a70d5","observation_id":"9156d484-00be-4473-948a-c2cad2f6b3c9","resolution":{"observed_at":"2026-08-06T18:27:46.747091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18415","last_updated":"2024-11-03T18:23:45Z","snapshot_observed_at":"2026-08-08T18:13:25.984360Z","submitted_at":"2024-05-28T17:57:06Z","title":"Why are Visually-Grounded Language Models Bad at Image Classification?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18415","snapshot_observed_at":"2026-08-06T18:27:46.828449Z","title":"Why are visually-grounded language models bad at image classification?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.828449Z"},"links":{"cited_paper":"/paper/2405.18415","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:817aa0dc85ee60d3474d4bc088cce4647a548156e307becad032423bf6054864","observation_id":"2f4deb52-f0f0-4b76-8427-1491df391ee8","resolution":{"observed_at":"2026-08-06T18:27:46.828449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.858025Z","title":"Eva: Exploring the limits of masked visual representation learning at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.858025Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0de413aea1e14840b98138ee9ceafe3437baf86835dda44f4db68e4492acc579","observation_id":"13029e43-a1b6-49e4-bafc-42fb665b7bfb","resolution":{"observed_at":"2026-08-06T18:27:46.858025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.862663Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.862663Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:03a738ddecb8171e89430badcf1e0bc880ea7ac006bc629b059286546c91b16b","observation_id":"39aa69af-70b4-4a4f-8183-f1198ec0dbeb","resolution":{"observed_at":"2026-08-06T18:27:46.862663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.867601Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.867601Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:a3c09655b4e525748f812663c9b85e3505e80e123ab3dac7eef95f581de634c7","observation_id":"46276c91-e114-4954-aa13-5a3a05cb3661","resolution":{"observed_at":"2026-08-06T18:27:46.867601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.871905Z","title":"Maple: Multi-modal prompt learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.871905Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:d99ee455de208e5494f411091707db899a31c405ecdeff9c4bc4fdcb25c9089b","observation_id":"e285e8a3-1e6c-46ea-beb8-b17c138e9631","resolution":{"observed_at":"2026-08-06T18:27:46.871905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.876620Z","title":"Tcp: Textual-based class-aware prompt tuning for visual-language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.876620Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:31ee4188f37b589e9437b888ba88cc5cea10038ace9d1d7c4cfe2cc41d02c6e5","observation_id":"a6fc409e-cd32-491d-b6b6-0a58406c2ab0","resolution":{"observed_at":"2026-08-06T18:27:46.876620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:53.253256Z","title":"Dept: Decoupled prompt tuning,","venue":null,"work_id":"1f090aa5-b8f4-48f2-b7c5-d4a3ed323278","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.881369Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:3f8a8525c921ef1ec5b621087e5679c029d10ef0b554750a9409e8187cf854c1","observation_id":"d1b1b93a-719a-4ddf-8302-3d48af181791","resolution":{"observed_at":"2026-08-06T18:27:53.308142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02781","last_updated":"2024-08-13T07:50:02Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T08:53:30Z","title":"PromptKD: Unsupervised Prompt Distillation for Vision-Language Models","version":5},"cited_work":{"arxiv_id":"2403.02781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.02781","snapshot_observed_at":"2026-08-06T18:27:47.622484Z","title":"PromptKD: Unsupervised Prompt Distillation for Vision-Language Models","venue":"cs.CV","work_id":"b149260f-de95-4e18-9c35-ebb1744aa70b","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.885780Z"},"links":{"cited_paper":"/paper/2403.02781","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:851f23f7bddc2ac5cd9b79e9879d0b21abedade164bcd8aeb9c3c8e3e75a2f91","observation_id":"1e11ad71-9bdb-44c6-96e9-9c28f9822ee4","resolution":{"observed_at":"2026-08-06T18:27:47.628086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.890805Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.890805Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:045c5400622975995f8f85331c291da6bd79d2e1754d6be26e5597c47ecccff6","observation_id":"ff40152d-8d67-4828-ba13-342a9de8c0cb","resolution":{"observed_at":"2026-08-06T18:27:46.890805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01195","last_updated":"2024-08-03T18:48:43Z","snapshot_observed_at":"2026-07-06T15:36:56.786182Z","submitted_at":"2023-06-01T23:20:47Z","title":"Consistency-guided Prompt Learning for Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01195","snapshot_observed_at":"2026-08-06T18:27:46.895300Z","title":"Consistency-guided prompt learning for vision- language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.895300Z"},"links":{"cited_paper":"/paper/2306.01195","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:6dcaca72f26de94cacd2d392668c6bac242d80f60c9130879ed55c58a34946fa","observation_id":"6bf813c6-152a-4bcf-9010-af13b40d0145","resolution":{"observed_at":"2026-08-06T18:27:46.895300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04076","last_updated":"2024-04-02T21:47:35Z","snapshot_observed_at":"2026-08-07T11:18:47.864084Z","submitted_at":"2023-12-07T06:43:34Z","title":"Large Language Models are Good Prompt Learners for Low-Shot Image Classification","version":2},"cited_work":{"arxiv_id":"2312.04076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.04076","snapshot_observed_at":"2026-08-06T18:27:47.583661Z","title":"Large Language Models are Good Prompt Learners for Low-Shot Image Classification","venue":"cs.CV","work_id":"52215a3e-2ae8-4db4-8030-f2d90231b358","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.900106Z"},"links":{"cited_paper":"/paper/2312.04076","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:794a61fa1f6087e82249367ef8892d10b5b9496531c772cd35bd1dc2bae8ee24","observation_id":"beabbd0c-6a93-456d-884e-253b41e88a75","resolution":{"observed_at":"2026-08-06T18:27:47.588821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:53.070684Z","title":"Improved zero-shot classification by adapting vlms with text descriptions,","venue":null,"work_id":"13758758-46ce-44c3-b5a1-6571c01f9915","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.904781Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:974d8a23b769b56bad2808666565bd87739fb1313d8eecac3de746eb697ae79d","observation_id":"b0972253-29f7-495d-b171-ee7e2656d84a","resolution":{"observed_at":"2026-08-06T18:27:53.132833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.975252Z","title":"Bilateral adaptive cross-modal fusion prompt learning for clip,","venue":null,"work_id":"0146697c-9072-4d0f-807e-053668f744cc","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.909676Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:556bed661309401db7be2d3d0b9d03f8911e4d6553e639dad147cbb4c5dd0c86","observation_id":"b51b309f-f8ee-4a08-aa8c-88b0b494d25e","resolution":{"observed_at":"2026-08-06T18:27:53.023998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07225","last_updated":"2022-10-13T17:50:24Z","snapshot_observed_at":"2026-08-09T12:39:06.378102Z","submitted_at":"2022-10-13T17:50:24Z","title":"Unified Vision and Language Prompt Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07225","snapshot_observed_at":"2026-08-06T18:27:46.914058Z","title":"Unified vision and language prompt learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.914058Z"},"links":{"cited_paper":"/paper/2210.07225","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:24e06fdf40b0b01e8e2bca0c594cfc03114e441dc2249471c3c873d3c7694df2","observation_id":"238e3490-284d-4bb2-961f-47d8d62720ee","resolution":{"observed_at":"2026-08-06T18:27:46.914058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.918620Z","title":"Visual prompt tuning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.918620Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:606744e18372b5a6cd70e3b4b3e8e3d0fe0dd578d305dd5e1bea787979c41110","observation_id":"df39cd68-4808-4b93-84a3-376673743d68","resolution":{"observed_at":"2026-08-06T18:27:46.918620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.864113Z","title":"Enhancing clip with gpt-4: Harnessing visual descriptions as prompts,","venue":null,"work_id":"8f12c857-fde3-4db2-8164-b3aec13ec91c","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.922850Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:7f4bbb506294f94bab78165b2dc8fa838dd457687f940308176e71aba01e7fe2","observation_id":"8de8356e-06a5-4660-bfaa-dcb20f95c1c9","resolution":{"observed_at":"2026-08-06T18:27:52.914404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.771932Z","title":"Prompt distribution learning,","venue":null,"work_id":"21919315-a94c-4eac-990c-1667f264f5c3","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.927549Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:aa14eb4d497125d0140a1b1988ee2e274759391d0e166908a4f01b70fc5eb130","observation_id":"3bd84a38-a290-439d-98ea-de7097bf09bf","resolution":{"observed_at":"2026-08-06T18:27:52.819718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.641681Z","title":"Prompt-aligned gradient for prompt tuning,","venue":null,"work_id":"222c33ea-c91f-40f9-9ddd-5e500db9ab83","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.931748Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:8346914f91d0c04070f466634d367d2e8527ea0cbe89728140ee6ce960182a99","observation_id":"746ad6f6-bf5f-4710-a27b-837d46252273","resolution":{"observed_at":"2026-08-06T18:27:52.688397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.529981Z","title":"Visual-language prompt tuning with knowledge-guided context optimization,","venue":null,"work_id":"6f9ea9df-c79e-4a40-af9f-57b104c6c1a8","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.936059Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:2e951ddfb3f36844eb7c702ee394d438e41516d8a36f0e290ea8171f18f85377","observation_id":"ce721eb8-229b-4418-bd7f-ddf5a5307220","resolution":{"observed_at":"2026-08-06T18:27:52.589453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.429027Z","title":"Gradient-regulated meta-prompt learning for generalizable vision-language models,","venue":null,"work_id":"f6413089-85e6-4efa-b59b-446dbddc5cde","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.940199Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:851a4c107d0ca8bfdc60fb026c130d96a98b3a050cab27c255df4573868fcfbc","observation_id":"bd6d3c8b-1362-4dc4-9d32-66c8364755c7","resolution":{"observed_at":"2026-08-06T18:27:52.463189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15914","last_updated":"2024-04-16T03:25:25Z","snapshot_observed_at":"2026-08-09T23:21:41.758435Z","submitted_at":"2024-01-29T06:57:48Z","title":"Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15914","snapshot_observed_at":"2026-08-06T18:27:46.944447Z","title":"Overcoming the pitfalls of vision-language model finetuning for ood generalization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.944447Z"},"links":{"cited_paper":"/paper/2401.15914","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:7321cfd3140d012cfe455a29faf0ce728c69aa56c6c285ea45e8385d958b03c0","observation_id":"10ae3ddd-ef59-4170-a0e7-6ca883cffe58","resolution":{"observed_at":"2026-08-06T18:27:46.944447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00851","last_updated":"2024-04-01T01:42:23Z","snapshot_observed_at":"2026-08-07T01:07:34.003095Z","submitted_at":"2024-04-01T01:42:23Z","title":"Prompt Learning via Meta-Regularization","version":1},"cited_work":{"arxiv_id":"2404.00851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00851","snapshot_observed_at":"2026-08-06T18:27:47.523119Z","title":"Prompt Learning via Meta-Regularization","venue":"cs.CV","work_id":"ea2e060c-3d5a-4383-8701-f796a0db24cb","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.950350Z"},"links":{"cited_paper":"/paper/2404.00851","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:6ec6b3c8d4a774d99255c7321a224c65612986f9ff4459e1d26cf7acbc710c68","observation_id":"9a37ab55-322c-41fb-aa5d-67c6ecef6e1f","resolution":{"observed_at":"2026-08-06T18:27:47.531123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.954920Z","title":"Extract free dense labels from clip,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.954920Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:018c0e027e4e4fdd03b2300c8bb87febd02e3a6ba86142863ea2c101f7a3ba21","observation_id":"220f93bd-0fb4-4ca8-9531-dfae0fce96f5","resolution":{"observed_at":"2026-08-06T18:27:46.954920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.264163Z","title":"Maskclip: Masked self-distillation advances contrastive language-image pretraining,","venue":null,"work_id":"7b2d7d51-327b-45b7-acea-b00fb61ff5fa","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.959853Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:576eb887ed621503593ecb5c7f2254990da18afb39b5ccc5ad065a5bc5130480","observation_id":"30df0cf1-407e-485a-b5cf-7dffa62d7dc8","resolution":{"observed_at":"2026-08-06T18:27:52.347774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.132791Z","title":"Scaling open-vocabulary image segmentation with image-level labels,","venue":null,"work_id":"03c1b57c-7188-473e-939b-b114435c35cd","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.964096Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:143f1d5d559d6d536f3acb2a223e2844ffd2335cb57d1d934aa48774dba05285","observation_id":"656ca6ad-35e3-44cb-8f23-7b855be7738e","resolution":{"observed_at":"2026-08-06T18:27:52.187378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.011535Z","title":"Clip-actor: Text-driven recom- mendation and stylization for animating human meshes,","venue":null,"work_id":"c3855d14-fa33-4fb0-9492-20f6e0d3f4a3","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.968647Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:a63b47da637b6a26fc0ec5c33000cc7d4fd719d464f59e06f92beea8a8ac4359","observation_id":"91fa11dc-3e8a-4aa1-a9ca-edfed4077d34","resolution":{"observed_at":"2026-08-06T18:27:52.049810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.868664Z","title":"Motionclip: Exposing human motion generation to clip space,","venue":null,"work_id":"f78d0db5-d33d-48e6-9f0f-f388a4f2fef4","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.972909Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:b590244a7f0918544d9ea5ec4bea2372c4d510e1b2bbb05107427b29e4668a34","observation_id":"0a060441-440b-47f6-a6c8-5f8ac15e06e3","resolution":{"observed_at":"2026-08-06T18:27:51.926665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.730956Z","title":"Lerf: Language embedded radiance fields,","venue":null,"work_id":"200f0b9f-ce72-4d8e-9985-f2525ddac02d","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.977678Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0f5608a5bd0447cad3bbed53b2a3d61ed058d30fa48d316f9a640b498a4fba9d","observation_id":"4eecf22f-9870-4ade-b773-d53cbb9d45ec","resolution":{"observed_at":"2026-08-06T18:27:51.794526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.631566Z","title":"Zero-shot learning—a comprehensive evaluation of the good, the bad and the ugly,","venue":null,"work_id":"40c6d75e-2ba4-404d-8877-56290c63d574","year":2018},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.982662Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0de6b93fc4aa6c7bc51620f6c4f66266194f36c3b9a3bf869f6c68ba12d2f495","observation_id":"02d23dc6-b701-44f5-ada5-0e86715b5721","resolution":{"observed_at":"2026-08-06T18:27:51.672169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.986836Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.986836Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:5f41cf393ce25be33180e40f2f7c1081b1a60883b2dc6885d1a1273d3f533a93","observation_id":"23b94d3d-e2e8-4244-8bbb-6e32f8929bca","resolution":{"observed_at":"2026-08-06T18:27:46.986836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.991834Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.991834Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:44e172e5b1ed5d2b549f9827c8755aa799a26a0ed7b388445e378a4dff9a0f05","observation_id":"35d1dcec-ae34-4f33-bb68-d42d1619d1db","resolution":{"observed_at":"2026-08-06T18:27:46.991834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.506591Z","title":"Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip,","venue":null,"work_id":"55738826-589e-4184-90e9-6b3c4b4fe240","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.996424Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:e873fb0a8daa458cb6025b5e5575bdeddcc27ee51dd97253dea1d504833e9729","observation_id":"6abaeceb-78db-4f94-a602-10c36459ebab","resolution":{"observed_at":"2026-08-06T18:27:51.558422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.382896Z","title":"Learning multiple visual do- mains with residual adapters,","venue":null,"work_id":"69980451-3a8d-4d5f-86cc-be047aebed98","year":2017},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.000463Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:379f5abfed8b267c0169ed384891bcbb65c8ee6d9913e1fcbd1af94abe90b137","observation_id":"dc50ac75-8e87-4e05-b27d-bdd526939afd","resolution":{"observed_at":"2026-08-06T18:27:51.422176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.004756Z","title":"Task residual for tuning vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.004756Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:936814b2f712dcd3a76324cdd21222f9d3d080351f5eb2ba036faab48cecb619","observation_id":"df3884a4-e868-4a13-b3f5-779d240ad034","resolution":{"observed_at":"2026-08-06T18:27:47.004756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.237802Z","title":"Graphadapter: Tuning vision-language models with dual knowledge graph,","venue":null,"work_id":"79caf452-99de-4d3e-9c8c-a9f6c3775af8","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.009320Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:e7d3ba5e580c5e15ca0f2f91c5b49b1b9640a299eab30f117aa665ee3315c449","observation_id":"1049f89e-7bdc-42f0-842a-40ef4abe2cfb","resolution":{"observed_at":"2026-08-06T18:27:51.287187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.115747Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification,","venue":null,"work_id":"b5ca1bdb-3890-4153-a219-d3943340a720","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.014458Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:39eb2cd0939b3ac285d38d61210bdc2e987f91e1291c75a18dea9c2894c32325","observation_id":"1eda3c94-5ad5-4f4d-be25-959d22145c73","resolution":{"observed_at":"2026-08-06T18:27:51.184126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.007272Z","title":"Prompt, generate, then cache: Cascade of foundation models makes strong few-shot learners,","venue":null,"work_id":"52afcc33-5cee-49d8-9a37-31184790bfab","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.020022Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:cd228d3de7986522739d422d89da2a2e8e78bddfe0b38544aff0bf572b76d478","observation_id":"1abc598d-c2f6-4616-ad26-a737a108eb74","resolution":{"observed_at":"2026-08-06T18:27:51.062183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.881123Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":"a806a00e-84ae-4499-adae-4eb34b698387","year":2021},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.024837Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:9771d2d9111b2d674c6b374a1648dd18de2973561b9809d3dea4276a4f90f7da","observation_id":"9f914995-6d80-4a1f-9ae2-225555a4edfd","resolution":{"observed_at":"2026-08-06T18:27:50.934926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.029881Z","title":"Clip-adapter: Better vision-language models with feature adapters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.029881Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:d65b74eebf2f88fa080a4884ee6790c9dbc922059696f3525f69e3f7f9300a6f","observation_id":"a0da0837-f247-4fa4-961c-15e60e0e2d10","resolution":{"observed_at":"2026-08-06T18:27:47.029881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.726386Z","title":"Visual instruction tuning,","venue":null,"work_id":"ef57fd76-c257-4fc0-973d-c23a89479e02","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.034432Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:ffe2948788789d3d28b1918861c568e94d284109066af35cc56840f804cbec4d","observation_id":"c4e96674-b6bb-4465-8a7b-65835d098491","resolution":{"observed_at":"2026-08-06T18:27:50.825910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.581056Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"52cc5f63-ed0f-4e93-ae6b-73373a0b54d0","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.040924Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:1faf4882af70cb9b57ab174a30d1fd5453b0db20bc7a0cb0810bfc9a89944536","observation_id":"ef0bc9f0-d96f-414c-8020-02d97cf13d3b","resolution":{"observed_at":"2026-08-06T18:27:50.620422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T18:27:47.045952Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.045952Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:3beaeba555ad047e9aa3564af4e53863fe3294f7e4fff2d579682ea75e41f86f","observation_id":"28ae536f-a7b7-4040-a6a4-6e8d39f811f1","resolution":{"observed_at":"2026-08-06T18:27:47.045952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T18:27:47.051880Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.051880Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:a4b8d9d5839942c48f6b08c01013e035873e237344d7e76a9cf9e1c4e42e97f4","observation_id":"fb9e63f8-2e1f-419d-83b6-5ea2e4e0e2bc","resolution":{"observed_at":"2026-08-06T18:27:47.051880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T18:27:47.056475Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.056475Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0d625c8d7556a5c7aeefd7ce83b87a83ed40178f85f5f2f2ca8eab12ef39ede4","observation_id":"b6fbb7e0-9f7a-4505-a77c-8edc06cd4e2c","resolution":{"observed_at":"2026-08-06T18:27:47.056475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T18:27:47.061316Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.061316Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:aa429336e92ea8a8208a5327afdda7fc831220c53bae603bab754f9142a3c08c","observation_id":"db69644f-4f1c-46dd-892f-a28717e3872e","resolution":{"observed_at":"2026-08-06T18:27:47.061316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T18:27:47.067589Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.067589Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:7fcb048c6b04ac1420fee843a89e7f1cf948ac362d36a6946716041dbbbd0ba6","observation_id":"4ea8671e-27eb-4810-9f07-15b354a3fbe0","resolution":{"observed_at":"2026-08-06T18:27:47.067589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.407321Z","title":"Language models are few-shot learners,","venue":null,"work_id":"e91aa0dd-ffab-46e7-9780-f3fa64e9cae5","year":1901},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.072777Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:7182c54eb7a02a1455064d4a795c2f3395a137fbb75f575484429baee2c6752f","observation_id":"df2878d6-2386-40f8-a3be-cf412156b8f0","resolution":{"observed_at":"2026-08-06T18:27:50.483391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:27:47.077647Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.077647Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0eca2a9cc62b26c13d652973cd490140587500a95b013a2e96de2d5c137b2d10","observation_id":"e21620ed-086e-4534-9205-d2ba8e2d569d","resolution":{"observed_at":"2026-08-06T18:27:47.077647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.290689Z","title":"Lit: Zero-shot transfer with locked-image text tuning,","venue":null,"work_id":"6a3f0ad0-8564-4cf9-9128-a70b14937146","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.082212Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:aee0f22d8b6ed762fe7505aea5dfa10092a1917ac163f97ac20daff51feb1a18","observation_id":"da45060a-6976-45f4-af72-cf3165bc0341","resolution":{"observed_at":"2026-08-06T18:27:50.324687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T18:27:47.087432Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.087432Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:c1e1174e2ac4f7bed58abb9b5e3512384079c033693673c4d8541f38b457f3df","observation_id":"35d68594-d399-4b80-9387-415d325d1bc9","resolution":{"observed_at":"2026-08-06T18:27:47.087432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.159698Z","title":"Compound text- guided prompt tuning via image-adaptive cues,","venue":null,"work_id":"e2c72370-eb4a-465d-b295-f1955f2af496","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.091790Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:db03469b2586784acea957def56802d6ca3d6b20e80aad4da951b2a6ed7a001f","observation_id":"9f233f02-4d06-4e35-acbb-1f53b16ebe0c","resolution":{"observed_at":"2026-08-06T18:27:50.217897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.043574Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classification,","venue":null,"work_id":"1fd010a4-87a7-4c8e-b388-0ddb2e7fa09b","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.095841Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:bfc2b306d080e2256e3eddccc19e6f260a560a888c584ede5ddd156e0239a6f7","observation_id":"e3af5be0-e7e6-4bbf-ad16-cf73bf0f6d94","resolution":{"observed_at":"2026-08-06T18:27:50.121431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.850092Z","title":"Knowledge- aware prompt tuning for generalizable vision-language models,","venue":null,"work_id":"ad556cdb-3717-433a-aa56-b887357031d9","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.099862Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:b81a069c86c0d5fb267071de2df92f3d82aecfc2de6e0cad6d97b5ca4aadf848","observation_id":"058280ef-4874-4509-bcbf-2194a2a50869","resolution":{"observed_at":"2026-08-06T18:27:49.956199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07183","last_updated":"2022-12-01T17:38:37Z","snapshot_observed_at":"2026-08-08T07:53:13.926951Z","submitted_at":"2022-10-13T17:03:46Z","title":"Visual Classification via Description from Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07183","snapshot_observed_at":"2026-08-06T18:27:47.103905Z","title":"Visual classification via description from large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.103905Z"},"links":{"cited_paper":"/paper/2210.07183","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:e63a5b4e104cd2025898b0ebab2d4c5c4a4982af3bb1e06b08eb5d45b2a547c7","observation_id":"1d8720a8-38d4-4b3a-8478-00c46d016f16","resolution":{"observed_at":"2026-08-06T18:27:47.103905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.708200Z","title":"Learning concise and descriptive attributes for visual recognition,","venue":null,"work_id":"e588d759-0f6b-4af5-9d33-8a89810c6039","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.108072Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:7967df2182d4bd851b2388b96a8507f66787bf2bbe58fceaca0458eb5e2bdcc1","observation_id":"75668555-2309-4fa6-bb4c-f2118b5d3851","resolution":{"observed_at":"2026-08-06T18:27:49.775912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.547771Z","title":"Language in a bottle: Language model guided concept bottlenecks for interpretable image classification,","venue":null,"work_id":"4732658b-10e5-4ca1-b567-43e743f591f9","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.112614Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:c45a58676b8736d794660f397ced7eb06777d8dab198ec424411de2911a65c03","observation_id":"34ada827-974f-4242-ba9b-9fd737e8d60b","resolution":{"observed_at":"2026-08-06T18:27:49.621856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16825","last_updated":"2023-10-25T17:56:07Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:56:07Z","title":"CommonCanvas: An Open Diffusion Model Trained with Creative-Commons Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16825","snapshot_observed_at":"2026-08-06T18:27:47.118712Z","title":"Commoncanvas: An open diffusion model trained with creative-commons images,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.118712Z"},"links":{"cited_paper":"/paper/2310.16825","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:af0ff447fe4ac73214cb3328f4720421748f883a30e6662a478cd541e932cb21","observation_id":"50027c03-64e6-4f04-9744-23d2afa54312","resolution":{"observed_at":"2026-08-06T18:27:47.118712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.387104Z","title":"Enhancing clip with a third modality,","venue":null,"work_id":"f1f96100-75e6-4cb4-9a7e-724be2fd54ac","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.123856Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:d6da66c8f278946403722664aca3bb6a438316d68bb4d742d4a027dc4f810133","observation_id":"c6b5550b-2977-42f3-9ad0-d2c49cf999a3","resolution":{"observed_at":"2026-08-06T18:27:49.445333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13837","last_updated":"2024-03-10T16:01:25Z","snapshot_observed_at":"2026-08-05T06:22:00.176279Z","submitted_at":"2024-01-24T22:28:26Z","title":"Democratizing Fine-grained Visual Recognition with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13837","snapshot_observed_at":"2026-08-06T18:27:47.128776Z","title":"Democratizing fine-grained visual recognition with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.128776Z"},"links":{"cited_paper":"/paper/2401.13837","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:693e5ce639a767221bf63de5cf367e229a9badfcf9f75dc7cc59acabfd07856e","observation_id":"ec1c2b0c-570f-417f-8122-21e4f8930b80","resolution":{"observed_at":"2026-08-06T18:27:47.128776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.264658Z","title":"Fine- tuned clip models are efficient video learners,","venue":null,"work_id":"491f52ee-60db-4219-9efe-fdcc4d9cf805","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.133211Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0eaa29e004f97ef437cdfdd0d2964730c4d756b05235e93756aed369afd41aad","observation_id":"47bfcda6-c303-4016-97c9-7eb8c868765a","resolution":{"observed_at":"2026-08-06T18:27:49.292751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.137318Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.137318Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:320d51b99eb9f65a9efb5ba2310fbb105345997fe0557094a3cf6a8b61e2812d","observation_id":"14e7dd2a-a6e4-44ef-83af-2c44af5d7ca2","resolution":{"observed_at":"2026-08-06T18:27:47.137318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.120433Z","title":"3d object representations for fine-grained categorization,","venue":null,"work_id":"2ab9b6eb-7ebc-4ca6-b63a-26c7fc44b4f1","year":2013},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.141493Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:3ba9c9958a555992f8af847cb5971ae500c4be5f8bdebc3104d3e3d81cbcb965","observation_id":"475c5e0c-cfcc-4dfa-988d-dfcd5af801cf","resolution":{"observed_at":"2026-08-06T18:27:49.180107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T18:27:47.145588Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.145588Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:c5adac63390791af4ec89ab16ad60b21b4bf05cfe50d97a9e333bd6125c446b3","observation_id":"9857915e-5ab4-4c8a-8e06-b24ec7478460","resolution":{"observed_at":"2026-08-06T18:27:47.145588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.150373Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.150373Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:84911bf7958cd2806969062a58bcb74272fb367eefa21c06e8a3eeaa6869e276","observation_id":"15ca188b-e6c5-41de-ac53-07fcd31661af","resolution":{"observed_at":"2026-08-06T18:27:47.150373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.936202Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":"48db96f5-bbd5-4761-9a74-3060cb572f51","year":2008},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.155160Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:7e89d0794480d8fcc254458d58954801d82b950e47125518ee8999c80fd1f52b","observation_id":"0a4b130c-298f-4fa9-8c3b-a67156111844","resolution":{"observed_at":"2026-08-06T18:27:48.995277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.788623Z","title":"Sun database: Large-scale scene recognition from abbey to zoo,","venue":null,"work_id":"f0f074e3-9328-4bd7-91bf-41db98cd9f6f","year":2010},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.159461Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:ed50a5c40f5250f6e2e9b14eb6f3a23e41ea05b44cdfdc29e7a319ad4445c1b2","observation_id":"cfb0970c-d0ef-4a1e-9a4e-cdb51eac85ba","resolution":{"observed_at":"2026-08-06T18:27:48.855739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.164738Z","title":"Describing textures in the wild,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.164738Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:c9eeb4d59e93e14b5873bdacd5c808b916ddbf47610f451337456e7e40be0cfb","observation_id":"cb1de294-5148-4188-80ce-d383d634eec2","resolution":{"observed_at":"2026-08-06T18:27:47.164738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.169601Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.169601Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:74912c82532fda858945c7b3d1d94da0f38a26935a4c01b713c900d967b69287","observation_id":"a67ce6cd-e736-4acf-ab61-68a8ea592866","resolution":{"observed_at":"2026-08-06T18:27:47.169601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-06T18:27:47.173763Z","title":"Fine- grained visual classification of aircraft,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.173763Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:109d8a46360c0a3923cebd5d9e6d5afa541a9b9860fcd0096ba6d1dc3526dc53","observation_id":"e59cc4cc-4243-4123-a5ec-3092aa3d8d3a","resolution":{"observed_at":"2026-08-06T18:27:47.173763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.492829Z","title":"Cats and dogs,","venue":null,"work_id":"26c45c3e-3f28-4de6-82aa-889976e1a7f5","year":2012},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.178390Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:e61a04a62ce1c51524d3fd5d01a3756f253b0bef4382e8b929c980ff333c392f","observation_id":"b3085d30-3809-40f2-8b98-d7c610e63ed1","resolution":{"observed_at":"2026-08-06T18:27:48.630071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.294494Z","title":"Food-101–mining discriminative components with random forests,","venue":null,"work_id":"2bc1a41d-3ece-405e-95af-bc4fe654b19c","year":2014},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.182947Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:92df0c3a00815caedf250a5dc169e0a191cb7eab128ea9686fd5f84336a9faca","observation_id":"909a32ad-7675-47a7-b735-0ae79adae21f","resolution":{"observed_at":"2026-08-06T18:27:48.360216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.187502Z","title":"Natural adversarial examples,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.187502Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:45bf0208fc879fe43d4ac394543143de30a0bf7b33d44f70fb714f4128e07302","observation_id":"72fc57ec-122e-432a-9988-717872c231ea","resolution":{"observed_at":"2026-08-06T18:27:47.187502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.152959Z","title":"Do imagenet classifiers generalize to imagenet?","venue":null,"work_id":"97612df6-3554-4e09-8926-cf3f471339fc","year":2019},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.191888Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:627f2cfc0a79c0a8f86c8102cb1e1e0c12e4ad76286af5e8e16898ad73fc9fd9","observation_id":"cc9ce98a-bbfc-4d28-8fe6-d2c3c6a19bb2","resolution":{"observed_at":"2026-08-06T18:27:48.217435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.021247Z","title":"Learning robust global representations by penalizing local predictive power,","venue":null,"work_id":"86a302e6-8b48-4cd2-922e-5cf2f962cffb","year":2019},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.196049Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:fe8af480a8d9902716851b0beae290c2ad64cbbd931148d28f823b2dfdc570d4","observation_id":"65100d47-d282-481d-8bd0-386ace54c4d1","resolution":{"observed_at":"2026-08-06T18:27:48.073216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:27:47.200213Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.200213Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:8141f8e75583baefc4f3adaaa12893b9bf4fed8ea313f625b9b44b872eed1042","observation_id":"3f9b258a-8bca-4d7d-a7a9-79e5628ee05f","resolution":{"observed_at":"2026-08-06T18:27:47.200213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13600","last_updated":"2024-03-20T13:48:50Z","snapshot_observed_at":"2026-07-06T17:47:42.867147Z","submitted_at":"2024-03-20T13:48:50Z","title":"VL-Mamba: Exploring State Space Models for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13600","snapshot_observed_at":"2026-08-06T18:27:47.204582Z","title":"Vl-mamba: Exploring state space models for multimodal learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.204582Z"},"links":{"cited_paper":"/paper/2403.13600","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:27f6736f7a8912944020bfd1e58237271876519c8651aba9f46872c1b7c6e49f","observation_id":"ae1a09a8-1962-4d48-a8aa-019755f1e3df","resolution":{"observed_at":"2026-08-06T18:27:47.204582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.208713Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.208713Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:9aeb5951d5a5cff6592fed08cd68046ef4b019473f081d84747d05708c3ed176","observation_id":"fbef7d83-68a3-4d39-aaeb-6e6f10e51d9c","resolution":{"observed_at":"2026-08-06T18:27:47.208713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.212991Z","title":"Efficiently scaling transformer inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.212991Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:4b9337e044852a158fb5b81d11783c207a9c7e4262e6251292a1cbb11edf0915","observation_id":"c553cb0d-8a20-4659-9ea2-1ba1c4a0a9f7","resolution":{"observed_at":"2026-08-06T18:27:47.212991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.847887Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"cf606901-8a15-443a-928e-a18c22960164","year":2020},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.217153Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0177e5175a70925844b985e791d6491f2bdaaf950b876d57532c85deeffa2b69","observation_id":"5a4c514e-fda3-44e4-acaf-7f7137416859","resolution":{"observed_at":"2026-08-06T18:27:47.920034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.774550Z","title":"Modality- consistent prompt tuning with optimal transport,","venue":null,"work_id":"c486d9db-89b1-49b9-bc17-a30ee469493a","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.222518Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:803c623d10dc0c67a5d0961603d2d44f4dc113f716038ae106d3af13174b6717","observation_id":"934244d5-50ea-42da-a768-6dbe291ce291","resolution":{"observed_at":"2026-08-06T18:27:47.791480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.751146Z","title":"Hierarchy- aware interactive prompt learning for few-shot classification,","venue":null,"work_id":"aa9d239a-8ace-4547-bdd8-85148ef92eab","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.226756Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:4983e0cf2f74cf4bf2e22395c80cffeb695d434ded47b9fb43d7caad14b88e3a","observation_id":"c1c080de-e9d9-4f7d-8580-e4b6fec02d7c","resolution":{"observed_at":"2026-08-06T18:27:47.761692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.727805Z","title":"Language-driven visual consensus for zero-shot semantic segmentation,","venue":null,"work_id":"0d6386f5-3d3b-4aa6-8ba4-5566d3e20312","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.232099Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:865cb7d942c007f2bdcd4715da9ac00b794317a5a9e37781331be2a9db6fbebe","observation_id":"b8cd94c3-82c5-4186-96e5-eb32b176a837","resolution":{"observed_at":"2026-08-06T18:27:47.737604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.699877Z","title":"Pedestrian attribute recognition via clip based prompt vision-language fusion,","venue":null,"work_id":"76f16607-ea6a-4c5d-a4a8-7e75ae9ff9e1","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.236731Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:f32b0bb539b61cfe97c1f8d890cc705fb865b4d6ca9d69a244cb1816640227dc","observation_id":"0626ab68-3e72-4287-8bd3-3356f62aaa44","resolution":{"observed_at":"2026-08-06T18:27:47.711586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.240681Z","title":"Understanding and mitigating overfitting in prompt tuning for vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.240681Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:07a61a315ba5f93a4df7409151cf9cd3d4a55c4194174b8d58f8ad7846d11d9e","observation_id":"d0247ef0-75df-4c82-9424-44f458c37556","resolution":{"observed_at":"2026-08-06T18:27:47.240681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.660861Z","title":"Clipood: Generalizing clip to out-of-distributions,","venue":null,"work_id":"35684cca-fa8b-4600-b7df-94955de41935","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.245370Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:40ff507417d8103e8b1b46e370ded564034b3e6872e9e795bad4ba1e105121cf","observation_id":"536fa8b1-0817-4ccd-873a-84eb3ba6cabb","resolution":{"observed_at":"2026-08-06T18:27:47.672562Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T12:40:28.487754Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":3,"verified_fuzzy":43},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2507.08410."}