{"as_of":"2026-08-14T07:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95b4278163e6d18a403fde31ef808be10a0b3815202c1c6d4d18eb5bf2a34a68","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:46:02.319525Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T04:46:34.946640Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T04:49:02.937990Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"cited_work":{"arxiv_id":"2506.23502","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23502","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm-enhanced action-aware multi-modal prompt tuning for image-text matching","venue":null,"work_id":"ea8655f8-1f5c-4100-b06a-295ea735e15e","year":2025},"citing_paper":{"arxiv_id":"2511.20162","last_updated":"2026-04-09T15:23:13Z","snapshot_observed_at":"2026-07-06T22:36:53.831174Z","submitted_at":"2025-11-25T10:38:41Z","title":"Action Without Interaction: Probing the Physical Foundations of Video LMMs via Contact-Release Detection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T04:46:34.946640Z"},"links":{"cited_paper":"/paper/2506.23502","citing_paper":"/paper/2511.20162"},"observation_digest":"sha256:04efe681a77fb8bc3f42e3b3a536934370c22020ae09f9a32a7018f479349db7","observation_id":"99e15fe9-6af7-4601-9aff-15c5c1ba243f","resolution":{"observed_at":"2026-05-17T04:49:02.940987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23502/citation-record","integrity":"/paper/2506.23502/integrity","json":"/paper/2506.23502/citation-record.json","paper":"/paper/2506.23502"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:11.205465Z","title":"Incorporating geo-diverse knowledge into prompting for increased geographical robustness in object recognition","venue":null,"work_id":"84d84f74-076a-48b8-bd24-0ac7b56c2f05","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.204051Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:8508891d07f7d48cee280389e20826339e328db68c7b423e41eca3d7f864cb94","observation_id":"f4e51e50-4dc3-49c3-ae30-6e3617a91fff","resolution":{"observed_at":"2026-08-06T21:46:11.326339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:10.993611Z","title":"Learning the best pooling strategy for visual semantic embedding","venue":null,"work_id":"ee479731-d575-4934-b325-2709992b182f","year":2021},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.252978Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:1b4a06f6d9df0c08f357d27ae6db0d2182efd39220e6bffb5f4cce45f882634b","observation_id":"c74f03bd-4c91-43f0-991b-d0ac68c1b878","resolution":{"observed_at":"2026-08-06T21:46:11.079672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:10.785788Z","title":"Large language models are visual reasoning coordinators.NeurIPS, pages 10–16, 2024","venue":null,"work_id":"d3a302f7-37be-41bf-8bf8-f1767879b98c","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.322328Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:35a1c2efb6acc3b9da732873713808a82fa3d27ff912d860628e56f8c60c4af4","observation_id":"9652da36-73e0-41f2-a322-e5c10925e01e","resolution":{"observed_at":"2026-08-06T21:46:10.883779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T21:45:58.361450Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.361450Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:54ee283e6980e4244e0c428432383ec2dbd9713b3d09def067fb731e6a4042f7","observation_id":"ea30dcd6-f499-4062-91a9-6da3efc4fa07","resolution":{"observed_at":"2026-08-06T21:45:58.361450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:10.655422Z","title":"Cross-modal graph matching network for image- text retrieval.TOMM, 18(4):1–23, 2022","venue":null,"work_id":"5f6df13b-b285-47e9-9a51-28c69430274b","year":2022},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.450649Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:7f426dfbd5e67fa7ee839ed11521c31aa7006ef7ad84b505c760eb43cd43ca6b","observation_id":"77d9e395-835c-4803-a5cc-711754ad2412","resolution":{"observed_at":"2026-08-06T21:46:10.698382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:10.483027Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":"697a2c05-a622-4ad4-9551-2c154ba82a7e","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.532573Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:7c7fa8935866c25f06a3eb11b008c19998f8dfa16d5c8b24a63f31c446bfb6d1","observation_id":"b2a6fbbc-57a4-43f6-a773-5ec29fdd347f","resolution":{"observed_at":"2026-08-06T21:46:10.582949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:10.383135Z","title":"Sim- ilarity reasoning and filtration for image-text matching","venue":null,"work_id":"e792d7d4-0ce2-4648-9fb4-c6383eff8c92","year":2021},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.566838Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:f124e69ce832b20dcee39de920299728bf88829b0a62609eb090b84301a315c2","observation_id":"f8701963-6001-43a5-a0c7-04f1a90cf92e","resolution":{"observed_at":"2026-08-06T21:46:10.437714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:10.182244Z","title":"Fleet, Jamie Ryan Kiros, and Sanja Fidler","venue":null,"work_id":"393d8e3c-7f1c-4ea2-a443-b16d30197db1","year":2018},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.636191Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:f15db876b0f2a39d5566a34130440c8a8085eb18d2962b92f29847d3efb93d6f","observation_id":"351997d4-cfa6-4159-8360-6514f64e8570","resolution":{"observed_at":"2026-08-06T21:46:10.289170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:10.006984Z","title":"Learning semantic relationship among instances for image- text matching","venue":null,"work_id":"bca2d6d5-582e-4cae-b0d6-e279170f88e7","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.705862Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:a90dde35e09be8d8eee924a817594d1ae3a61a2516d38e88d2e1aaf2c372b416","observation_id":"095d7716-b2e3-4634-bb8a-5ea1bdb37e31","resolution":{"observed_at":"2026-08-06T21:46:10.097973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:09.836164Z","title":"Pyramidclip: Hierarchi- cal feature alignment for vision-language model pretraining","venue":null,"work_id":"4a8f06d0-f1a3-4db9-ad86-fa5c425675ef","year":2022},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.790852Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:9adaa82719fbe3cca17ffae709bbf7eadf451f36f1f1b91283c16e80aa71ab5d","observation_id":"e664c977-85da-4a1a-a165-cdcda54adc90","resolution":{"observed_at":"2026-08-06T21:46:09.926777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:09.611438Z","title":"Cross-modal semantic enhanced interaction for image-sentence retrieval","venue":null,"work_id":"c54e7f29-2907-48e2-8e67-dc871239e0bc","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.898987Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:e831632ae6dc4e8a97b286c36fe74897d33811977ee44573b18192b6620880d6","observation_id":"dee985aa-e72f-41c5-9cae-5522cf82d76d","resolution":{"observed_at":"2026-08-06T21:46:09.708912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:09.452718Z","title":"Hiclip: Contrastive language-image pre- training with hierarchy-aware attention","venue":null,"work_id":"9116876f-c6b8-4467-9df7-87f18b8f185a","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:58.985185Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:8f81a80e89285c8121d383a89b0b2eacedb809e978ea2933e2537f7de5cd857d","observation_id":"b42cf75e-bdf4-481f-bd3a-d4dd5c018bdc","resolution":{"observed_at":"2026-08-06T21:46:09.527887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:09.318938Z","title":"From im- ages to textual prompts: Zero-shot visual question answering with frozen large language models","venue":null,"work_id":"f556e19c-47fe-4a36-99c7-abd4ff87c046","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.056867Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:4ab02eeb94327207b409ebca6ff5afb2be6ea1ca707b3736951caa6651b33a33","observation_id":"b1934b8d-98d5-4a57-bcd2-32ae4b06f868","resolution":{"observed_at":"2026-08-06T21:46:09.381531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:09.191012Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":"dd925fc3-d2ce-4935-b4e8-28553a242a10","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.127145Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:84885ca8109b6d2f7f6afa30d2056e9627f1c7ecccfa249e347efa587d636781","observation_id":"e5f97260-9444-42ce-a1fb-844f1d922875","resolution":{"observed_at":"2026-08-06T21:46:09.245934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:08.998494Z","title":"Structure-clip: Towards scene graph knowledge to enhance multi-modal structured representa- tions","venue":null,"work_id":"986eac0a-edad-45f6-95b9-4fb77aa1b731","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.196134Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:f992ce2a8ee461a3a8e6b3591b4d0d0fabe44927dcebfbf1b6764d7e45221fee","observation_id":"3231f3df-5b52-4677-a74f-d088b652f9e4","resolution":{"observed_at":"2026-08-06T21:46:09.059318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:08.877736Z","title":"Fineclip: Self-distilled region-based clip for better fine-grained under- standing","venue":null,"work_id":"4d076b31-8ff8-440b-8173-e981fee60270","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.266266Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:5d4eb5362d6fba17d9425145e1e7501e2764f7ce1f8bb3ac1fda79fbf918eefc","observation_id":"2309f4f4-fa2c-41ed-b325-866efec1c4a0","resolution":{"observed_at":"2026-08-06T21:46:08.957054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:08.717658Z","title":"Knowledge-aware prompt tun- ing for generalizable vision-language models","venue":null,"work_id":"457cfe9a-41cd-41cb-b2e9-ab5b0f40bec3","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.389988Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:3fc2f096cc6e7727c4a7aeaf0b21feb49babd2d4f9f37d0d3f895da3f8b3be67","observation_id":"0c33dae3-0e7e-4537-b57b-8138ce59554b","resolution":{"observed_at":"2026-08-06T21:46:08.801890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:08.560381Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"ed7c10db-2f16-4719-8222-c02fca4836d4","year":null},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.431964Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:8b30962ab343fa2281c1785889c4cde023d90bb3d7bd077838784a1fc081d33b","observation_id":"8ae628f9-cb49-4137-9e6e-ec1174499752","resolution":{"observed_at":"2026-08-06T21:46:08.621773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:08.439714Z","title":"Stacked cross attention for image-text matching","venue":null,"work_id":"25543cbe-adf6-4a87-afa3-838570847c0f","year":2018},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.503349Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:843e7ae4717abdbcaf74a64543983b36aabc0d39367c67b5bef25c9d9c7e7e2d","observation_id":"37eeb6a9-2b61-4b18-b572-09e88fe4e44e","resolution":{"observed_at":"2026-08-06T21:46:08.493167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:08.348674Z","title":"Action-aware em- bedding enhancement for image-text retrieval","venue":null,"work_id":"5ad7fa64-969e-4cb4-ae06-dce28d67b0bc","year":2022},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.578340Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:ef02524b68e1b5ba9992d285187c817e72b511ad76d322ed1ffe0e897e1c15b5","observation_id":"66a2902f-4696-492e-a048-c47e39ade055","resolution":{"observed_at":"2026-08-06T21:46:08.391733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:08.230661Z","title":"Learning background prompts to dis- cover implicit knowledge for open vocabulary object detec- tion","venue":null,"work_id":"0bee8864-7899-4b25-9710-04ebc630c2c7","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.664580Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:87393b3885e709d470b03ca1fa821f0063dc028ffdf2daed5902922241fa9dd3","observation_id":"2e7a3d5f-46e1-487c-a0af-9296832a10e9","resolution":{"observed_at":"2026-08-06T21:46:08.296908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:08.064862Z","title":"Cross- modal alternating learning with task-aware representations for continual learning.TMM, 2023","venue":null,"work_id":"6e9e11d3-b749-4ca8-81f2-b76fb2403f4e","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.724477Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:2af3e37b80e5411e84bb2efb320c9afdfdc7e6ff6139e140383f4c4bc252dbe0","observation_id":"54680ab0-30df-4504-99de-ff27fa414cb2","resolution":{"observed_at":"2026-08-06T21:46:08.134264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:07.937020Z","title":"Image-text bidirectional learning network based cross-modal retrieval","venue":null,"work_id":"48a253f8-7904-4c42-8220-dd69a6a5f53e","year":2022},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.808291Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:e87af569c2b456e64db60eb4adae3acefd30759f4c18b16f4f781c2ec0e9afa8","observation_id":"1abbc369-b536-41d1-8579-bc551a8d61ea","resolution":{"observed_at":"2026-08-06T21:46:07.992070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:07.829685Z","title":"Learning customized visual models with retrieval-augmented knowledge","venue":null,"work_id":"bc2b0b6a-578a-4de7-8f16-da8e10303187","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.897619Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:9c99683fed853c5ae023f9cc6411f1923d94141668e73b9dcf3b6dad88aa16b8","observation_id":"85adc5a4-ee2a-49da-af69-1ad9ebcfc1f7","resolution":{"observed_at":"2026-08-06T21:46:07.878180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:07.776130Z","title":"Multi-modal attribute prompting for vision-language models.TCSVT, 2024","venue":null,"work_id":"f719a267-6bdd-48f5-85f9-39f0288f8ac8","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:45:59.975439Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:a2116d56798b871d6a17564f99f23bbd8cbd532cfcf9ed9cf79ec484cb6611a0","observation_id":"0cce8655-cbc3-4550-86c7-124630b1c125","resolution":{"observed_at":"2026-08-06T21:46:07.818852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:07.642094Z","title":"Fine-grained visual– text prompt-driven self-training for open-vocabulary object detection.TNNLS, pages 1–11, 2023","venue":null,"work_id":"48795768-e9b7-44b7-af8c-c9416179d74d","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.077299Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:7600a4f5aaf5d5de6597412d4ab9ed6dfa32370cc89fcac0660e23c7fc7c8d90","observation_id":"71ccba72-23ac-486c-93f6-c97ae5125f4b","resolution":{"observed_at":"2026-08-06T21:46:07.698542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:07.459809Z","title":"Visual classification via description from large language models","venue":null,"work_id":"4280709e-c43e-4b06-972f-e596763dee86","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.144303Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:80f98930584df9f6b136100c85a25b90ad459924c19a433d3e02ae347c38cdda","observation_id":"216fa119-48a1-4cea-943f-eef01ebd306f","resolution":{"observed_at":"2026-08-06T21:46:07.545899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:07.305086Z","title":"SCHEMA: state changes matter for procedure planning in instructional videos","venue":null,"work_id":"7979f840-0139-49bb-9b0b-6f7c01eec9c0","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.199420Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:03c8fb52454015eb15078479876f425a8ef614cf61129b5e906fb05ff7121f08","observation_id":"f7bfca97-fb79-4275-8ad4-e8578c7cb3fd","resolution":{"observed_at":"2026-08-06T21:46:07.369802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:07.137900Z","title":"Teaching clip to count to ten","venue":null,"work_id":"78f4946f-3eee-49b7-9ef8-531230666cae","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.285075Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:fb0cbf53ece363c09498f6b21bd1689ea76d329c8aeb46de292eedb07e9e7110","observation_id":"492369ea-3c73-4552-ae31-4dc7e546eac7","resolution":{"observed_at":"2026-08-06T21:46:07.239545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:06.975967Z","title":"Fine-grained image-text matching by cross-modal hard aligning network","venue":null,"work_id":"8347f7e3-004a-4366-99ef-8e47f19be4d3","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.354666Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:e713aa724d047300ed13644bc559e643951abce0ce514c761b8d12d249eecbc4","observation_id":"1a958523-11f2-4aac-9de5-3c11cf5486b2","resolution":{"observed_at":"2026-08-06T21:46:07.051157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:06.811322Z","title":"Dynamic modality interaction modeling for image-text retrieval","venue":null,"work_id":"f09f6f96-c4ea-446d-be0c-73e5095571f8","year":2021},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.412406Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:210a5fe59184bd6f69c1b3dc34e529147f755c1399fa23a5da8d2bdd1df2b04d","observation_id":"3d500885-10b2-4dfe-83df-900a3002a46d","resolution":{"observed_at":"2026-08-06T21:46:06.880385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:06.464099Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"892e52f1-6232-4b49-98ca-d8fcf2f37a4c","year":2021},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.509155Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:e2494a7cce94a936981879eee8778f6ae07f9f567afb2655a92e1ec6e156d16b","observation_id":"784facf2-5037-4c1f-8ffa-229826f8e16a","resolution":{"observed_at":"2026-08-06T21:46:06.607635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:06.260792Z","title":"Vlc-bert: Visual question answering with contextualized commonsense knowledge","venue":null,"work_id":"7b198b30-dc77-455a-8e94-31078e9aba9a","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.576317Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:19a605419e2e1aafaa086337e8c3a92cbb035f6531f89250356bb0912bc43b5c","observation_id":"df139403-5b87-4590-aef3-278e5f8cfb7a","resolution":{"observed_at":"2026-08-06T21:46:06.368510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:06.053606Z","title":"Language models are causal knowledge ex- tractors for zero-shot video question answering","venue":null,"work_id":"a8d38ac3-a130-43b7-9e03-7dcbfdf8e5e7","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.647825Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:a3d47e5efc1294be78669e181bfa0ecd6c55238af407f5b13d7b9627b1dff809","observation_id":"6fec0c54-161a-4dde-ad96-fec20fb6ce54","resolution":{"observed_at":"2026-08-06T21:46:06.147358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T21:46:00.728702Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.728702Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:d03f59b7e6502bae151c88f9322d287b837362c36d2348e9ddb811ad0afe4f1a","observation_id":"97d650ee-0f8e-49fa-b45a-415ff64f2dc8","resolution":{"observed_at":"2026-08-06T21:46:00.728702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:05.732060Z","title":"Compound text-guided prompt tuning via image-adaptive cues","venue":null,"work_id":"37809e3b-7b3d-4460-a9bd-a1f2f553b756","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.814075Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:299915285b4352358bde23338f68935f8092001a18e102d907e2c06fa2bc6e42","observation_id":"306a3b8e-e638-4a3f-873f-ffc8c008123b","resolution":{"observed_at":"2026-08-06T21:46:05.899299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:05.488861Z","title":"Multi-granularity cross-modal align- ment for generalized medical visual representation learning","venue":null,"work_id":"b1b64107-9ba4-476e-9986-4e3ad754d717","year":2022},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:00.916739Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:0ac01200af62bdfba6fa41d5e130b9a935af88eb4dc5481baa7dcb6d10684f9f","observation_id":"683ec262-ffed-4b1b-b9f8-1ba75477c251","resolution":{"observed_at":"2026-08-06T21:46:05.612801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:05.236515Z","title":"Consensus-aware visual-semantic embedding for image- text matching","venue":null,"work_id":"eb084218-8538-42b4-81b8-ec56de2a0390","year":2020},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.008060Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:021a8a48cef7a6472ac6a47851e7cb95fda2176eaa2499429ae73cda9b457252","observation_id":"e7505452-b647-4910-8541-9e75740df224","resolution":{"observed_at":"2026-08-06T21:46:05.284410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:05.001302Z","title":"Vilt- clip: Video and language tuning clip with multimodal prompt learning and scenario-guided optimization","venue":null,"work_id":"cdc25823-da4c-408a-9fe6-5cc29615443f","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.109203Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:76470fc00fe9a19da9d15c385217e7ec60abf1b4e42b1a9991fc16ab3f9fc747","observation_id":"106832fd-dd91-4d87-98f0-f50eb4dd2bb8","resolution":{"observed_at":"2026-08-06T21:46:05.104822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:04.815724Z","title":"Position-guided text prompt for vision-language pre- training","venue":null,"work_id":"284bcb96-3684-4847-baef-bf7b35d813cb","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.194101Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:03fa915ad785c71a1975beaf30ca6ae0d64c3ca36c91be8d566f67fe9a54a3bd","observation_id":"ce17a852-6b73-4383-837c-9ee1589a4735","resolution":{"observed_at":"2026-08-06T21:46:04.878349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-13T18:09:42.014649Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T21:46:01.269123Z","title":"Actionclip: A new paradigm for video action recognition.arXiv preprint arXiv:2109.08472, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.269123Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:4e2b9a0296e49c3feee4339b59d5f6b3ecccb15128fc79e58614c5d5d0bf5b2a","observation_id":"4e85078f-a7d3-4f7d-9755-7bc0e018c68a","resolution":{"observed_at":"2026-08-06T21:46:01.269123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:04.664766Z","title":"Cross-modal scene graph matching for relationship-aware image-text retrieval","venue":null,"work_id":"ad78111e-8edb-4bb3-8236-6f12cdf223ab","year":2020},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.316475Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:00bf1ba52d33567db5d2131201d1033baff99abe077c62654eedc5116efecf2f","observation_id":"6e788e16-0286-4999-b93e-6f5467d83c86","resolution":{"observed_at":"2026-08-06T21:46:04.742902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:04.518496Z","title":"Diffusion feedback helps clip see better","venue":null,"work_id":"5172a53f-5e06-48c8-809f-2d0b284190ca","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.407864Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:d68939b70c656a2c185ba344c891a3c269227a7f4af0dec2aa435a043f9975a5","observation_id":"69cc5f4b-da85-4fc3-9195-af6880442ea6","resolution":{"observed_at":"2026-08-06T21:46:04.591379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:04.361625Z","title":"Balance act: Mitigat- ing hubness in cross-modal retrieval with query and gallery banks","venue":null,"work_id":"58ad2d5c-5cb6-4086-bc2d-aee1d405b8d5","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.486247Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:9a5f16793822aba087e7900736f7452f210756be33dc13ae9e839247e65927ca","observation_id":"c6b2526c-d082-4833-896e-56fb0d19f469","resolution":{"observed_at":"2026-08-06T21:46:04.426824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:04.188437Z","title":"Learning hierarchical prompt with structured linguistic knowledge for vision-language models","venue":null,"work_id":"2af7fef9-6808-4459-b8b6-f01c91849918","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.539766Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:ee67063c9e03c54f09f9a953c6651c1c60ad1a549d8c7e7cd7d514d38215e7db","observation_id":"a085f20a-3d6a-4c66-95a4-c2e1911b43d8","resolution":{"observed_at":"2026-08-06T21:46:04.270094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:04.028881Z","title":"Multi-view inter-modality representation with progressive fusion for image-text matching.Neurocomputing, 535:1–12, 2023","venue":null,"work_id":"0cc33d86-5804-4d72-a3a2-6c38db807629","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.607195Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:96d52b0906ded597aa4f572fd8fbcbb731ebf50135d1d3049a49c9acace19344","observation_id":"5b308134-caa9-4bed-893e-e343532fe2b1","resolution":{"observed_at":"2026-08-06T21:46:04.098062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:03.845458Z","title":"Saco loss: Sample-wise affinity con- sistency for vision-language pre-training","venue":null,"work_id":"84da7f2f-7158-4bc4-a8ad-80d3b5ec51e0","year":2024},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.685643Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:2f1407547a846794b9601a1f6768e0e62cc5fb59378acba955ae3921d5c99f7d","observation_id":"fcd561d1-4d2e-4a45-9c47-0713da403415","resolution":{"observed_at":"2026-08-06T21:46:03.952171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:03.549568Z","title":"Visual- language prompt tuning with knowledge-guided context op- timization","venue":null,"work_id":"b1abcb0e-60cb-4f33-915b-92fd3067e4b4","year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.734901Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:130c5e759918455758d5ea5e15629740c4247e88ea42f028c75e4a31d7b786e8","observation_id":"27802d92-26da-4d5c-a7a2-ada570d0ec48","resolution":{"observed_at":"2026-08-06T21:46:03.712784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:03.262879Z","title":"FILIP: fine-grained interactive language-image pre-training","venue":null,"work_id":"30af4890-ec2d-4ab5-943d-2a3c72271103","year":2022},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.784837Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:b29392b0a30c0b2a6eeb9bdee0721f3295c039f4003067557775f52d8931e5dd","observation_id":"5c60afda-21e5-4646-838d-6aa3ccc5a0ee","resolution":{"observed_at":"2026-08-06T21:46:03.389697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:02.989116Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions.TACL, 2:67–78, 2014","venue":null,"work_id":"775574d3-1628-4e12-98e5-5df81d5e4277","year":2014},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.848329Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:4ff625960ac685cc1c3bfcff0a8f143c2d7dee6e94acf3ffb678124b1906845c","observation_id":"ffffa9ae-697c-4519-8c11-e33500c03a49","resolution":{"observed_at":"2026-08-06T21:46:03.122250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:02.815139Z","title":"Dual-path convolutional image-text embeddings with instance loss.TOMM, 16(2): 1–23, 2020","venue":null,"work_id":"d3f166b7-5001-41f1-9897-f72c08ab8add","year":2020},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.927793Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:ac4831d4ed7caa8e8b1b5f8960b3fd8862b236838952f64a7033f8a2e21dd08d","observation_id":"e0c6aea0-a122-448b-a748-51b057bff30b","resolution":{"observed_at":"2026-08-06T21:46:02.907213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04076","last_updated":"2024-04-02T21:47:35Z","snapshot_observed_at":"2026-08-13T05:08:11.995586Z","submitted_at":"2023-12-07T06:43:34Z","title":"Large Language Models are Good Prompt Learners for Low-Shot Image Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04076","snapshot_observed_at":"2026-08-06T21:46:02.007187Z","title":"Large language models are good prompt learners for low-shot image classification.arXiv preprint arXiv:2312.04076, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:02.007187Z"},"links":{"cited_paper":"/paper/2312.04076","citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:6883d4a4220f6726a82d7f67c00dd7f61fb26f5766da9b3fe01f61799a89a695","observation_id":"dde1ff41-5a67-4728-82f1-f784c595b202","resolution":{"observed_at":"2026-08-06T21:46:02.007187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:02.742041Z","title":"Regionclip: Region-based language- image pretraining","venue":null,"work_id":"ed5c5b5f-56c7-438f-9482-337f52c17f4c","year":2022},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:02.083073Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:5c537627c8ad5c1cbc185885ffae79cfb4c4c697ad9f4755ec47a2c65c001fcd","observation_id":"b13f4e3d-710c-4d46-b2bd-61e6ae75c0fe","resolution":{"observed_at":"2026-08-06T21:46:02.807417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:02.618262Z","title":"Relclip: Adapting language- image pretraining for visual relationship detection via rela- tional contrastive learning","venue":null,"work_id":"ce03b2cd-1962-4c2b-96e4-0f911891ea85","year":null},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:02.167435Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:91ce9755dcf51e328e37f3a82d62607e07df908b92e335d73864287211f9a98d","observation_id":"15d59c97-d7a3-4b17-b0ac-37ee4fb5d7bf","resolution":{"observed_at":"2026-08-06T21:46:02.679618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:02.426506Z","title":"w/o ac- tion knowledge","venue":null,"work_id":"1962f01a-3b50-4968-9b2e-76cca7aea986","year":null},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":336,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:02.319525Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:781e02c190d508cdb9729379b3106640792c8c25a095444c7c6433036eaca429","observation_id":"757f26c7-3387-439a-ba94-4b7b9d7a6fe0","resolution":{"observed_at":"2026-08-06T21:46:02.464676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:46:02.511100Z","title":"Datasets Details Flickr30K[50] dataset contains 31,000 images collected from the Flickr website","venue":null,"work_id":"2e46dd66-e0bb-41ab-8549-32158a85e3e1","year":null},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:02.237082Z"},"links":{"citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:f5237ac77ce677cf4ab6bae6252d27a9b9a4fc1f179e94a7ebf0725247a058ad","observation_id":"7d955b46-826e-4e4d-821c-5930fc88c276","resolution":{"observed_at":"2026-08-06T21:46:02.578898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:19:01.143620Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":52},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2506.23502."}