{"as_of":"2026-08-18T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:150f97518818bea019380bfaab9c4a995f8c71400096ec3538ef143bda75dfdf","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:32:53.746199Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T05:52:20.768497Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:05:41.146631Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":"2504.17990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17990","snapshot_observed_at":"2026-07-01T10:05:41.146631Z","title":null,"venue":null,"work_id":"1a80741f-9378-41cc-8ed2-c6751c220d1d","year":2025},"citing_paper":{"arxiv_id":"2606.31222","last_updated":"2026-06-30T07:04:05Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:04:05Z","title":"Thinking Before Retrieving: Robust Zero-Shot Composed Image Retrieval via Strategic Planning and Self-Criticism","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-01T05:52:20.768497Z"},"links":{"cited_paper":"/paper/2504.17990","citing_paper":"/paper/2606.31222"},"observation_digest":"sha256:6d484eabd01f6d9c6297dfbe2a1a89170d19a77af20d35ea06f32c1cd6028ffa","observation_id":"d0abb623-5c05-41f3-836d-9538536a9a9b","resolution":{"observed_at":"2026-07-01T10:05:41.148243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.17990/citation-record","integrity":"/paper/2504.17990/integrity","json":"/paper/2504.17990/citation-record.json","paper":"/paper/2504.17990"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.468479Z","title":"Cross-domain diffusion with progressive alignment for efficient adaptive retrieval,","venue":null,"work_id":"87c170eb-f7f3-4db9-ba64-bd64b6248158","year":2025},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.564218Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:220cf07ff586473398a18b6ad37f219036c1ab079ee6419515dde8bb12276864","observation_id":"810d838a-9392-4c79-a719-e7b46ccbfaf1","resolution":{"observed_at":"2026-08-16T10:32:54.473230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.569154Z","title":"Dual-view curricular optimal transport for cross-lingual cross-modal retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.569154Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:c035198daa7c3d22872577fd4f44c737d44907bbf471e8527387d35a0c091daf","observation_id":"900791ef-d932-43fd-a3ea-c0dd3b54c983","resolution":{"observed_at":"2026-08-16T10:32:53.569154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.443996Z","title":"Reading-strategy inspired visual representation learning for text-to- video retrieval,","venue":null,"work_id":"7e98fa1b-514b-48ca-a221-184c0a50b7bd","year":2022},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.573591Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:3bf5aa969f92ec46faf0c2ac425e08978fe081706ed6807cbaaef1bb0410fbbc","observation_id":"188fa890-4060-4416-9f27-ab9669b74989","resolution":{"observed_at":"2026-08-16T10:32:54.448806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.428308Z","title":"Semantics disentangling for cross-modal retrieval,","venue":null,"work_id":"491b0ffa-c4ae-405b-9c11-11c6cbde6e19","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.577981Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:b3c236f7ad634fb999908c9448a480791a489a3e6e8be9d2a9667d25d8100f16","observation_id":"e2dd37f9-b44d-4bb2-8ada-4aa7614a9ce2","resolution":{"observed_at":"2026-08-16T10:32:54.433283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.412973Z","title":"Cross-modal retrieval with noisy correspondence via consistency refining and mining,","venue":null,"work_id":"048eb692-1671-48d5-9431-00dc3b1c8d0d","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.582720Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:664625abd11cdae5cb620eb55921a5d92ac7bd085bc5b5ab42b0eb2e941d24a5","observation_id":"cade58d0-11c8-4d04-84e1-8b7550be136e","resolution":{"observed_at":"2026-08-16T10:32:54.417489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.397955Z","title":"Efficient token-guided image-text retrieval with consistent multimodal contrastive training,","venue":null,"work_id":"3cb4f42e-a593-4e92-aed1-6bf4b753f8db","year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.586957Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:f167051e0c3cf5a980e7128adb2a1ea636903526a4642892a39b5f7baf7fba65","observation_id":"d044af83-bbe3-4213-b8fb-2e0a75607c84","resolution":{"observed_at":"2026-08-16T10:32:54.402758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.384074Z","title":"Target-guided com- posed image retrieval,","venue":null,"work_id":"7af277b4-6442-4b18-8a06-1e5e86b800c3","year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.591566Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:ca6a817e74c60806291880d25d35ce349ff6cec4bc442085bc17ff4d9e1cb9ca","observation_id":"fb8bc878-84ab-4676-80c0-b828f9bf6d31","resolution":{"observed_at":"2026-08-16T10:32:54.388555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.370087Z","title":"Dynamic weighted combiner for mixed-modal image retrieval,","venue":null,"work_id":"7aef1e64-733c-4105-84f1-786eda515c8a","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.595865Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:eac96ab324355a6960031cc7015e497d000e3f96f6db87e09704dc0ddc53b84b","observation_id":"66bb14a4-562e-412f-87fd-70a181feb114","resolution":{"observed_at":"2026-08-16T10:32:54.374357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.356042Z","title":"Covr: Learning composed video retrieval from web video captions,","venue":null,"work_id":"deb41042-c868-4342-9b69-4207592ee98a","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.599895Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:34f5e300fe73e244c52d6d57e6f0438cfa71b052ec1996f871502f59e79c43fe","observation_id":"8da27648-a772-402e-ba4a-56e680c31c4b","resolution":{"observed_at":"2026-08-16T10:32:54.360840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.604042Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- tioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.604042Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:a6cf0b31019284ab372f0eb870c46e8e22393417e2c4780c8aca5e255c8e0ec0","observation_id":"1e7dcf7e-f13c-42e0-b60c-58a0f97b03c5","resolution":{"observed_at":"2026-08-16T10:32:53.604042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.333146Z","title":"Pic2word: Mapping pictures to words for zero-shot com- posed image retrieval,","venue":null,"work_id":"f50ab94c-6d18-42d7-97ea-84e3ccac3c42","year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.608382Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:a88e527c1075d9a735c8dff2a24ca7f34d2574254ab2691e7821ef11870e1552","observation_id":"71e31679-5d02-49db-a7fc-2d11ce09277b","resolution":{"observed_at":"2026-08-16T10:32:54.337583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.319182Z","title":"Context- i2w: Mapping images to context-dependent words for accurate zero-shot composed image retrieval,","venue":null,"work_id":"2c67b2b6-eaba-4dc0-9d8a-c9aaaa6c0576","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.612877Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:c7656a9bb9bc3bd2c86a432c603061ac191a1a73dccc0038e5d39c6d82ff9147","observation_id":"9024f8a6-e650-448f-abeb-6ff0e7460c2b","resolution":{"observed_at":"2026-08-16T10:32:54.323600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.305560Z","title":"Language-only training of zero-shot composed image retrieval,","venue":null,"work_id":"b6eccdf3-8b14-4549-9a48-6a1677ae5cfa","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.616951Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:fe1372da7f0099c50e0db13c2709157bb276e10ecb1337bd1c6d6861d1ea6e05","observation_id":"4aaf62d9-b8d2-4b1f-ad36-9337d8d45024","resolution":{"observed_at":"2026-08-16T10:32:54.310032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05795","last_updated":"2024-07-09T03:44:55Z","snapshot_observed_at":"2026-08-16T13:36:14.148568Z","submitted_at":"2024-07-08T09:55:36Z","title":"HyCIR: Boosting Zero-Shot Composed Image Retrieval with Synthetic Labels","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05795","snapshot_observed_at":"2026-08-16T10:32:53.622110Z","title":"Hycir: Boosting zero- shot composed image retrieval with synthetic labels,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.622110Z"},"links":{"cited_paper":"/paper/2407.05795","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:e94fd4a4494daa3d38870ca58c2270972ef515a60edab51a1a06cdb85e039c55","observation_id":"2c0537ca-5d03-478a-a2c7-7763e8ff998d","resolution":{"observed_at":"2026-08-16T10:32:53.622110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.626882Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.626882Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:3de77c35dc5bff29a3f3845fcb11041027c0b63302e8846066fe07bb9672102d","observation_id":"530a876f-7956-46ec-aae7-c43eda185dee","resolution":{"observed_at":"2026-08-16T10:32:53.626882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01431","last_updated":"2024-03-03T07:58:03Z","snapshot_observed_at":"2026-08-16T14:13:23.158828Z","submitted_at":"2024-03-03T07:58:03Z","title":"Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01431","snapshot_observed_at":"2026-08-16T10:32:53.630976Z","title":"Image2sentence based asymmetrical zero-shot composed image retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.630976Z"},"links":{"cited_paper":"/paper/2403.01431","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:dce967f45821dec1bda8da263c38d1bcd1efefc1330c5e70fa35594a8d4f16fc","observation_id":"71617fd9-1927-4f85-a153-3624d85c1fc4","resolution":{"observed_at":"2026-08-16T10:32:53.630976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.283019Z","title":"Spherical linear interpolation and text-anchoring for zero-shot composed image retrieval,","venue":null,"work_id":"7370c731-d5a6-4381-961e-c4b372001cad","year":2025},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.635310Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:527e0455c83984def56aad67801e5b894093a0a4c7968c448389806f86ae9b6e","observation_id":"50c95646-129d-40fd-a0ac-31541893992b","resolution":{"observed_at":"2026-08-16T10:32:54.287521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.269238Z","title":"Compodiff: Versatile composed image retrieval with latent diffusion,","venue":null,"work_id":"7f59e465-8290-4c33-accd-869c8a2d9fd5","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.639558Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:f058bc8832fb84d34248741803b982b5bc757307b0495afac51f14c765fc3cb0","observation_id":"cbcd1caf-68cd-462a-8b8d-1fea0174064c","resolution":{"observed_at":"2026-08-16T10:32:54.273720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.255235Z","title":"Fine-grained textual inversion network for zero-shot composed image retrieval,","venue":null,"work_id":"108f07f8-e015-4269-8555-0842ea97e94e","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.644001Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:586a90a997491d684ed192eff8c1fc10bbff97ad13d80aa929a15c1e2fa64bfd","observation_id":"90f33e41-89bc-4d43-862f-f1a8c53321b9","resolution":{"observed_at":"2026-08-16T10:32:54.259884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09188","last_updated":"2025-03-18T04:06:55Z","snapshot_observed_at":"2026-08-16T13:43:18.869502Z","submitted_at":"2024-06-13T14:49:28Z","title":"An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09188","snapshot_observed_at":"2026-08-16T10:32:53.648312Z","title":"Reducing task discrepancy of text encoders for zero-shot composed image retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.648312Z"},"links":{"cited_paper":"/paper/2406.09188","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:8f52df7c853342dd6b1d27e322a6e59b0563dcf1a8242e2be34d131840cc70d8","observation_id":"dfcbe2b0-b51a-4a64-8942-231604fec4ef","resolution":{"observed_at":"2026-08-16T10:32:53.648312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.240179Z","title":"Fashion iq: A new dataset towards retrieving images by natural language feedback,","venue":null,"work_id":"2dd0ae64-0ba7-4ece-a866-9d9e38052364","year":2021},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.652765Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:3c48f15413e429b18d917c5618edf385d3cedb4baea82bec75ce495436d991da","observation_id":"a59e34b9-3e94-413c-acc7-67c4b4668255","resolution":{"observed_at":"2026-08-16T10:32:54.244884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.657072Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.657072Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:f2a4978d87018206677a388fcbadde77f1d6430076792f867ca5a81351131c87","observation_id":"38fc6c8c-45c0-46ec-a6c7-2baba7534467","resolution":{"observed_at":"2026-08-16T10:32:53.657072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.216468Z","title":"Zero-shot composed image retrieval with textual inversion,","venue":null,"work_id":"32ff23fb-21c3-4e2a-90b5-e7a44addefce","year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.661165Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:435b4f6b1f0c075ce7cf2ee061dc4dd5cf1702c14b19b51ec7bbce4179ce156a","observation_id":"029ba515-cb40-4df0-86b1-a8951ffad342","resolution":{"observed_at":"2026-08-16T10:32:54.221016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.202873Z","title":"Cross- lingual cross-modal retrieval with noise-robust learning,","venue":null,"work_id":"c7a6ba52-b5cb-43a5-be03-ee4d3c86655a","year":2022},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.665396Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:3da991e012dea3e744062d78c00338a9ce0b7259f345d8fef62ef44b4eb4097f","observation_id":"77451e9e-9a5e-4a50-b0e3-c634c8f6de0e","resolution":{"observed_at":"2026-08-16T10:32:54.207201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.189097Z","title":"Cl2cm: Improving cross- lingual cross-modal retrieval via cross-lingual knowledge transfer,","venue":null,"work_id":"7ca8d362-8d53-4375-ab6c-b609dbc3fc50","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.669598Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:82eb81d457f7ff29a726d1f06a1727dcb7e157f8f43735d4282cff8f23b7c574","observation_id":"3a20d69b-1506-4e10-8e97-08a262979673","resolution":{"observed_at":"2026-08-16T10:32:54.193486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.174173Z","title":"Multimodal llm enhanced cross-lingual cross-modal retrieval,","venue":null,"work_id":"bc289d94-786e-4177-bfda-dd8e7437e58e","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.673586Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:4ed1331199508061e548fdf771cea22d221a60f53210c07a548d87414a068ec4","observation_id":"d8c1d1bd-24af-4f7b-ad83-1009b9c66f22","resolution":{"observed_at":"2026-08-16T10:32:54.178289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.161098Z","title":"Cross-lingual cross-modal retrieval with noise-robust fine- tuning,","venue":null,"work_id":"b1ea9dc7-0b0d-484a-a602-30e98e6ef2fa","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.677657Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:e23954914f3eb24b48328b580066ca599e05867ee15c17e1feff0ae858fb4c2c","observation_id":"40c29172-b9f5-434d-ba86-10dbfc591806","resolution":{"observed_at":"2026-08-16T10:32:54.165359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.147901Z","title":"Revealing security flaws in cross- modal retrieval models through video poisoning,","venue":null,"work_id":"c43c99ae-108b-4dbe-a867-0916ff0d3bb8","year":2025},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.682282Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:1ece40c216a6ff5da8736dcd812a3a51d3348c3027d942fc449878dca2376574","observation_id":"f26f2422-d3fa-4b75-84a2-00df27f5850f","resolution":{"observed_at":"2026-08-16T10:32:54.152422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.134656Z","title":"Deep reversible consistency learning for cross-modal retrieval,","venue":null,"work_id":"c49b6a57-8ca6-4460-b64a-286306970b3e","year":2025},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.686436Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:670256f6d260c15c0b1675064fcb64ef236cf1ae382a6feada2f3382a5e11045","observation_id":"9d2ca54f-ac32-4279-8c5c-5872dcd8501d","resolution":{"observed_at":"2026-08-16T10:32:54.139101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.121266Z","title":"A large cross-modal video retrieval dataset with reading comprehension,","venue":null,"work_id":"74e8482e-3bae-42a5-beca-bb4622e3a3fb","year":2025},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.690431Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:350e43e0696f4080db138819e97902f089d02880d8c17ac2fa90201fc746db72","observation_id":"93e295e7-c44b-478b-8c76-8af13739ab0c","resolution":{"observed_at":"2026-08-16T10:32:54.125605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.107624Z","title":"Sda: Semantic discrepancy alignment for text-conditioned image retrieval,","venue":null,"work_id":"ef750b8b-77dd-4fbe-bb64-501c7a757692","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.694328Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:d5b164001851667941c4e1cb0dcce904a839fdedd62e020db22da58bb4ae9901","observation_id":"d48959d4-5d72-4b30-bf96-43b3d1424bd2","resolution":{"observed_at":"2026-08-16T10:32:54.111916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.093558Z","title":"Improving composed image retrieval via contrastive learning with scaling positives and negatives,","venue":null,"work_id":"88464279-44e3-4d52-b549-dc7913439cdc","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.698322Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:21378f11bf600bc0eb9df5fe79c93dd5e1745a4ec8165577599da8d155b66ca1","observation_id":"08a645cd-5865-4f76-967a-d6c37408c8a9","resolution":{"observed_at":"2026-08-16T10:32:54.098240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.079449Z","title":"Progressive learning for image retrieval with hybrid-modality queries,","venue":null,"work_id":"b213be37-ac04-4469-aa93-6341dcb40646","year":2022},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.702635Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:b261a3c5810a1b0bd938f43c05903711e3da1a7c595e0961a2c16e6fd41d8b48","observation_id":"33748156-29d7-4d53-9ddb-2ff9ef08930a","resolution":{"observed_at":"2026-08-16T10:32:54.083975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.064823Z","title":"Conditioned and composed image retrieval combining and partially fine-tuning clip- based features,","venue":null,"work_id":"337361e8-394b-42a1-ada4-11bde8616f6c","year":2022},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.706517Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:1a4524bc280162f163a24ccad0de9b90ffb1ef266d00785387bede76da775443","observation_id":"98f9b5dc-f2bb-4e53-aa41-6b3b0bd84944","resolution":{"observed_at":"2026-08-16T10:32:54.069596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.710855Z","title":"Composing text and image for image retrieval - an empirical odyssey,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.710855Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:2ff2875d1c147612ae4d5bf0f43a571eb26b73fa9952ce906d04a80be32d5299","observation_id":"c59aadab-6e15-4bbf-bc0e-f1a5ae152371","resolution":{"observed_at":"2026-08-16T10:32:53.710855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.049907Z","title":"Cala: Complementary association learning for augmenting comoposed image retrieval,","venue":null,"work_id":"cd3ede7e-70cf-4c0a-975a-72935b635625","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.715342Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:c7885c179a8fbfa460024044906a98a450791c7ea40c1b4df90e1f2606ccaa2a","observation_id":"96685f58-a240-4f8f-ab24-9d206c05e52d","resolution":{"observed_at":"2026-08-16T10:32:54.054321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.035799Z","title":"Ldre: Llm-based diver- gent reasoning and ensemble for zero-shot composed image retrieval,","venue":null,"work_id":"cfdf8fdc-3059-47f9-a578-225f8b47fd86","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.719559Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:f3559fea0b2ccb86e673be5e1f3d5440439fc6f64dfad7f58c876245cfbb30e8","observation_id":"30fe452d-8b41-4203-b64d-673a3c003c64","resolution":{"observed_at":"2026-08-16T10:32:54.040459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08924","last_updated":"2024-03-24T14:23:59Z","snapshot_observed_at":"2026-08-16T14:34:47.178793Z","submitted_at":"2023-12-14T13:31:01Z","title":"Training-free Zero-shot Composed Image Retrieval with Local Concept Reranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08924","snapshot_observed_at":"2026-08-16T10:32:53.723992Z","title":"Training-free zero-shot composed image retrieval with local concept reranking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.723992Z"},"links":{"cited_paper":"/paper/2312.08924","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:5117e881d24ddffc4af70561c7934b383a88f71d43ea4051cd5362b8034ae5e0","observation_id":"9014324f-2aa7-45d6-8a03-f18e077ad1b6","resolution":{"observed_at":"2026-08-16T10:32:53.723992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.021135Z","title":"Seman- tic editing increment benefits zero-shot composed image retrieval,","venue":null,"work_id":"8eefb56a-374d-49cf-8e22-3d37685bab44","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.728472Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:6fad6d43034dd01efce18af8d4b7c965916c0ae3430c0b97c5e2c088f5d4ab34","observation_id":"d389e062-031e-4aca-9df9-cc925ec32007","resolution":{"observed_at":"2026-08-16T10:32:54.025441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:54.006908Z","title":"Zero-shot composed image retrieval considering query-target relationship leverag- ing masked image-text pairs,","venue":null,"work_id":"0847bca2-6257-484f-a894-3729378d7332","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.732700Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:3385b529719f9068793276eb09375782c26e56756bc757e21505658eaf2c5529","observation_id":"7ccc90a0-0439-40bb-ad1b-d02e92627f7e","resolution":{"observed_at":"2026-08-16T10:32:54.011633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07272","last_updated":"2024-03-06T07:16:06Z","snapshot_observed_at":"2026-08-16T15:24:31.559646Z","submitted_at":"2023-06-12T17:56:01Z","title":"Zero-shot Composed Text-Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07272","snapshot_observed_at":"2026-08-16T10:32:53.737107Z","title":"Zero-shot composed text-image retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.737107Z"},"links":{"cited_paper":"/paper/2306.07272","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:c57a89548ee246b77dc9d88eb0a3bc85ecfb6971c56d9021b06929c8ac06783c","observation_id":"c9c431dd-2c66-46a5-98b5-54b8e12f80eb","resolution":{"observed_at":"2026-08-16T10:32:53.737107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-14T18:05:37.795597Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-08-16T10:32:53.741590Z","title":"A corpus for reasoning about natural language grounded in photographs,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.741590Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:a0608c59f5dbd5fe39ac36425183d0f516e31ab2c3462457ada78979b6549eb0","observation_id":"0c2bf7b2-3ac9-4c9e-9a8a-4f6b200cd057","resolution":{"observed_at":"2026-08-16T10:32:53.741590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:32:53.989795Z","title":"Knowledge-enhanced dual-stream zero-shot composed image retrieval,","venue":null,"work_id":"139a570b-0b76-428e-93e8-05186052bd45","year":2024},"citing_paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T10:32:53.746199Z"},"links":{"citing_paper":"/paper/2504.17990"},"observation_digest":"sha256:8f3ad3aa6f453d8473227cb65b53bfdedaf49a74719d865f2108a1417a5d57cb","observation_id":"7a6f5d45-217f-40e4-ab61-958eef9d4ba1","resolution":{"observed_at":"2026-08-16T10:32:53.995890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.17990","last_updated":"2025-04-25T00:18:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T13:28:08.593273Z","submitted_at":"2025-04-25T00:18:23Z","title":"From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2504.17990."}