{"as_of":"2026-08-10T01:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:43523cecb4cd11daf9f261a1658901192da86e18dd8fca77f6ab09959215f8ec","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:07:40.730204Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:21:10.770726Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:05:41.143246Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19952","snapshot_observed_at":"2026-08-06T22:21:10.770726Z","title":"Multimodal reasoning agent for zero-shot composed image retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21924","last_updated":"2025-06-27T05:34:57Z","snapshot_observed_at":"2026-08-08T23:44:20.747366Z","submitted_at":"2025-06-27T05:34:57Z","title":"SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:10.770726Z"},"links":{"cited_paper":"/paper/2505.19952","citing_paper":"/paper/2506.21924"},"observation_digest":"sha256:22cb11981937c3393c18aaafd0e4c57aa9970e62c3159fd29506ba7ffc683fac","observation_id":"e452ef4b-739f-4f84-ad68-a889a2b58f50","resolution":{"observed_at":"2026-08-06T22:21:10.770726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19952","snapshot_observed_at":"2026-08-03T01:02:35.070287Z","title":"Multimodal reasoning agent for zero-shot composed image retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-08T07:23:55.696942Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.070287Z"},"links":{"cited_paper":"/paper/2505.19952","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:74f20f062d1472e6203d8dcc89bb1343a9472fff33cb1a8f915da82ad895d666","observation_id":"9b1c5e39-0d5b-436d-98fc-ec0b8f51f774","resolution":{"observed_at":"2026-08-03T01:02:35.070287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19952","snapshot_observed_at":"2026-07-13T21:37:55.887477Z","title":"Multimodal rea- soning agent for zero-shot composed image retrieval.arXiv preprint arXiv:2505.19952, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.20190","last_updated":"2026-06-09T22:16:34Z","snapshot_observed_at":"2026-08-04T20:13:17.293244Z","submitted_at":"2026-03-20T17:59:25Z","title":"CoVR-R:Reason-Aware Composed Video Retrieval","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T21:37:55.887477Z"},"links":{"cited_paper":"/paper/2505.19952","citing_paper":"/paper/2603.20190"},"observation_digest":"sha256:9550c7fc2dbd3b3018f30a44b7f6f84b09552bbca21bf87e7b3d0fb661d4ad6e","observation_id":"16a6f781-dec7-417d-ae33-b5f9e59733cb","resolution":{"observed_at":"2026-07-13T21:37:55.887477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":"2505.19952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19952","snapshot_observed_at":"2026-07-01T10:05:41.143246Z","title":"Multimodal reasoning agent for zero-shot composed image retrieval","venue":null,"work_id":"9c7b4217-974b-4d18-a914-37d79ec38231","year":2025},"citing_paper":{"arxiv_id":"2605.22478","last_updated":"2026-07-18T11:55:12Z","snapshot_observed_at":"2026-08-03T06:10:22.493856Z","submitted_at":"2026-05-21T13:36:38Z","title":"DeliCIR: Memory-Guided Test-Time Deliberation via Multi-Agent Collaboration for Composed Image Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T06:40:58.445504Z"},"links":{"cited_paper":"/paper/2505.19952","citing_paper":"/paper/2605.22478"},"observation_digest":"sha256:b0c082f5816ae0aba2d538ff53fc68f3cc9abbe73ea6735559dae20e872327bf","observation_id":"922148f1-64cc-45c3-8c8f-05fe704e3ba4","resolution":{"observed_at":"2026-05-22T06:41:10.257851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":"2505.19952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19952","snapshot_observed_at":"2026-07-01T10:05:41.143246Z","title":"Multimodal reasoning agent for zero-shot composed image retrieval","venue":null,"work_id":"9c7b4217-974b-4d18-a914-37d79ec38231","year":2025},"citing_paper":{"arxiv_id":"2605.22478","last_updated":"2026-07-18T11:55:12Z","snapshot_observed_at":"2026-08-03T06:10:22.493856Z","submitted_at":"2026-05-21T13:36:38Z","title":"DeliCIR: Memory-Guided Test-Time Deliberation via Multi-Agent Collaboration for Composed Image Retrieval","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T17:10:54.790735Z"},"links":{"cited_paper":"/paper/2505.19952","citing_paper":"/paper/2605.22478"},"observation_digest":"sha256:ed8475ca9bffa495f7b34dc43ce7b9413e7c7aaf349a595293334bbedbe07dbd","observation_id":"49782fa1-ea49-4103-a5ea-995e68bdb437","resolution":{"observed_at":"2026-06-30T17:14:56.878699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19952","snapshot_observed_at":"2026-08-02T13:28:19.474650Z","title":"Multimodal reasoning agent for zero-shot composed image retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.22478","last_updated":"2026-07-18T11:55:12Z","snapshot_observed_at":"2026-08-03T06:10:22.493856Z","submitted_at":"2026-05-21T13:36:38Z","title":"DeliCIR: Memory-Guided Test-Time Deliberation via Multi-Agent Collaboration for Composed Image Retrieval","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T13:28:19.474650Z"},"links":{"cited_paper":"/paper/2505.19952","citing_paper":"/paper/2605.22478"},"observation_digest":"sha256:f6835e040e91f529197415e0a2eaef2177aed70e9c0738acfeb6a73ebf091399","observation_id":"6d51e281-51a6-4bac-bd03-c5e8505fdf78","resolution":{"observed_at":"2026-08-02T13:28:19.474650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":"2505.19952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19952","snapshot_observed_at":"2026-07-01T10:05:41.143246Z","title":"Multimodal reasoning agent for zero-shot composed image retrieval","venue":null,"work_id":"9c7b4217-974b-4d18-a914-37d79ec38231","year":2025},"citing_paper":{"arxiv_id":"2606.31222","last_updated":"2026-06-30T07:04:05Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:04:05Z","title":"Thinking Before Retrieving: Robust Zero-Shot Composed Image Retrieval via Strategic Planning and Self-Criticism","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T05:52:20.768497Z"},"links":{"cited_paper":"/paper/2505.19952","citing_paper":"/paper/2606.31222"},"observation_digest":"sha256:f22faea5095b41528460a22e136f234eb89fb4495d3273a6b792e930fd0f6ac6","observation_id":"de0291f8-879f-4383-a4d6-69e97783b87b","resolution":{"observed_at":"2026-07-01T10:05:41.145002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19952/citation-record","integrity":"/paper/2505.19952/integrity","json":"/paper/2505.19952/citation-record.json","paper":"/paper/2505.19952"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:34.933454Z","title":"Distribution consistency guided hashing for cross-modal retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:34.933454Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:78d74a07083b0906328ce95e29af4d13d121e7426628e281db7c795430a5522d","observation_id":"2f6c19bf-fa02-4ae7-8ad0-fd89ac999fa8","resolution":{"observed_at":"2026-08-07T14:07:34.933454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:35.023106Z","title":"Similarity transitivity broken-aware multi-modal hashing.IEEE Trans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:35.023106Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:283326a54bd355aac4614ce3c3a6a10f9c7d20f21a5a05ea127dd1bc6c5d35a5","observation_id":"538ab951-db2c-40b6-b51a-8f47eef29e71","resolution":{"observed_at":"2026-08-07T14:07:35.023106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:35.062654Z","title":"Data-aware proxy hashing for cross-modal retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:35.062654Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:b3885635865f9c96af14a0e0a7d1979b4337281f7f48be9f6b7aff158aeae6d6","observation_id":"9d9f5b31-c484-4436-8dec-1c341b1491cd","resolution":{"observed_at":"2026-08-07T14:07:35.062654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:35.168550Z","title":"Where does the performance improvement come from?: - A reproducibility concern about image-text retrieval","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:35.168550Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:8a364c8d398732b8569e0283f97c6b17f76a6d2445403eae90babb0598df2aa0","observation_id":"51b2802e-9064-479a-9e56-6f461d220588","resolution":{"observed_at":"2026-08-07T14:07:35.168550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:35.291206Z","title":"Com- posing text and image for image retrieval - an empirical odyssey","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:35.291206Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:ad403bca3b4d101244afd14561047b64d5a52d7d669733e546ccd64b8a0ec2f8","observation_id":"a8855576-087d-471a-9ace-60361e5e8f85","resolution":{"observed_at":"2026-08-07T14:07:35.291206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:47.836344Z","title":"Sim- ple but effective raw-data level multimodal fusion for composed image retrieval","venue":null,"work_id":"f1d7685e-7944-4547-8a4f-5e5d251470af","year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:35.377153Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:dbb8c73e3524cf5aac36064433d5a2aff8cb6a5457f84fd023ac11ded07783af","observation_id":"8c94eda2-0b0d-4e67-b969-4e28046fa20d","resolution":{"observed_at":"2026-08-07T14:07:47.951301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:35.561828Z","title":"Dual-path semantic construction network for composed query-based image retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:35.561828Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:c6f0f7168c7c9a1becfb6186f99dceef6421b4dd6d834e967f9957ea1b46fcd3","observation_id":"1754bc0b-4231-47f3-bbb5-5a5c2e5a0b7b","resolution":{"observed_at":"2026-08-07T14:07:35.561828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.32354","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:42.906643Z","title":"Multi-modal transformer with global-local alignment for composed query image retrieval.IEEE Trans","venue":null,"work_id":"14ed7947-5a82-4d0e-b7e4-f583be3edbc0","year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:35.694647Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:ea4bb53f7f42e0008efead3bc4b85ba19e3088d5df5cc4a4d6aee0feae4b10a0","observation_id":"ed7928b0-7826-495d-aec2-c096137479c1","resolution":{"observed_at":"2026-08-07T14:07:43.016620Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05473","last_updated":"2023-10-09T07:31:44Z","snapshot_observed_at":"2026-07-06T16:29:39.982733Z","submitted_at":"2023-10-09T07:31:44Z","title":"Sentence-level Prompts Benefit Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05473","snapshot_observed_at":"2026-08-07T14:07:35.796615Z","title":"Sentence-level prompts benefit composed image retrieval.arXiv preprint arXiv:2310.05473, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:35.796615Z"},"links":{"cited_paper":"/paper/2310.05473","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:09f147ca6f84e4509fbbcee4a747859c58fd55e754d841c83d43cfe376c4e68b","observation_id":"301e70e5-0c60-4b16-bd29-1a0d622023ad","resolution":{"observed_at":"2026-08-07T14:07:35.796615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03809","last_updated":"2022-03-08T02:03:49Z","snapshot_observed_at":"2026-07-06T12:45:21.570121Z","submitted_at":"2022-03-08T02:03:49Z","title":"Image Search with Text Feedback by Additive Attention Compositional Learning","version":1},"cited_work":{"arxiv_id":"2203.03809","doi":"10.48550/arxiv.2203.03809","metadata_source":"pith","pith_arxiv_id":"2203.03809","snapshot_observed_at":"2026-08-07T18:16:16.850658Z","title":"Image Search with Text Feedback by Additive Attention Compositional Learning","venue":"cs.CV","work_id":"863023ad-9a08-429d-9986-e8b5cd14d52f","year":2022},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:35.903005Z"},"links":{"cited_paper":"/paper/2203.03809","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:43dcf04652a8597e0d6c06392b1c2dc3c38070dd2c8ba85d0d0aebaeb8c950e4","observation_id":"fbb65504-4c99-47e3-bd34-736153cc65b2","resolution":{"observed_at":"2026-08-07T14:07:41.386495Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:35.986269Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:35.986269Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:8f77538d5ea996218d559c291b843bc38c4bb653a7c5b3ffe82960d6189cbc4c","observation_id":"30f596e3-4083-4d51-b197-01f032f122e8","resolution":{"observed_at":"2026-08-07T14:07:35.986269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3617597","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:41.147269Z","title":"Composed image retrieval using contrastive learning and task-oriented clip-based features.ACM Trans","venue":null,"work_id":"fb673eeb-adf3-4b80-888b-4d685eac5deb","year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:36.053819Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:531d7bb916c1de664a5099e929eca581967a2e30cc9f06857f23b18a8e4f0cf7","observation_id":"2f231df7-737b-47a7-aa08-b5b9b016f965","resolution":{"observed_at":"2026-08-07T14:07:41.240420Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:36.160343Z","title":"Fine- grained textual inversion network for zero-shot composed image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:36.160343Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:76d5ba7eb2e5c92d44a22fccaaaa2791c837446ccae8abf45d365f04d246a77f","observation_id":"7dd376e6-6da1-4e3d-a81c-4eabcdadfd49","resolution":{"observed_at":"2026-08-07T14:07:36.160343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.01850","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:42.512439Z","title":"Pic2word: Mapping pictures to words for zero-shot composed image retrieval","venue":null,"work_id":"b0fafac0-1a0e-429a-ad0a-8e0e8486579e","year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:36.254019Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:c85c8dbef635d0d0bbc0561afa8ba9bda375f2a77e4d178535ebbfa7f70fc305","observation_id":"9270e1f6-a011-4e8f-9a48-b3e09ed9b047","resolution":{"observed_at":"2026-08-07T14:07:42.601773Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:47.599947Z","title":"MLLM-I2W: harnessing multimodal large language model for zero-shot composed image retrieval","venue":null,"work_id":"5253fd32-9a3f-4bb3-9da8-21ac37592d4a","year":2025},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:36.416601Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:436c782f365fe675bfaf9c0335eaec2509ad0a26af27f22d7f0d99072a814be1","observation_id":"94655246-9d83-41c3-8d1f-951209eb33a1","resolution":{"observed_at":"2026-08-07T14:07:47.724543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:47.369748Z","title":"Kankanhalli","venue":null,"work_id":"5439aeea-8ab9-4c64-be67-c7c26165579f","year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:36.510398Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:2b44c3153288d0b539a530ab1700c71e109e891852ba1625ceff7b67abcbed37","observation_id":"8cd08409-8037-41ba-8f94-b7fa225194d5","resolution":{"observed_at":"2026-08-07T14:07:47.508680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:47.146823Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"e2cc86fb-4a40-4148-9fdd-efeda52f9955","year":2021},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:36.588283Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:8de1c299c8204094088835dd8e5495a61203c110ff312941326f44e144e9116f","observation_id":"7c16a5f1-68a2-4fd6-9e75-b18ac824a136","resolution":{"observed_at":"2026-08-07T14:07:47.274574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:46.979772Z","title":null,"venue":null,"work_id":"799ae77c-8c8a-4004-8e9f-3a71c5caf987","year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:36.710310Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:14cbdd775cf634a6b0c51c0a8ddc490439563a9d3b55dbaa41af98f05b75de9b","observation_id":"eb65907c-f8e9-45b5-bd4e-372cc5f342da","resolution":{"observed_at":"2026-08-07T14:07:47.063818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:36.788327Z","title":"Seeing what you miss: Vision-language pre-training with semantic completion learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:36.788327Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:d1d8a9b43745eac183e5fd3ab55dd17bed8921055601dc9ca999b7f9ba4604b6","observation_id":"d28659d0-78ad-4ad8-86c1-077abbf24ef5","resolution":{"observed_at":"2026-08-07T14:07:36.788327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07096","last_updated":"2023-12-06T03:49:10Z","snapshot_observed_at":"2026-07-06T15:41:35.923624Z","submitted_at":"2023-06-12T13:20:29Z","title":"Global and Local Semantic Completion Learning for Vision-Language Pre-training","version":2},"cited_work":{"arxiv_id":"2306.07096","doi":"10.48550/arxiv.2306.07096","metadata_source":"pith","pith_arxiv_id":"2306.07096","snapshot_observed_at":"2026-08-07T18:16:16.850658Z","title":"Global and Local Semantic Completion Learning for Vision-Language Pre-training","venue":"cs.CV","work_id":"bb398d84-1f8e-40a4-925d-cffaa459ffc5","year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:36.870380Z"},"links":{"cited_paper":"/paper/2306.07096","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:5e5e130f9c42b9df0cc6afa7b210b852eceafc9f4baf1f078063abb61866b893","observation_id":"a939717c-1883-4fa2-99d7-4d71ecaf91b4","resolution":{"observed_at":"2026-08-07T14:07:41.095133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:46.668183Z","title":"Zero-shot composed text- image retrieval","venue":null,"work_id":"d8c1c2c7-c5e3-466d-aa8c-cd64f4b99138","year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:36.972948Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:4527a290e7e6368c49db9de7fc8c3b968d015e38439fb5964d7957173d36b0d8","observation_id":"22b2247f-6e88-4a19-8f53-2fe7d56eb5dc","resolution":{"observed_at":"2026-08-07T14:07:46.822771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-07-06T20:03:20.752332Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05756","snapshot_observed_at":"2026-08-07T14:07:37.059408Z","title":"Compo- sitional image retrieval via instruction-aware contrastive learning.CoRR, abs/2412.05756, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.059408Z"},"links":{"cited_paper":"/paper/2412.05756","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:c681f4fbd82caea883cadcf482d6730f1a67bcf2e511e2caeb6a46b31bb8a8ed","observation_id":"7159ee2e-b43d-4a3d-a704-81725a921591","resolution":{"observed_at":"2026-08-07T14:07:37.059408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:07:37.160966Z","title":"Llama: Open and efficient foundation language models.CoRR, abs/2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.160966Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:45d3d7e8c519edcea10625c6d292113957a02083f2872add3656295aee13cd27","observation_id":"6cf8b24b-55bf-48d4-a2c2-8e94cd17290c","resolution":{"observed_at":"2026-08-07T14:07:37.160966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21460","last_updated":"2025-03-27T12:50:17Z","snapshot_observed_at":"2026-07-06T20:59:35.694800Z","submitted_at":"2025-03-27T12:50:17Z","title":"Large Language Model Agent: A Survey on Methodology, Applications and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21460","snapshot_observed_at":"2026-08-07T14:07:37.240894Z","title":"Yu, and Ming Zhang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.240894Z"},"links":{"cited_paper":"/paper/2503.21460","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:ad49e8f5b9ee547226deb49c48b767041dd84d881bc172b8ab0a49bc24b66fa8","observation_id":"2f83fe13-f59a-4027-9956-1c6ef3d9215c","resolution":{"observed_at":"2026-08-07T14:07:37.240894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:46.416568Z","title":"Visual instruction tuning","venue":null,"work_id":"7f08ef7d-c07f-4675-9c9b-c5589951f462","year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.359497Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:51f248ed589655cc09de775391e35fac2203ff5a9b037e85807a7e1cc155628e","observation_id":"c023c4a0-12fb-4a6f-afc6-8b68a27e560a","resolution":{"observed_at":"2026-08-07T14:07:46.516968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18983","last_updated":"2024-11-28T08:07:32Z","snapshot_observed_at":"2026-07-31T16:34:41.070293Z","submitted_at":"2024-11-28T08:07:32Z","title":"SPAgent: Adaptive Task Decomposition and Model Selection for General Video Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18983","snapshot_observed_at":"2026-08-07T14:07:37.487699Z","title":"Spagent: Adaptive task decomposition and model selection for general video generation and editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.487699Z"},"links":{"cited_paper":"/paper/2411.18983","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:a5b4be186d5389c03f1de440ac6be1adcb464dfc1755ea0e2c8ae2d9d8e3fea8","observation_id":"4faaafec-6882-45dc-89c9-338a09a643c9","resolution":{"observed_at":"2026-08-07T14:07:37.487699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:46.123827Z","title":"Grounding language models to images for multimodal inputs and outputs","venue":null,"work_id":"f6363117-3b02-460f-b4d3-ec555267c1c2","year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.592129Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:10668670b4b987ccec5a6e75b989ef4c821f0935842840ef7efdc3c0286b0377","observation_id":"b74f79d4-0c60-463c-8822-0f8326ab012f","resolution":{"observed_at":"2026-08-07T14:07:46.295587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:45.842626Z","title":null,"venue":null,"work_id":"27a014cb-35a9-4e69-8195-f741073e48ca","year":2020},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.696524Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:e9f09dd9fd0147841029c70e49ea735cabd9a32484c2655f8d0c3ac03a719fee","observation_id":"7b1ae7af-ba40-4db3-b761-89f4dc576f85","resolution":{"observed_at":"2026-08-07T14:07:46.003833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:07:37.755205Z","title":"Minicpm-v: A GPT-4V level MLLM on your phone.CoRR, abs/2408.01800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.755205Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:17ab2a36391d8780e42c694b4fde571a0916cfd728ad82efa50a45d9fa50014e","observation_id":"11038ea0-4bce-4a62-bb5f-b711dbd1a21b","resolution":{"observed_at":"2026-08-07T14:07:37.755205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T14:07:37.919492Z","title":"Representation learning with contrastive predictive coding.CoRR, abs/1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.919492Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:17cdd7b1d0551238b32a7843f7b8fc892e88e6e34685f1c2cce53078b844df7d","observation_id":"61e154bc-4477-4ca2-a4e9-eed858a478dc","resolution":{"observed_at":"2026-08-07T14:07:37.919492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:07:37.813610Z","title":"URL https://doi.org/10.48550/arXiv.2408","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.813610Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:a7341b0c3d49e750a50fac24ffe673ed101ce232ccc9acb873931cfb837d3e66","observation_id":"84835a9a-54c1-4b11-9ecc-8ea290504b13","resolution":{"observed_at":"2026-08-07T14:07:37.813610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:38.165615Z","title":"Weighted gaussian loss based hamming hashing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:38.165615Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:2d2c47115a50832efc7dad99832d4b7f0f872dd685909092c5d8394c5240eeaa","observation_id":"8cf5a0ca-7cae-4890-9b59-9ebab07e4ae0","resolution":{"observed_at":"2026-08-07T14:07:38.165615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3588683","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:40.802362Z","title":"Unsupervised hashing with semantic concept mining.Proc","venue":null,"work_id":"dbe027c7-6685-4c4f-aaa4-d3d28d20f7f3","year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:38.080713Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:f4a0bfaae1c559d2eeda40df92f772227be0f7c78eba1bffa578dbf7438e7985","observation_id":"020557ce-a9b2-4711-bb62-d7b1292c9eea","resolution":{"observed_at":"2026-08-07T14:07:40.884160Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.32513","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:42.155014Z","title":"Unsupervised cross-modal hashing with modality-interaction.IEEE Trans","venue":null,"work_id":"8e2557f5-d2c7-4900-90f0-049facf97dfe","year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:38.379544Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:b8086dbf226fd2d6593a14948f4bab0a20b1610cc1a35d74eabd8bd97a687f89","observation_id":"1b6d306c-3e34-41eb-aed3-f31e3e77bd37","resolution":{"observed_at":"2026-08-07T14:07:42.189094Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:38.290845Z","title":"Partial-softmax loss based deep hashing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:38.290845Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:69d41e57390ccaafef7480b1b6f46543008e461d5b77f49a89f569c5071b5b92","observation_id":"d416cac1-f94a-4443-bf6e-f460ef08e3ee","resolution":{"observed_at":"2026-08-07T14:07:38.290845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:38.566628Z","title":"Unsupervised cross-modal hashing via semantic text mining.IEEE Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:38.566628Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:49fc71bd96c034833aec42212394b33e8788c62b8c59e1f6b215f9cd85858ff0","observation_id":"c7699576-e266-4c04-9ef3-62c61a9746f4","resolution":{"observed_at":"2026-08-07T14:07:38.566628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:38.471242Z","title":"Deep cross-modal proxy hashing.IEEE Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:38.471242Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:25d6aa4888a605f929a83f18bc90fccd4608d0be5356aba477ea2f8af9f634b5","observation_id":"af33825f-e7e6-4eb9-abe4-0863552461e6","resolution":{"observed_at":"2026-08-07T14:07:38.471242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:45.289006Z","title":"Knowledge-enhanced dual-stream zero- shot composed image retrieval","venue":null,"work_id":"7d0e888c-74bf-460f-a52e-1f6648ee39c8","year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:38.893398Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:88b3c643f312621f3341184afeed20a152d9b197b60c70b0d19c331cfb3062ba","observation_id":"a962b845-f363-4556-9c1b-11339166c34e","resolution":{"observed_at":"2026-08-07T14:07:45.438771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:45.535143Z","title":"Zero-shot composed image retrieval with textual inversion","venue":null,"work_id":"c352d4e3-cf63-4aca-9f7e-fb3fa153460f","year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:38.676505Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:92baed96a66f73eed10f2d6acfa0ab73f8d51dcd30b9e8e07dc3ff9fb573c785","observation_id":"4abf15b5-e33a-4f23-a3ba-adcf8076cb5d","resolution":{"observed_at":"2026-08-07T14:07:45.689940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:45.101266Z","title":"Target-guided composed image retrieval","venue":null,"work_id":"042033eb-0c09-47d6-a1f9-72c527e88b18","year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:39.258733Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:2c8c6d50d0bdea2d12c97c2c467bc2dc5f0e0ab8c3e04d1a5ddd5d2b71054466","observation_id":"9fbf06e4-991f-4bd4-a342-b94d9b5b34cd","resolution":{"observed_at":"2026-08-07T14:07:45.186347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.32734","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:41.629112Z","title":"Enhance composed image retrieval via multi-level collaborative localization and semantic activeness perception","venue":null,"work_id":"0290e600-f047-404f-98ba-dbf438defac2","year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:39.075665Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:a935bcc317f9d4f2699875c883e4a635a0764fdda670cf5dbb4b59c4468b20a1","observation_id":"d8838646-f428-4d69-b99a-625bd9726bce","resolution":{"observed_at":"2026-08-07T14:07:41.699024Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:39.516160Z","title":"Data roaming and quality assessment for composed image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:39.516160Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:49de2e06383713101ba8680b258b6f578783bc0bcac3571146c31e0ea50e3360","observation_id":"4d0facfa-3bef-45b5-a616-90a4e93fa75f","resolution":{"observed_at":"2026-08-07T14:07:39.516160Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T14:07:39.618249Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual- linguistic tasks.CoRR, abs/2312.14238, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:39.618249Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:29adfedfb56abab4a25d37c92ba8fd9d14a10fd3e1f99bf0d5935b44a3cf26a8","observation_id":"3cc6934b-9fde-4ca2-b134-d7dec363c68b","resolution":{"observed_at":"2026-08-07T14:07:39.618249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:44.831323Z","title":"Self- training boosted multi-factor matching network for composed image retrieval.IEEE Trans","venue":null,"work_id":"a2eb845e-51ae-4ed5-8c7c-96d471564fe4","year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:39.359562Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:5fb5144b87ba12195121274482e63b8584fd998021fca351e1894ef2e4e9d154","observation_id":"3d1f6201-d720-47ac-bb11-baf71655fb1f","resolution":{"observed_at":"2026-08-07T14:07:44.969022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:39.449109Z","title":"Context- i2w: Mapping images to context-dependent words for accurate zero-shot composed image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:39.449109Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:6ed397e9d4a5c0fb0b7754994e250e70ad9d0218e58561403fffde0a83696837","observation_id":"ff304f35-27d3-410d-b920-5ca08d8da2b6","resolution":{"observed_at":"2026-08-07T14:07:39.449109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:39.932800Z","title":"Fashion IQ: A new dataset towards retrieving im- ages by natural language feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:39.932800Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:f04ed2fe2314030c9515908b33f81fd4345e1c2173d0f32197c73525bdb9e023","observation_id":"ca4a488a-0f0f-4da9-bf66-635be1128220","resolution":{"observed_at":"2026-08-07T14:07:39.932800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:40.096640Z","title":"A corpus for reasoning about natural language grounded in photographs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:40.096640Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:7c6429543d446fd12789d0dbf62f3c7bc7b442a35bede146ec7db875c7ee95c5","observation_id":"b2fb9b68-3761-4a0e-b362-2c2ddd5034b5","resolution":{"observed_at":"2026-08-07T14:07:40.096640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:44.576821Z","title":"Mini-batch optimization of contrastive loss.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"53ef7edb-b922-4ec6-a436-41f7da696bc4","year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:39.674668Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:dde610c5a29d1780ec4a743967150f97c2b39aad30f87be1d3c4983ab4446293","observation_id":"4129a7a0-e2b1-42e7-b0d3-67e399357e06","resolution":{"observed_at":"2026-08-07T14:07:44.691636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:44.246188Z","title":"Bridging mini-batch and asymptotic analysis in contrastive learning: From infoNCE to kernel-based losses","venue":null,"work_id":"cf97a1fe-8d50-4430-b215-ec1ff8e034e1","year":null},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:39.786720Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:a8c2e07b33f2a862b11923acd354738767f2bdc7a189da428bb14576b93423d4","observation_id":"aa12343d-fb2d-48de-8a7a-c69161ef55b3","resolution":{"observed_at":"2026-08-07T14:07:44.425859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:43.988338Z","title":null,"venue":null,"work_id":"1a8d5dee-20b5-4100-a260-13bc5f56e592","year":null},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:39.862668Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:54098e353125f1f3d72083eae7c98a510c412f8011a25bdfbdaf53afab3cbfad","observation_id":"60c97a70-de33-4cc0-9da2-9ccaf7a8c04e","resolution":{"observed_at":"2026-08-07T14:07:44.117488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:40.428606Z","title":"Language- only efficient training of zero-shot composed image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:40.428606Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:88931f8a2519460efb94cf899b4c45f97cbfbe0719138aa91be2fb8c9498b40a","observation_id":"ef43d3dc-2c58-44b9-951a-117d568cacea","resolution":{"observed_at":"2026-08-07T14:07:40.428606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02951","last_updated":"2025-07-26T10:50:24Z","snapshot_observed_at":"2026-07-06T18:09:59.472962Z","submitted_at":"2024-05-05T14:39:06Z","title":"iSEARLE: Improving Textual Inversion for Zero-Shot Composed Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02951","snapshot_observed_at":"2026-08-07T14:07:40.499510Z","title":"isearle: Improving textual inversion for zero-shot composed image retrieval.CoRR, abs/2405.02951, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:40.499510Z"},"links":{"cited_paper":"/paper/2405.02951","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:211c3adccb780ec2fe9a89ca4dfe6bd4f4492cd3b378f53b9c06a2d549b5ad85","observation_id":"9cc13558-3ba6-494a-8a96-f7ec2024f060","resolution":{"observed_at":"2026-08-07T14:07:40.499510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:40.153180Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:40.153180Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:ca09a120f904eca338296e0b7cbb1d5091ca778c811f0017eb397eeac274931c","observation_id":"60ccd460-c987-4c18-b7f0-ae258f6f9267","resolution":{"observed_at":"2026-08-07T14:07:40.153180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:40.228472Z","title":"Bernstein, Alexander C","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:40.228472Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:50ecf55d60a3268f9ea1a29ecedb07f082210f6924c2ca85668b9c50ae74f771","observation_id":"7a072da1-1de3-4991-afd7-b8a93b41041c","resolution":{"observed_at":"2026-08-07T14:07:40.228472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:40.384950Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:40.384950Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:67a834fb934468475f9609deb0353cdb9ef707f8c1001962bfad65c0bbdbd61d","observation_id":"1891be75-4b69-4f6a-8173-5eb5de5d6d3a","resolution":{"observed_at":"2026-08-07T14:07:40.384950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:43.672142Z","title":"Vision-by- language for training-free compositional image retrieval","venue":null,"work_id":"6dbaffed-a30b-471a-bd0e-b9ca761f058a","year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:40.575614Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:b1c686c341c83f4d9e754d2a6e562acd2b166793f5fe3483268afb595eb1c4aa","observation_id":"1f139446-d555-4488-8c72-cb646f2a48bc","resolution":{"observed_at":"2026-08-07T14:07:43.833760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:40.687358Z","title":"Effective conditioned and composed image retrieval combining clip-based features","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:40.687358Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:ba33a71e338d12e4d11512b7056e5e37a73dfc3eb3f0cfa982d6db07b2e48af5","observation_id":"95c7083a-1aa8-49db-9d8c-7bd100e3bc53","resolution":{"observed_at":"2026-08-07T14:07:40.687358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:43.452156Z","title":"cap1\" and image 2 with the caption","venue":null,"work_id":"e59e46a6-02b5-4c1f-9129-90ba44fdea6f","year":2022},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:40.730204Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:8e4b64d1ec3d7f52da63c05218f885bacf09b6d2a15a7f188e2de97948348803","observation_id":"605c0739-24a8-4707-8b81-9bf4aab364f2","resolution":{"observed_at":"2026-08-07T14:07:43.504874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:38.798145Z","title":"URL https://doi.org/10.1109/ICCV51070","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:38.798145Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:1e68f440c79846e5a369489de926347956fb3333284eebe8958eb105f77b556e","observation_id":"05e1be0d-d4c5-4bda-a1e3-ce88948d567a","resolution":{"observed_at":"2026-08-07T14:07:38.798145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:35.458335Z","title":"URL https://doi.org/10.1145/3626772.3657727","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:35.458335Z"},"links":{"citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:08fc036a9f1e957dd13ca1b47d55668b6bec288841eb717b3388fb983fa7c7cb","observation_id":"bbf5ee11-3fd1-4061-a73d-4b5b733e86cb","resolution":{"observed_at":"2026-08-07T14:07:35.458335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":36,"verified_exact":4,"verified_fuzzy":15},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 7 inbound Pith citation observations for arXiv:2505.19952."}