{"as_of":"2026-08-12T20:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61eb0909a7a693c9214918140375c7b13f214a2722f79f30d5fc637deb64ddc5","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:28:39.587387Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:14:36.479575Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:49:57.653860Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05756","snapshot_observed_at":"2026-08-07T14:14:36.479575Z","title":"Compo- sitional image retrieval via instruction-aware contrastive learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19707","last_updated":"2025-05-26T08:56:59Z","snapshot_observed_at":"2026-08-11T19:34:40.551308Z","submitted_at":"2025-05-26T08:56:59Z","title":"MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:36.479575Z"},"links":{"cited_paper":"/paper/2412.05756","citing_paper":"/paper/2505.19707"},"observation_digest":"sha256:272dd11e1ac723c8a1d4018fa19113112172e62a7a980bd50d347cc5038b3a9c","observation_id":"fe1fac11-dc12-4666-acb2-990a031842ad","resolution":{"observed_at":"2026-08-07T14:14:36.479575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05756","snapshot_observed_at":"2026-08-07T14:07:37.059408Z","title":"Compo- sitional image retrieval via instruction-aware contrastive learning.CoRR, abs/2412.05756, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.059408Z"},"links":{"cited_paper":"/paper/2412.05756","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:a4e8029430b7aa800e8f1e0f5caece2a305e88a78b2e03abbad427e09c6bfc81","observation_id":"7159ee2e-b43d-4a3d-a704-81725a921591","resolution":{"observed_at":"2026-08-07T14:07:37.059408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"cited_work":{"arxiv_id":"2412.05756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05756","snapshot_observed_at":"2026-07-04T15:49:57.653860Z","title":"Compositional image retrieval via instruction-aware contrastive learning.arXiv preprint arXiv:2412.05756","venue":null,"work_id":"8b86e9d8-267e-47c5-95ae-01283afc16a5","year":2024},"citing_paper":{"arxiv_id":"2604.16487","last_updated":"2026-04-21T02:26:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T08:27:11Z","title":"Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:28:50.127362Z"},"links":{"cited_paper":"/paper/2412.05756","citing_paper":"/paper/2604.16487"},"observation_digest":"sha256:83f5d41433f0c98edb5498ea1d16019902e55b6167f2b6177c7feed2d2c89f00","observation_id":"f0d5ce91-7dd8-4804-9186-84cdc4b9e03a","resolution":{"observed_at":"2026-05-11T08:50:58.111382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"cited_work":{"arxiv_id":"2412.05756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05756","snapshot_observed_at":"2026-07-04T15:49:57.653860Z","title":"Compositional image retrieval via instruction-aware contrastive learning.arXiv preprint arXiv:2412.05756","venue":null,"work_id":"8b86e9d8-267e-47c5-95ae-01283afc16a5","year":2024},"citing_paper":{"arxiv_id":"2606.24094","last_updated":"2026-06-23T03:20:09Z","snapshot_observed_at":"2026-08-06T22:07:11.614337Z","submitted_at":"2026-06-23T03:20:09Z","title":"Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-26T01:19:19.253076Z"},"links":{"cited_paper":"/paper/2412.05756","citing_paper":"/paper/2606.24094"},"observation_digest":"sha256:9c240119fda825285a4a9208d210cf640969760f77361164dee5b299c816bae0","observation_id":"12930f30-d7d0-482c-ab7b-941ac426ffdd","resolution":{"observed_at":"2026-07-04T15:49:57.656128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.05756/citation-record","integrity":"/paper/2412.05756/integrity","json":"/paper/2412.05756/citation-record.json","paper":"/paper/2412.05756"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T20:28:38.061159Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.061159Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:b5c0694e17fcd3d59627657c88909666798b029716afe37608ee4159818b3dc4","observation_id":"fe4579b8-7c84-4040-99ec-ea33b2c5b376","resolution":{"observed_at":"2026-08-11T20:28:38.061159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T20:28:38.082738Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.082738Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:f453fea3be424c38dcba36ba280a432e696edd473e05b23c989cc331587e5271","observation_id":"6b4bc66d-2da8-47f4-91b5-79d34442d652","resolution":{"observed_at":"2026-08-11T20:28:38.082738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02951","last_updated":"2025-07-26T10:50:24Z","snapshot_observed_at":"2026-08-12T12:29:54.658022Z","submitted_at":"2024-05-05T14:39:06Z","title":"iSEARLE: Improving Textual Inversion for Zero-Shot Composed Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02951","snapshot_observed_at":"2026-08-11T20:28:38.125412Z","title":"isearle: Improving textual inversion for zero-shot composed image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.125412Z"},"links":{"cited_paper":"/paper/2405.02951","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:29a79f218490a5c762e1f92822e0d45365150dbbd6ebede04ec0c04aa459b8a9","observation_id":"0488177e-37a3-45e0-8c7e-9a0357350780","resolution":{"observed_at":"2026-08-11T20:28:38.125412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T20:28:38.149769Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.149769Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:56e10ca1a22b680b68841645d9ddc9d0512088481d8e040f9ab765a33c1f460d","observation_id":"8c5bf4f5-e147-47aa-980c-2ce4518e9465","resolution":{"observed_at":"2026-08-11T20:28:38.149769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.889976Z","title":"Zero-shot composed image retrieval with textual inversion, 2023","venue":null,"work_id":"0991d541-a707-49c6-81d8-68a579dd7956","year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.155101Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:a90b7d1af1037bc8302df5289afd355880122a80bd118e5f3277768a5acef98b","observation_id":"d909b817-4055-4144-ad10-2425a21afc38","resolution":{"observed_at":"2026-08-11T20:28:43.980981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:38.159922Z","title":"Zero-shot composed image retrieval with textual inversion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.159922Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:55967c5d7fd8c5f1f4f330d4f7efe3bb375a921749e7fdb9ea483cd75ad5abe1","observation_id":"ec82d223-912b-4fe8-a361-38d1a665db99","resolution":{"observed_at":"2026-08-11T20:28:38.159922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.861650Z","title":"Leveraging large language models for multimodal search","venue":null,"work_id":"bf90190a-fb09-43bf-be0a-1f12cfef3894","year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.165273Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:8cc70026af6894965fa8c0f5aaa60a726e4fc18f0f6e7f7e0f31f2ce8c653f1a","observation_id":"ea801c9e-2069-4fea-ba41-0357a6647fa6","resolution":{"observed_at":"2026-08-11T20:28:43.866825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T20:28:38.170425Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.170425Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:891c6021b695000f0d97862f27bc0ba70e23aa455dd24f2c3b3ed5f11cd1bacf","observation_id":"d9bfedf3-3047-4333-b19d-681570ffc15e","resolution":{"observed_at":"2026-08-11T20:28:38.170425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09188","last_updated":"2025-03-18T04:06:55Z","snapshot_observed_at":"2026-08-12T19:51:40.509028Z","submitted_at":"2024-06-13T14:49:28Z","title":"An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval","version":2},"cited_work":{"arxiv_id":"2406.09188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09188","snapshot_observed_at":"2026-08-11T20:28:40.112179Z","title":"An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval","venue":"cs.CV","work_id":"1cdbcaa5-e681-4368-b1c6-cafd18fbfbc5","year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.176255Z"},"links":{"cited_paper":"/paper/2406.09188","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:8542941cfb487630c768c0d230042cd5ae1aff5925a31ed8cf6dd709c93ac086","observation_id":"d00ffdd2-f22e-4ffa-ab8c-02c2d6f1dda2","resolution":{"observed_at":"2026-08-11T20:28:40.159886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T20:28:38.182222Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.182222Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:76c66313660833047102fdcc0f290a7fb1538da487a321bccb8cf4510c59bdac","observation_id":"ba80f392-ff8a-4b30-97bb-038ed2131cd1","resolution":{"observed_at":"2026-08-11T20:28:38.182222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:38.188509Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.188509Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:8835a2c5729a69b2903d30e642c264861a5f958284a783e1cd874b6da1d7b52a","observation_id":"a4d79d16-9be5-46af-b122-948929647e09","resolution":{"observed_at":"2026-08-11T20:28:38.188509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.810001Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"0c8ece94-3796-43e4-86af-2333f6e5542b","year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.193647Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:3a349d049071b93aab83d21d3086fb382eda54ec957c9b609e81c1b4626f2243","observation_id":"d320a3c9-d50a-4b6a-b87c-5d377f1eae19","resolution":{"observed_at":"2026-08-11T20:28:43.825169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:38.198371Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.198371Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:9bcb1b59b7232f62909b8eb3be0aab34c20f0e5f1585fbe58e63405e23dcf350","observation_id":"4025ca91-fb83-4e40-959d-aac49698a04c","resolution":{"observed_at":"2026-08-11T20:28:38.198371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.782615Z","title":"Xtuner: A toolkit for efficiently fine-tuning llm","venue":null,"work_id":"8a1c0469-3621-4635-84cd-ba310277b346","year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.202797Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:89a7f5da855224d743892b4eca9a7859777836c1526feebcdfe050f7fc7a54e2","observation_id":"bae50a6f-0b0f-4db8-a8a2-c69365d3a179","resolution":{"observed_at":"2026-08-11T20:28:43.787846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-06T19:00:20.787763Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-11T20:28:38.207262Z","title":"Internlm-xcomposer2- 4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.207262Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:9de816435fa40a87a39931cb36480eba5d773bfa9c1318556509cfc6853dee2f","observation_id":"ccc32b6a-e4a1-4fa8-8935-8c7536e4e9bd","resolution":{"observed_at":"2026-08-11T20:28:38.207262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01431","last_updated":"2024-03-03T07:58:03Z","snapshot_observed_at":"2026-08-10T19:16:48.101948Z","submitted_at":"2024-03-03T07:58:03Z","title":"Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01431","snapshot_observed_at":"2026-08-11T20:28:38.212097Z","title":"Image2sentence based asymmetrical zero-shot composed image retrieval.arXiv preprint arXiv:2403.01431,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.212097Z"},"links":{"cited_paper":"/paper/2403.01431","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:214b6da9272a8ad47728e4050137ad5abdd031572d8bb4d28ca4e68390c75c7a","observation_id":"e75f1fbf-4f80-4508-bae6-53d8f2d1c453","resolution":{"observed_at":"2026-08-11T20:28:38.212097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.678478Z","title":"Language-only efficient training of zero- shot composed image retrieval–appendix–","venue":null,"work_id":"1cb72a59-3579-48a4-8e3f-396fce422df1","year":null},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.217294Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:25f3c9378c6bf23940bc7a83e580ade66815c0444924dcaad1bdc03125d83bdf","observation_id":"5401473b-e092-41a8-beda-0baac29ebf6a","resolution":{"observed_at":"2026-08-11T20:28:43.745152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11916","last_updated":"2024-07-16T04:23:37Z","snapshot_observed_at":"2026-08-12T13:06:12.446389Z","submitted_at":"2023-03-21T15:06:35Z","title":"CompoDiff: Versatile Composed Image Retrieval With Latent Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11916","snapshot_observed_at":"2026-08-11T20:28:38.268822Z","title":"Compodiff: Versa- tile composed image retrieval with latent diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.268822Z"},"links":{"cited_paper":"/paper/2303.11916","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:4a222a7c57e91e7a09da825f262c17b20ac959d6f952afb2da5892c229f707bc","observation_id":"334a1f4e-2acb-4896-88ba-7c9bc268d5c5","resolution":{"observed_at":"2026-08-11T20:28:38.268822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T20:28:38.390610Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.390610Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:a843e5fe600f452e3660799bb68c8a82549ab50682315c835ae3ce1f1aaaddb1","observation_id":"14399c4d-679c-49c0-bc67-787fcd52882e","resolution":{"observed_at":"2026-08-11T20:28:38.390610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00571","last_updated":"2024-05-01T15:19:54Z","snapshot_observed_at":"2026-07-06T18:08:13.456457Z","submitted_at":"2024-05-01T15:19:54Z","title":"Spherical Linear Interpolation and Text-Anchoring for Zero-shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00571","snapshot_observed_at":"2026-08-11T20:28:38.494207Z","title":"Spherical linear interpolation and text- anchoring for zero-shot composed image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.494207Z"},"links":{"cited_paper":"/paper/2405.00571","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:d2d44766a64be3bab4d4663bcbc483b1d21332e6e33ab8bc18fd25c7fdd58e48","observation_id":"24075eff-2837-44c3-bff7-dc206592f60b","resolution":{"observed_at":"2026-08-11T20:28:38.494207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.660505Z","title":"Visual delta generator with large multi-modal models for semi-supervised composed image retrieval","venue":null,"work_id":"5c7d7c93-6252-445b-ada0-904ad52d0267","year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.544882Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:39b1fc150a46c593fb819470f2c5a6e427ff0779af45d2d5de333282e8e7ed1e","observation_id":"e4488461-2813-439f-b85d-2dd46ef5673f","resolution":{"observed_at":"2026-08-11T20:28:43.666815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16645","last_updated":"2023-07-31T13:26:03Z","snapshot_observed_at":"2026-08-01T09:03:35.501236Z","submitted_at":"2023-07-31T13:26:03Z","title":"Scaling Sentence Embeddings with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16645","snapshot_observed_at":"2026-08-11T20:28:38.550195Z","title":"Scaling sentence embeddings with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.550195Z"},"links":{"cited_paper":"/paper/2307.16645","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:5c65398d0b3defbf3d1e6de6f24995db8eec9aedbfe9b7fde2ea5267a15afdbf","observation_id":"da375af5-811b-47ec-aedc-551e13edd096","resolution":{"observed_at":"2026-08-11T20:28:38.550195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-11T20:28:38.554702Z","title":"E5-v: Universal embeddings with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.554702Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:f428bcc21fc7473aec1a236dd89a24ea8b7f238398a4176581a868a990aa0dd3","observation_id":"0a486c30-e9e5-490c-a9af-1026c69cacb5","resolution":{"observed_at":"2026-08-11T20:28:38.554702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09291","last_updated":"2024-02-26T18:59:49Z","snapshot_observed_at":"2026-08-12T09:56:51.055987Z","submitted_at":"2023-10-13T17:59:38Z","title":"Vision-by-Language for Training-Free Compositional Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09291","snapshot_observed_at":"2026-08-11T20:28:38.560509Z","title":"Vision-by-language for training- free compositional image retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.560509Z"},"links":{"cited_paper":"/paper/2310.09291","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:0feb0bdf2e763f289e231147794653fe358a3716384eb3856d608edd7b647a3c","observation_id":"15e232e7-0357-45ac-a97f-0406eca3b912","resolution":{"observed_at":"2026-08-11T20:28:38.560509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.621442Z","title":"Grounding language models to images for multimodal inputs and outputs","venue":null,"work_id":"e058a357-1324-436f-96bc-3d9ebd3514b5","year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.565712Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:c173df7106a355bf97025c01f61f05bd54e5849a0b8923672bb0c0fc74d2d93a","observation_id":"1e0fa9cd-c0cf-4ae9-b42d-a5049e1a6a6b","resolution":{"observed_at":"2026-08-11T20:28:43.643872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:38.570718Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.570718Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:2dc1f6d39795d2c786be5855b4dba5b68e8c056f7c40226a2f8a49433a1059ea","observation_id":"59cbec90-3ee0-49b6-a1e9-860b5e298810","resolution":{"observed_at":"2026-08-11T20:28:38.570718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.594134Z","title":"Improving context understanding in multi- modal large language models via multimodal composition learning","venue":null,"work_id":"0b8fa29f-f302-41a8-ab76-48135d0c0eb3","year":null},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.575336Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:6db8ae4d7cedd9a078746b47c41905e85a9fa173e3eab8649aef557492609e05","observation_id":"a8e6a41d-8ecd-4639-b354-9fae0fccd4a2","resolution":{"observed_at":"2026-08-11T20:28:43.599678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:38.580182Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.580182Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:e32dd95926b16e3284884348949ab07b29e2f2ae8d0d3ad1acf81f2ec5e28e3a","observation_id":"8be22f4c-8343-4f4e-a7e4-e46acc24ce45","resolution":{"observed_at":"2026-08-11T20:28:38.580182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.449584Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"3c4914ec-6116-4593-9d72-14719d24015c","year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.584561Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:fbb7df959545e9b27bf4f8299cc15ed0c4ecc06f970c2d270637a9a7ebdec80e","observation_id":"28076032-59d4-4bfc-88f5-7972ff5da59b","resolution":{"observed_at":"2026-08-11T20:28:43.541650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:38.589649Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.589649Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:806931e43c7d873ef4c7f09b5e42fcba46c371dd7171696e1f57fd706c88a162","observation_id":"d8bb9fe8-6475-4e19-bed9-d79013b6cdf8","resolution":{"observed_at":"2026-08-11T20:28:38.589649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:38.594557Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.594557Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:ec56511bcba37b5429a04ec1e90c54caeb5c0e65f5d5a9da367068ff2a39d3c7","observation_id":"50dcfcfa-b9ef-4a01-945e-619e9309aa5a","resolution":{"observed_at":"2026-08-11T20:28:38.594557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.411265Z","title":"Visual instruction tuning","venue":null,"work_id":"6adf5b7c-9746-4cb6-a22a-b9a0ab385165","year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.599029Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:b5b168c8999d36b714283f52ce9819f208eb29330d9f15c9901dcccd2e386ad1","observation_id":"d63ff2e8-ed48-4e5e-8d61-3ffefcaee84a","resolution":{"observed_at":"2026-08-11T20:28:43.417008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.190104Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":"93cd591f-dabd-4252-bd9d-ff606f64028c","year":2021},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.704715Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:e6d6a6b908ea224f245f51e0192e30d2bb599c0b8f02fbff3e83205f5fbf9cf6","observation_id":"d1c5c96f-d2fc-4b84-aab7-f86ee42cd1dd","resolution":{"observed_at":"2026-08-11T20:28:43.308028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:43.149445Z","title":"Image retrieval on real-life images with pre- trained vision-and-language models","venue":null,"work_id":"956dcf12-a7a5-40da-84ed-7b7ce4e30e41","year":2021},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.792808Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:63d1220cc5201cd1262fb4cf99a8ab658dc1b134d2dc198cfb7883d2f0f2fd8a","observation_id":"043148bf-ef48-4b2f-9a20-7f9362be0d4a","resolution":{"observed_at":"2026-08-11T20:28:43.178420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-11T20:28:38.869088Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.869088Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:ececafb9c62776df3ae1d7b77175bebcf8e39f1aa73e052cb6e599ce31edd8a2","observation_id":"4d6e0c25-73b0-44ac-a678-d5bd30e6ea41","resolution":{"observed_at":"2026-08-11T20:28:38.869088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:38.875750Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.875750Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:59c0f02bbaee97c629193d766d8a81bf2535b7d538f2d4599a62b07371b144f1","observation_id":"0dd56536-ed00-4831-8aa2-ab922bd2609b","resolution":{"observed_at":"2026-08-11T20:28:38.875750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:38.881850Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.881850Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:d69c0bddf0bcd27cf00bf0a22da91c68e026892760da32343052db21aaa9727a","observation_id":"0e928b77-cd43-4554-9d3d-c9fae0e61cbd","resolution":{"observed_at":"2026-08-11T20:28:38.881850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:42.985893Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"166e7590-f806-47e2-8108-295c74237d5e","year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.886480Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:668ef5e075d2b4f19e5bacee3d95784522e3a33fc8a2edc9b7e48f1d09584a24","observation_id":"78ca80f0-4fcb-43e3-987a-ea740e5bb187","resolution":{"observed_at":"2026-08-11T20:28:43.042379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:42.969478Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"b3ded3f3-fb7d-41a2-82c8-1d258615441a","year":2020},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.890635Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:82b834f3cd06a20f4216a5a93670d9e9ab66d2e0a14787f6866d71b9c2688198","observation_id":"5fd95c1c-dd2c-4b52-a9be-087933cc9264","resolution":{"observed_at":"2026-08-11T20:28:42.975459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:42.936883Z","title":"Pic2word: Mapping pictures to words for zero-shot composed image retrieval","venue":null,"work_id":"6a6d8f39-ee81-418a-be82-5385541e9ba1","year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:38.982829Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:406d015ed34562be716cc7697709696a0088eb4ba742b9a27bf1e3d3caa6996d","observation_id":"7949d080-3ec7-47ad-a565-a4f532d09f9a","resolution":{"observed_at":"2026-08-11T20:28:42.957568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:42.813059Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"c9fe21ac-7310-48b5-84aa-2728ff1afc9a","year":2018},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.070424Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:7368dfb6a2853c7abac2d2c02b80e56d71a20b613b4ea94750ede546e134bada","observation_id":"6041b27e-9247-4c4f-907c-c41c2f929955","resolution":{"observed_at":"2026-08-11T20:28:42.819721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:42.795525Z","title":"”foil it! find one mismatch between image and language caption”","venue":null,"work_id":"4d19acbd-edfe-40b5-8939-de33494bc496","year":2017},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.224902Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:325396597bf38d2a7f6dc68a547f7e298588eb08f04d060fef60b7a2ba60da42","observation_id":"7645cde4-abe7-45c5-a75c-4d30078de11b","resolution":{"observed_at":"2026-08-11T20:28:42.801465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:42.659587Z","title":"Knowledge-enhanced dual-stream zero-shot composed im- age retrieval","venue":null,"work_id":"be9b2039-d345-4c7c-b62e-ff9b6d9335f8","year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.231540Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:72775f556418dba533aba3b3b72fef3c2831b24d4423474b2b7c23b23b2fb422","observation_id":"5262a08a-2df5-432f-bcd6-e2392b3808a9","resolution":{"observed_at":"2026-08-11T20:28:42.734509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:42.266386Z","title":"Context-i2w: Mapping images to context-dependent words for accurate zero-shot composed image retrieval","venue":null,"work_id":"431fe1bb-2b7d-405b-be70-bcf42d027c37","year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.237121Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:68e151cb03a2618fffd793684afd39a6c0d797f511965b5ea242229331bedb9c","observation_id":"3a1f294d-5a88-4a43-a772-119e6c1bea2a","resolution":{"observed_at":"2026-08-11T20:28:42.450794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T20:28:39.243296Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.243296Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:5b45bdf19e25bd569c59e181167a8f9238929a332d2c38d1e1cdaf74edd27729","observation_id":"4edf9d82-ba3d-4c36-b8c5-f78db82cab71","resolution":{"observed_at":"2026-08-11T20:28:39.243296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:41.611631Z","title":"Genecis: A benchmark for general conditional image similarity","venue":null,"work_id":"f479c846-5937-42b5-ae91-9b669f6b638b","year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.248874Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:2fbac058682d6ca877d950729232395eb096d8f143c284b6d578122ad7032142","observation_id":"ad6ba9f9-fe8e-4ca0-87ea-7324613c8ef4","resolution":{"observed_at":"2026-08-11T20:28:41.889403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:41.469431Z","title":"Covr: Learning composed video retrieval from web video captions","venue":null,"work_id":"ae6eaa96-5fe1-474c-938f-1681012c7fd5","year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.254687Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:dd550fd2798ceca28dc79cda990c0c98d4110e9d2dd520632fc5e275bab733a8","observation_id":"a5ecbf14-ff90-479b-8c1b-5834f36de698","resolution":{"observed_at":"2026-08-11T20:28:41.524875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00368","last_updated":"2024-05-31T07:22:01Z","snapshot_observed_at":"2026-08-11T17:21:30.617849Z","submitted_at":"2023-12-31T02:13:18Z","title":"Improving Text Embeddings with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00368","snapshot_observed_at":"2026-08-11T20:28:39.259288Z","title":"Improving text em- beddings with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.259288Z"},"links":{"cited_paper":"/paper/2401.00368","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:a76e008cb86f549e66d5f29d1de737e96cbe2c206d5f64319b2fd8c3adc37e91","observation_id":"aefc1b5b-c1c5-40a8-8961-fb062b484464","resolution":{"observed_at":"2026-08-11T20:28:39.259288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:41.325024Z","title":"Uniir: Training and benchmarking universal multimodal information retriev- ers, 2023","venue":null,"work_id":"a9e16baa-3b9f-44b7-a945-a4063d6c14b0","year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.265070Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:346174096986a154206e5802cacc024b85df772aac8a8e2120d814fd279ddbcb","observation_id":"ad0242fd-a5d9-4639-bf61-2642203c8a32","resolution":{"observed_at":"2026-08-11T20:28:41.376774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:40.796325Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":"b1dd1483-8f4b-4a66-b0f0-14dffa432c2f","year":2022},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.269655Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:347bb8eb84bd18deff6a1f816a0a9ceb3cb891a12911105983188742b11be5bd","observation_id":"47e0b32b-6939-4a80-81db-5d4f3378a4c5","resolution":{"observed_at":"2026-08-11T20:28:41.141585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:40.639507Z","title":"The fashion iq dataset: Retrieving images by combining side information and relative natural language feedback","venue":null,"work_id":"8a52fdae-e833-4937-a8f5-e92cc08107a9","year":2021},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.388157Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:c97454226b9b6b715a214c45ec9ec8f3f1fd44f2e9f9dde2e16744f2425e2fff","observation_id":"0589c548-8de5-42f5-8fde-62c8d1523fb8","resolution":{"observed_at":"2026-08-11T20:28:40.692496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-11T20:28:39.473351Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.473351Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:d809bf1d3e582d61f03b4f7501700c98296e7bf8396d364298f04b3bd54235b1","observation_id":"41e306a9-bec9-471c-a9fb-9b6e9da5f6dd","resolution":{"observed_at":"2026-08-11T20:28:39.473351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17143","last_updated":"2024-09-25T17:59:13Z","snapshot_observed_at":"2026-07-06T19:22:14.655041Z","submitted_at":"2024-09-25T17:59:13Z","title":"Attention Prompting on Image for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2409.17143","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.17143","snapshot_observed_at":"2026-08-11T20:28:39.862681Z","title":"Attention Prompting on Image for Large Vision-Language Models","venue":"cs.CV","work_id":"b7132d38-8a1d-49b3-b940-1fc11699b819","year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.553852Z"},"links":{"cited_paper":"/paper/2409.17143","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:f0b42b75b961b2c1f2f51f351514a3aef4978001e504ac73fdd49c3f9d4e2ad0","observation_id":"daa16a05-d6c2-4846-92eb-d10f58f21792","resolution":{"observed_at":"2026-08-11T20:28:39.870518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19651","last_updated":"2024-06-24T23:41:29Z","snapshot_observed_at":"2026-08-04T07:44:45.555675Z","submitted_at":"2024-03-28T17:59:20Z","title":"MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19651","snapshot_observed_at":"2026-08-11T20:28:39.559321Z","title":"Magi- clens: Self-supervised image retrieval with open-ended in- structions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.559321Z"},"links":{"cited_paper":"/paper/2403.19651","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:820f9a9b0ba01b4e9e455e643d8a9b1c224495489fefad0540e0c4ce912e2ea2","observation_id":"ef230554-b52f-4ca9-869d-2f6d63fd3f24","resolution":{"observed_at":"2026-08-11T20:28:39.559321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:39.565645Z","title":"Instruction tuning for large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.565645Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:1adcf4cccbb965e9b43f1dd397b16f96ad3ae12b08232d0c3680749a4a619883","observation_id":"f8678ae0-270c-4fbf-9603-87bbd416ba53","resolution":{"observed_at":"2026-08-11T20:28:39.565645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-11T20:28:39.570872Z","title":"A survey of large language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.570872Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:2099c1a9f54599393eed54604a4dd8cc52672799df4c263d22f25ce131abc0f9","observation_id":"b1cfea2a-9079-4ae6-9a05-af8255e62337","resolution":{"observed_at":"2026-08-11T20:28:39.570872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:39.576272Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.576272Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:4433e06f0b338768f6e8346a401f91ad468f95d22d39e114fa4dbac75b1252f2","observation_id":"ba48bfc9-ffcf-4282-b8da-3fd151b706f8","resolution":{"observed_at":"2026-08-11T20:28:39.576272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:40.463432Z","title":"a very typical bus station","venue":null,"work_id":"faab44f8-0360-4462-88b3-227524777f02","year":2024},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.580737Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:da40f123ed4d475ca844072c2519f3e754eff748bffd7d23a15bebcfc545d250","observation_id":"4fbdb120-1a1c-4708-bc82-48dc3dbc8dc6","resolution":{"observed_at":"2026-08-11T20:28:40.547856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:40.319288Z","title":"Table 8 shows the sizes of training datasets","venue":null,"work_id":"7d5baf47-fccb-4a85-a9da-e25aba561ecf","year":null},"citing_paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:39.587387Z"},"links":{"citing_paper":"/paper/2412.05756"},"observation_digest":"sha256:c75c784328baef4a7d6b3c851abaf4b4c096398db455fb278543448a8dbeed52","observation_id":"1d224a39-7b9b-48cd-a60f-ed5d5e171257","resolution":{"observed_at":"2026-08-11T20:28:40.386621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.05756","last_updated":"2024-12-07T22:46:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T12:30:46.694372Z","submitted_at":"2024-12-07T22:46:52Z","title":"Compositional Image Retrieval via Instruction-Aware Contrastive Learning"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 4 inbound Pith citation observations for arXiv:2412.05756."}