{"as_of":"2026-08-15T21:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9696d1d89aab1e85e6e39aef0a2382251cb69afa6f10f8ab160fe88268337b6e","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:18:49.815677Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:43:17.336608Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T17:08:01.148592Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02020","snapshot_observed_at":"2026-08-03T04:20:58.191649Z","title":"Improve multi-modal embedding learning via explicit hard negative gradient amplifying.arXiv preprint arXiv:2506.02020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.191649Z"},"links":{"cited_paper":"/paper/2506.02020","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:097745942345693f8d921be8216599b49517bf13de38b4d109dd79c0c58f21e3","observation_id":"e645e263-3f3f-4f85-b91b-a49573b0af2c","resolution":{"observed_at":"2026-08-03T04:20:58.191649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"cited_work":{"arxiv_id":"2506.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02020","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improve multi-modal embedding learning via explicit hard negative gradient amplifying","venue":null,"work_id":"dc89e988-66b9-49bd-9a01-641d350e14bf","year":2025},"citing_paper":{"arxiv_id":"2604.04976","last_updated":"2026-04-04T17:05:15Z","snapshot_observed_at":"2026-08-14T01:20:46.134170Z","submitted_at":"2026-04-04T17:05:15Z","title":"Tencent Advertising Algorithm Challenge 2025: All-Modality Generative Recommendation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T16:59:06.735742Z"},"links":{"cited_paper":"/paper/2506.02020","citing_paper":"/paper/2604.04976"},"observation_digest":"sha256:d13d3e4dd4b56d4f6fed9f49c578a1df6fa14fd02c67e4ba929c7c8b9f28689d","observation_id":"5019370f-b1a0-4032-a9cf-39ea744575e5","resolution":{"observed_at":"2026-05-13T17:08:01.150217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02020","snapshot_observed_at":"2026-07-13T10:23:38.252227Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04997","last_updated":"2026-04-05T20:56:19Z","snapshot_observed_at":"2026-08-08T01:22:14.544755Z","submitted_at":"2026-04-05T20:56:19Z","title":"Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T10:23:38.252227Z"},"links":{"cited_paper":"/paper/2506.02020","citing_paper":"/paper/2604.04997"},"observation_digest":"sha256:ed3a8aa21cf3567239f92749212fdf8ec97ebdfe5a88e6f572cca7dfd5e4015f","observation_id":"09101564-083c-4c12-a45b-25aa8df6c83c","resolution":{"observed_at":"2026-07-13T10:23:38.252227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"cited_work":{"arxiv_id":"2506.02020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02020","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improve multi-modal embedding learning via explicit hard negative gradient amplifying","venue":null,"work_id":"dc89e988-66b9-49bd-9a01-641d350e14bf","year":2025},"citing_paper":{"arxiv_id":"2605.02378","last_updated":"2026-05-04T09:18:19Z","snapshot_observed_at":"2026-08-12T17:20:44.773767Z","submitted_at":"2026-05-04T09:18:19Z","title":"Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T19:21:30.235583Z"},"links":{"cited_paper":"/paper/2506.02020","citing_paper":"/paper/2605.02378"},"observation_digest":"sha256:668e511e6ca8d30831d40cd4d0df6dbdc9ef52305708c9896f16e51a52d05cdc","observation_id":"f5e448f3-ec66-479c-bf7d-a6621149975d","resolution":{"observed_at":"2026-05-09T05:55:31.217933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02020","snapshot_observed_at":"2026-08-04T20:43:17.336608Z","title":"Improve multi-modal embedding learning via explicit hard negative gradient am- plifying.arXiv preprint arXiv:2506.02020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.336608Z"},"links":{"cited_paper":"/paper/2506.02020","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:8a48724ab16bdaf8501518acdbb10aec2fa1973ebc654b463243a546667989d4","observation_id":"d2e52caf-a117-4d20-864f-ee1847e6c1db","resolution":{"observed_at":"2026-08-04T20:43:17.336608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02020/citation-record","integrity":"/paper/2506.02020/integrity","json":"/paper/2506.02020/citation-record.json","paper":"/paper/2506.02020"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:53.983379Z","title":"Notellm: A retrievable large language model for note recommendation","venue":null,"work_id":"4e47c10c-494d-4594-8c09-de2572da97d5","year":2024},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:46.808309Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:32cd3ecfe0bd2ca176d5bf5d345c9a81839a04c7922bcedfa8f76a26e067268c","observation_id":"6a06e7c1-ffc4-4f6e-af91-519c5b807b3b","resolution":{"observed_at":"2026-08-07T13:18:54.052728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16789","last_updated":"2025-01-21T15:40:43Z","snapshot_observed_at":"2026-08-15T00:32:16.392217Z","submitted_at":"2024-05-27T03:24:01Z","title":"NoteLLM-2: Multimodal Large Representation Models for Recommendation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16789","snapshot_observed_at":"2026-08-07T13:18:46.934462Z","title":"Notellm-2: Multimodal large representation models for recommendation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:46.934462Z"},"links":{"cited_paper":"/paper/2405.16789","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:95a2e5358cf2176fe5778c3ca56c6d5669d8939c5f9371ec1155efcb573e9bd2","observation_id":"be9e6f38-c610-4e59-869c-60cdcce966a5","resolution":{"observed_at":"2026-08-07T13:18:46.934462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-13T17:45:25.269133Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-07T13:18:47.055743Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:47.055743Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:3dadad37d3221c0fc896aa7e02a2bb85e3b82849762ebec2246612ea3b591f4c","observation_id":"d23551af-ff17-475e-bbfd-8ffa72c03980","resolution":{"observed_at":"2026-08-07T13:18:47.055743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09795","last_updated":"2025-04-14T01:50:33Z","snapshot_observed_at":"2026-08-13T16:33:57.570808Z","submitted_at":"2025-04-14T01:50:33Z","title":"VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents","version":1},"cited_work":{"arxiv_id":"2504.09795","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.09795","snapshot_observed_at":"2026-08-07T13:18:50.443849Z","title":"VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents","venue":"cs.CL","work_id":"40561a6e-01d9-4a00-ad45-007bc3f4f5e4","year":2025},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:47.143641Z"},"links":{"cited_paper":"/paper/2504.09795","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:8319a4ae4069f28ba76cc2de16653bc63d69640b612e9481906f81714052ec21","observation_id":"adcef878-068b-44f0-b6fb-54145652c77b","resolution":{"observed_at":"2026-08-07T13:18:50.597400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:53.775412Z","title":"Mmsearch: Unveiling the potential of large models as multi-modal search engines","venue":null,"work_id":"fd6b86c2-e1af-4184-9916-a1465a28e8ff","year":null},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:47.218912Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:a4b069badb7da5bd8519612bf2c781aadf7807c1d929eb8ab33d968b33c915fa","observation_id":"2c2f5a19-c0bf-4ee3-aed9-7786dc748ecf","resolution":{"observed_at":"2026-08-07T13:18:53.861947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:53.555581Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"fa53cfdb-1984-4578-88e5-ac63a6582615","year":2021},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:47.288067Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:933d08082a0d025e0ec3e7ae36cbc9f47e377f4254230b2aa88d097e342af79a","observation_id":"2037f4b4-297b-4860-bb3e-a92d987b8487","resolution":{"observed_at":"2026-08-07T13:18:53.676270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:53.370591Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"f80625e8-c50a-4d33-b63c-7d7a1d9bdc41","year":2023},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:47.416759Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:bc07754b4aa00aed339e484b85f7fc68ac5564c42d10c1abe6f9781daf2ead40","observation_id":"14e6952a-8e20-493a-91aa-5e8d7d655adf","resolution":{"observed_at":"2026-08-07T13:18:53.437440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-07T13:18:47.517568Z","title":"Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Al- abdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, Olivier J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:47.517568Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:d23ecea0066b72fe0627ca2e2fa2aefef543b46f760e2001f7d30161464d0df4","observation_id":"0a91747f-1661-496a-b348-79ad926b19d3","resolution":{"observed_at":"2026-08-07T13:18:47.517568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-08-14T12:08:01.047250Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-07T13:18:47.669708Z","title":"EV A-CLIP-18B: scaling CLIP to 18 billion parameters.CoRR, abs/2402.04252, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:47.669708Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:c85f9fa9b0a7652a36f1a2dd6892c39065e76713fad09141db16cfebe9acc276","observation_id":"4ac52ac6-a3b7-487b-a43c-42578b84fa9e","resolution":{"observed_at":"2026-08-07T13:18:47.669708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:47.878642Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:47.878642Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:ee19834d720829d7d8be7cecd14982b4615195e207f4414fa3a6107df149af83","observation_id":"eb7201fc-68ed-48cb-a5a9-fcd83ad30f09","resolution":{"observed_at":"2026-08-07T13:18:47.878642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:18:48.004899Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:48.004899Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:8c887d548b027f19bfcbc9c253f48cfd5c9ee14383c4ee41facd418c8fce5cef","observation_id":"f6c8825a-e942-4e43-b3f1-634b507bed65","resolution":{"observed_at":"2026-08-07T13:18:48.004899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:18:48.083695Z","title":"Qwen2-vl: Enhancing vision- language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:48.083695Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:5a7237933f58e7a04092549b7e35ca60892a47e93cdc1547b789505df09a2e56","observation_id":"6ab308f6-09dc-4d04-b326-0d4a9db9c0ee","resolution":{"observed_at":"2026-08-07T13:18:48.083695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T13:18:48.190114Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:48.190114Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:7fa4c2a4d75acd3c193ce4a734a31687839664a4b4443860b3c8ee6ca9d54700","observation_id":"56948934-2ff3-42cf-864d-e24574e7f022","resolution":{"observed_at":"2026-08-07T13:18:48.190114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T13:18:48.258280Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:48.258280Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:4006ae7576e8ec008791098f2157f71c01df3b0eaab8fcf87a186ebfefb7167f","observation_id":"037c4ad1-3a29-4627-bfdf-dc47b9027368","resolution":{"observed_at":"2026-08-07T13:18:48.258280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:53.180103Z","title":"Girshick","venue":null,"work_id":"5e1870c1-97e9-408f-9cec-c4c525e0834b","year":2020},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:48.368541Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:cfb115f8a17eff3f9f2470b74225e6b63b4b2dc5a70839539c5f016215a3bd7a","observation_id":"2be151e4-ec62-4bb7-87f6-124e6a02f149","resolution":{"observed_at":"2026-08-07T13:18:53.298401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:52.944793Z","title":null,"venue":null,"work_id":"2c1e2423-a5e7-42be-b58a-d5f4fde76478","year":2020},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:48.441213Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:d38a887bed06284659dfe391d5de417452d1ba06127ac4e59a0be823be94e1b0","observation_id":"d441546d-9309-4228-aa4c-577ebfe4ec70","resolution":{"observed_at":"2026-08-07T13:18:53.011925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:48.530572Z","title":"Llave: Large language and vision embedding models with hardness-weighted contrastive learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:48.530572Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:f5c248c4d4c782425d212c5ea9dbf02ddf9da80d7e6cb21ca7d22f9c7ad63b76","observation_id":"4c19eca1-f0ba-40ad-b4ca-06503607c333","resolution":{"observed_at":"2026-08-07T13:18:48.530572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:52.737945Z","title":"Scaling deep contrastive learning batch size under memory limited setup","venue":null,"work_id":"c30fa007-2e4a-470a-8c15-46dd6aae69ac","year":2021},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:48.604872Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:06185e8a8c219f9d620e8d7c4a3cbb5cca4453f47dddac050a286c15ad6314a6","observation_id":"00e5072e-34de-4be2-9027-b8dee6685881","resolution":{"observed_at":"2026-08-07T13:18:52.834999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:48.770440Z","title":"Sfr- embedding-mistral:enhance text retrieval with transfer learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:48.770440Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:00b8da7917fe82797837befbfb26acf71e775a0c1ac372501966523bb6e2b3b3","observation_id":"49a68cbb-a738-4763-95d9-2707a5e1a146","resolution":{"observed_at":"2026-08-07T13:18:48.770440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:52.365994Z","title":"Nv-embed: Improved techniques for training llms as generalist embedding models","venue":null,"work_id":"78f84bb7-85de-47e6-b34c-c0140bd5e6f9","year":2025},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:48.969887Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:95b0dc5e5a89ca4795eb341db79661481594de88de8f6cca4756298fa4b74707","observation_id":"1f3336d7-15d2-4268-9806-eb28c1f95d34","resolution":{"observed_at":"2026-08-07T13:18:52.517561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:49.092184Z","title":"Breaking the batch barrier (b3) of contrastive learning via smart batch mining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:49.092184Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:5970640ce2b8bbb5163cb37164ac4dd8e94cb47817eb4bd84d58e8fa454e670e","observation_id":"345308d0-a43d-404a-b265-7841355c0144","resolution":{"observed_at":"2026-08-07T13:18:49.092184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:52.123623Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":"6106f297-d8ea-4f30-ab05-8abb982f2702","year":2025},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:49.230103Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:c3a93428d6266db808898652c669597277edb2b6f4b83496628205f81724220b","observation_id":"d89fa713-000a-45eb-9f28-1d446614dc2f","resolution":{"observed_at":"2026-08-07T13:18:52.225357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-07T13:18:49.328229Z","title":"E5-V: universal embeddings with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:49.328229Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:caf4fdf9ff0a06a61511affc7e442666c654de357876d1c0723bfbf8adbe3274","observation_id":"b4e7e494-9df5-40aa-9749-773e8d3af88c","resolution":{"observed_at":"2026-08-07T13:18:49.328229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:49.443909Z","title":"Breaking the modality barrier: Universal embedding learning with multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:49.443909Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:5ab3684f649f4eed409296199c66701cef5ef3d70ce3eaddff2d9a409212bd3b","observation_id":"b65eaf56-3c4b-4acb-997d-4790aa3dcfea","resolution":{"observed_at":"2026-08-07T13:18:49.443909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:51.749445Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"fb5eddb6-0e5c-407f-b96d-6a5ffb23c235","year":2023},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:49.549297Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:0921da37cc86fdacd694c2fe4ee40eee98a207037ea65a10ba1a4218d66edc4b","observation_id":"308e107d-fa79-4f6c-84c7-45123b663d45","resolution":{"observed_at":"2026-08-07T13:18:51.937499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:51.431250Z","title":"Magiclens: Self-supervised image retrieval with open-ended instructions","venue":null,"work_id":"1d6c4e68-11ac-4605-8126-60445844fac2","year":2024},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:49.607945Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:ff8a485e71db77cdb1956470321e6760fce42da009add396c1f58ee249602e50","observation_id":"708161ca-e7cd-48d9-a6f3-4bdee685bc79","resolution":{"observed_at":"2026-08-07T13:18:51.561668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:51.201639Z","title":null,"venue":null,"work_id":"79cd3224-2970-4b92-82eb-9334f05c1c41","year":2023},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:49.690159Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:7f20d814d980c44a423437ac0bdafaae79ce151de681bfbf56484b953d7f380b","observation_id":"19ae5c26-5713-43b7-afa7-63d3567a26e9","resolution":{"observed_at":"2026-08-07T13:18:51.301046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:51.021699Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":"2bc10421-45a9-4504-9a2f-d36b69cb929a","year":2014},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:49.749615Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:564142e1c85d87a1cd8d1bdf6a5585d47978d5933c809aaf1d96fd66ee3c7aa2","observation_id":"c14177af-8e87-46ca-855b-8011d54ec94e","resolution":{"observed_at":"2026-08-07T13:18:51.092200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:50.753313Z","title":"Visual news: Benchmark and challenges in news image captioning","venue":null,"work_id":"110e2e8d-9782-40b6-a6d9-0f2ea9d2e738","year":2021},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:49.815677Z"},"links":{"citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:fb8101196cf265a4cf3e153e3fdd8486cd5e1beedcd573974210a8c798e8c18e","observation_id":"d7e0e637-e7e5-4135-8f6d-12939a687a7a","resolution":{"observed_at":"2026-08-07T13:18:50.865936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 5 inbound Pith citation observations for arXiv:2506.02020."}