{"as_of":"2026-08-09T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9ac8d0bde96acd8971c08ba104438bb457fa24e8384890f9952653ac4ebfc57","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:20:01.029650Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:30:07.771573Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-08-08T23:20:01.029650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04176","last_updated":"2025-04-21T12:02:08Z","snapshot_observed_at":"2026-08-08T23:12:59.210731Z","submitted_at":"2025-02-06T16:07:24Z","title":"MRAMG-Bench: A Comprehensive Benchmark for Advancing Multimodal Retrieval-Augmented Multimodal Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T23:20:01.029650Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2502.04176"},"observation_digest":"sha256:38a688d43493d5ea096113fd14a1e50130c13b935693c0662285383a7e776fff","observation_id":"a37951d5-4c65-4996-8dbf-85523f262b56","resolution":{"observed_at":"2026-08-08T23:20:01.029650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":"2412.08802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-07-04T19:30:07.771573Z","title":"jina-clip-v2: Multilingual multimodal embeddings for text and images","venue":null,"work_id":"a6304ec4-5272-4974-a69f-7be8718d3d41","year":2024},"citing_paper":{"arxiv_id":"2604.02546","last_updated":"2026-07-02T01:57:06Z","snapshot_observed_at":"2026-08-02T20:00:32.514238Z","submitted_at":"2026-04-02T21:54:43Z","title":"RGB-Pointmap Pretraining for Unified 3D Scene Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T21:19:49.421653Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2604.02546"},"observation_digest":"sha256:bcc47f02ac93a1eb106590e3a57edd32fdc5d9377e7b199dd9ce698b29280eed","observation_id":"4c233abe-685d-4479-aed1-9faae35b6db7","resolution":{"observed_at":"2026-05-13T21:23:17.939130Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":"2412.08802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-07-04T19:30:07.771573Z","title":"jina-clip-v2: Multilingual multimodal embeddings for text and images","venue":null,"work_id":"a6304ec4-5272-4974-a69f-7be8718d3d41","year":2024},"citing_paper":{"arxiv_id":"2604.07220","last_updated":"2026-04-08T15:41:42Z","snapshot_observed_at":"2026-07-06T22:55:33.502756Z","submitted_at":"2026-04-08T15:41:42Z","title":"HIVE: Query, Hypothesize, Verify An LLM Framework for Multimodal Reasoning-Intensive Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:22:21.682534Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2604.07220"},"observation_digest":"sha256:1ec9fd67663c5179fc58ce052b62a5beb97a3b4889e2f213b91e30c31e576ec0","observation_id":"f5186e79-b65c-4286-91ea-410d98f875a5","resolution":{"observed_at":"2026-05-11T06:56:02.585194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":"2412.08802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-07-04T19:30:07.771573Z","title":"jina-clip-v2: Multilingual multimodal embeddings for text and images","venue":null,"work_id":"a6304ec4-5272-4974-a69f-7be8718d3d41","year":2024},"citing_paper":{"arxiv_id":"2605.08384","last_updated":"2026-06-05T21:57:48Z","snapshot_observed_at":"2026-08-02T16:50:30.597437Z","submitted_at":"2026-05-08T18:45:15Z","title":"jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:28:48.722301Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2605.08384"},"observation_digest":"sha256:2e16116cf9cce5b6c5eda638f9db7bb3e2dbd26df4d19ce89e4b0edd6bd815d7","observation_id":"e6c5de1f-0bdd-4e19-893a-9e758e94f51b","resolution":{"observed_at":"2026-05-12T07:56:28.838737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":"2412.08802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-07-04T19:30:07.771573Z","title":"jina-clip-v2: Multilingual multimodal embeddings for text and images","venue":null,"work_id":"a6304ec4-5272-4974-a69f-7be8718d3d41","year":2024},"citing_paper":{"arxiv_id":"2605.08384","last_updated":"2026-06-05T21:57:48Z","snapshot_observed_at":"2026-08-02T16:50:30.597437Z","submitted_at":"2026-05-08T18:45:15Z","title":"jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T06:57:25.015358Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2605.08384"},"observation_digest":"sha256:cd242c21790c058d13f500e7edf859c4b54fee82782ecf3e0b00e6b3d2b80c5b","observation_id":"8b86ce07-2594-4b42-96d6-f4e48c6c4bd3","resolution":{"observed_at":"2026-05-13T07:02:27.779441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":"2412.08802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-07-04T19:30:07.771573Z","title":"jina-clip-v2: Multilingual multimodal embeddings for text and images","venue":null,"work_id":"a6304ec4-5272-4974-a69f-7be8718d3d41","year":2024},"citing_paper":{"arxiv_id":"2605.08384","last_updated":"2026-06-05T21:57:48Z","snapshot_observed_at":"2026-08-02T16:50:30.597437Z","submitted_at":"2026-05-08T18:45:15Z","title":"jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T22:56:43.298141Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2605.08384"},"observation_digest":"sha256:699884d10a972730e5b5a041d4622d3a70525bc74b20d54e798710bb23564118","observation_id":"fb41aea0-70b2-483a-a861-eaea954a8b99","resolution":{"observed_at":"2026-07-01T13:35:46.703034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":"2412.08802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-07-04T19:30:07.771573Z","title":"jina-clip-v2: Multilingual multimodal embeddings for text and images","venue":null,"work_id":"a6304ec4-5272-4974-a69f-7be8718d3d41","year":2024},"citing_paper":{"arxiv_id":"2605.21272","last_updated":"2026-05-20T15:04:56Z","snapshot_observed_at":"2026-08-02T13:53:05.548583Z","submitted_at":"2026-05-20T15:04:56Z","title":"MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T05:21:18.369534Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2605.21272"},"observation_digest":"sha256:0d1619675b2652355944e6377546c0575e1a9fc1ef320d726491dde24a87d775","observation_id":"f1cf3dec-3d74-43a2-8536-ce16658b0faf","resolution":{"observed_at":"2026-05-21T05:23:58.441043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":"2412.08802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-07-04T19:30:07.771573Z","title":"jina-clip-v2: Multilingual multimodal embeddings for text and images","venue":null,"work_id":"a6304ec4-5272-4974-a69f-7be8718d3d41","year":2024},"citing_paper":{"arxiv_id":"2606.08126","last_updated":"2026-06-06T12:10:33Z","snapshot_observed_at":"2026-07-06T23:47:38.671681Z","submitted_at":"2026-06-06T12:10:33Z","title":"One Stone, Three Birds: Self-adaptive Optimal Transport for Multi-VLM Selection, Adaptation, and Ensembling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T19:57:15.988771Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2606.08126"},"observation_digest":"sha256:799935ec0821bc63c45eda1bf6a5842c93a6f361334bb235786a47c49c790d46","observation_id":"9f548490-1d6f-4406-8dfd-aa5baf953dfb","resolution":{"observed_at":"2026-07-02T21:07:23.771000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":"2412.08802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-07-04T19:30:07.771573Z","title":"jina-clip-v2: Multilingual multimodal embeddings for text and images","venue":null,"work_id":"a6304ec4-5272-4974-a69f-7be8718d3d41","year":2024},"citing_paper":{"arxiv_id":"2606.25343","last_updated":"2026-06-26T04:35:35Z","snapshot_observed_at":"2026-08-06T22:43:48.099674Z","submitted_at":"2026-06-24T03:17:30Z","title":"Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-25T21:15:12.242955Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2606.25343"},"observation_digest":"sha256:ba6bc12eff83082486abbc2725d5a2cc71270e389249fd11bb7736924b53512f","observation_id":"20b3544d-2409-4544-8762-e46faac2b04a","resolution":{"observed_at":"2026-07-04T19:30:07.773095Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":"2412.08802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-07-04T19:30:07.771573Z","title":"jina-clip-v2: Multilingual multimodal embeddings for text and images","venue":null,"work_id":"a6304ec4-5272-4974-a69f-7be8718d3d41","year":2024},"citing_paper":{"arxiv_id":"2606.25343","last_updated":"2026-06-26T04:35:35Z","snapshot_observed_at":"2026-08-06T22:43:48.099674Z","submitted_at":"2026-06-24T03:17:30Z","title":"Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T05:07:28.537679Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2606.25343"},"observation_digest":"sha256:1aa10019ed2085b50a5ff2f3bf054dbed168df61db9b377a3e9a4090c68287b6","observation_id":"67de105b-4d74-4a96-86cb-b0b461385c3a","resolution":{"observed_at":"2026-06-29T18:23:51.253079Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":"2412.08802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-07-04T19:30:07.771573Z","title":"jina-clip-v2: Multilingual multimodal embeddings for text and images","venue":null,"work_id":"a6304ec4-5272-4974-a69f-7be8718d3d41","year":2024},"citing_paper":{"arxiv_id":"2606.26794","last_updated":"2026-06-25T09:27:54Z","snapshot_observed_at":"2026-08-03T16:40:37.506200Z","submitted_at":"2026-06-25T09:27:54Z","title":"ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T05:03:15.044146Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2606.26794"},"observation_digest":"sha256:8a1c0dac5045abfd7703435ea74bcf2b826b20952e2c81281d85369d2920e10e","observation_id":"994aec71-e745-4473-8b9b-2de9c6dc08df","resolution":{"observed_at":"2026-07-04T13:39:50.719907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-08-06T00:17:09.450205Z","title":"arXiv preprint arXiv:2412.08802 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01389","last_updated":"2026-08-02T17:11:09Z","snapshot_observed_at":"2026-08-07T06:44:16.746327Z","submitted_at":"2026-08-02T17:11:09Z","title":"KoVRE: Training an Efficient Embedding Model for Korean Visual Document Retrieval","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T00:17:09.450205Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2608.01389"},"observation_digest":"sha256:5cba4cb20bdc3a1c87996bbba2078cac809d455f6d61fc98632cb0bc4e35f09e","observation_id":"5530c45c-12d9-46d5-bb05-c6171f617c16","resolution":{"observed_at":"2026-08-06T00:17:09.450205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-08-04T20:43:16.254863Z","title":"jina- clip-v2: Multilingual multimodal embeddings for text and images.arXiv preprint arXiv:2412.08802, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.254863Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:327b9325701a2c25374537ee8d0b0bd90eebbeb351a45ca31dcf22c95c86c407","observation_id":"73ae2735-f4c0-4927-ba64-3ea619c019e7","resolution":{"observed_at":"2026-08-04T20:43:16.254863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08802/citation-record","integrity":"/paper/2412.08802/integrity","json":"/paper/2412.08802/citation-record.json","paper":"/paper/2412.08802"},"outbound":[],"paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2412.08802."}