{"as_of":"2026-08-10T12:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47df6474d89c7bd6a9f43d6759e08b3cb46db2943bac8f97d81a9e969f774b23","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T02:51:39.142437Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:43:23.733753Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T11:43:28.407453Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"cited_work":{"arxiv_id":"2605.14448","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.14448","snapshot_observed_at":"2026-08-05T11:43:28.407453Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","venue":"cs.CV","work_id":"baee3ddf-d75d-4dc4-af36-d9804f066392","year":2026},"citing_paper":{"arxiv_id":"2608.03826","last_updated":"2026-08-04T15:36:17Z","snapshot_observed_at":"2026-08-09T17:07:39.724064Z","submitted_at":"2026-08-04T15:36:17Z","title":"Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T11:43:23.733753Z"},"links":{"cited_paper":"/paper/2605.14448","citing_paper":"/paper/2608.03826"},"observation_digest":"sha256:5cfe2fd3c783c69ef933dabe8a26f546385863371f55e54aec27b45d9f8f3fb5","observation_id":"c1fef859-a397-4ace-b531-59308763c5da","resolution":{"observed_at":"2026-08-05T11:43:28.454660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.14448/citation-record","integrity":"/paper/2605.14448/integrity","json":"/paper/2605.14448/citation-record.json","paper":"/paper/2605.14448"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:e6d4205d0694b8d9e0f46d97ba7184cf42d98a5a43b986eab9d68d834bc9927d","observation_id":"94adbe60-0729-4d73-8a99-83e7efbbafc4","resolution":{"observed_at":"2026-05-15T02:53:33.620043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05961","last_updated":"2024-08-21T22:46:05Z","snapshot_observed_at":"2026-08-10T10:36:42.293144Z","submitted_at":"2024-04-09T02:51:05Z","title":"LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders","version":2},"cited_work":{"arxiv_id":"2404.05961","doi":"10.48550/arxiv.2404.05961","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05961","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM2Vec: Large language models are secretly powerful text encoders","venue":"arXiv (Cornell University)","work_id":"156e1320-54cd-416f-af15-d9da54374957","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2404.05961","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:2fd9dbb26fa7231957d9cd589f02c30c954dfc32a5179e48e6340e5da494ee30","observation_id":"d3eb9b61-dd0a-413b-b66d-f29fe0365f3b","resolution":{"observed_at":"2026-05-15T02:53:33.616969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"75a0de0b-0e1f-4038-aad8-a85626ae5442","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:5ed000abb12fe96facc6f34e02b9a9ba6567697d7d07949ae4011b6b1de59ed0","observation_id":"42fd8a27-34c3-4abc-9e9a-53c10427595e","resolution":{"observed_at":"2026-05-15T03:59:48.298030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:48:21.005891Z","title":"arXiv preprint arXiv:2510.05014 , year=","venue":null,"work_id":"2a83d4ce-5ef7-4aac-bff2-d4fa50e611d9","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:bcbbac7e6f6a1e3bb925307ef561ea53f76f52ce0f9efa57a57df2cf1a5fe1d8","observation_id":"25ce55d7-42cb-4c1f-848d-445effd6ea1d","resolution":{"observed_at":"2026-05-15T02:53:33.574647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":"0f89dfdc-a347-49f7-87ff-cec69596f875","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:ce59111fb1f33a23f0b608be8b69f93770fd893b2f3bc9e62ea7017d9f3374b0","observation_id":"40922353-9b79-4575-8926-64edb62500c5","resolution":{"observed_at":"2026-05-15T03:59:48.274547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:d778e60bfdd58b9d7b35bd2e8b36d68f5b64dd0ff9852d0b26aa8b0c6103fc65","observation_id":"f90352f8-3ccd-499d-a2cd-d0e67a4075f8","resolution":{"observed_at":"2026-05-15T02:53:33.607157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:46:12.977838Z","title":"Colpali: Efficient document retrieval with vision language models","venue":null,"work_id":"101c0260-59e3-4304-bd2e-d19b57659f73","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:9429b57e2a3efb215a6714aaac301656307d90b0b0d2eff0c720081870ede154","observation_id":"7b41eda3-caf2-4586-bef9-e41f5f07707f","resolution":{"observed_at":"2026-05-15T03:59:48.278740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling deep contrastive learning batch size under memory limited setup","venue":null,"work_id":"7a230fa1-293b-485f-af5d-db8c3c733c65","year":2021},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:0d0dd0e2c2bd86d2d9c34ed7c29ae24577d59651c59d5a17f2218387353567e9","observation_id":"3af8c85c-284f-4954-9b19-3eddcf13b494","resolution":{"observed_at":"2026-05-15T03:59:48.288208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Breaking the modality barrier: Universal embedding learning with multimodal llms","venue":null,"work_id":"06d44ff9-cc74-45e4-a9cd-9e09ccca1027","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:7e39b55968e8267b8ff05185c66b9af6c3aa9b0fce1390c4b912973417f0ed85","observation_id":"2206bcc1-fde0-43e8-aab8-39fefd06315b","resolution":{"observed_at":"2026-05-15T03:59:47.644603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:02.239431Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"062e8d93-5855-4995-abdb-8c79e2312784","year":2022},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:d80dcc406c33af280c7ab9ad599180658a8d78dd2ca542b091db4317f66a3a69","observation_id":"77ac9636-68f6-4152-aa96-d27a2844eb3f","resolution":{"observed_at":"2026-05-15T03:59:47.625790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cumulated gain-based evaluation of IR techniques","venue":null,"work_id":"2d09589c-bcbb-4de4-8d44-a6853b99eeaa","year":2002},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:56760adba872a5fc380241c09613e412c8790961f901c924f7c7c6f9e67964ce","observation_id":"726c1a68-4710-4e0f-8e58-62d996a9e19c","resolution":{"observed_at":"2026-05-15T03:59:47.632221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Le, Yun- Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":"43550805-a10a-404a-91b8-3433ccd140ae","year":2021},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:f0f373664c3ac2f5e5f113a37af0316535de1c0f3f4ad966b7dac0604b949b8f","observation_id":"eea7682d-c7ae-40c2-afb1-4ad1dc97be29","resolution":{"observed_at":"2026-05-15T03:59:47.638328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2407.12580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-07-08T20:35:34.387006Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","venue":"cs.CL","work_id":"df2e178e-bd96-48f4-8431-51c61fbc63fd","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:d05a3ad19327500cd9eaef16c7e14715d4a48423cc2a8f7a471d30c9f7baa626","observation_id":"f298b2ba-57b1-4556-9b70-3f0eb4cef87a","resolution":{"observed_at":"2026-05-16T22:52:21.013841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":"6ccede0b-718c-493f-b5d0-cf8eac6f97b4","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:f5cb617f8c01ff9d1d8ef3ea68c5c3ba84ddfcc6f885471bcb3d2cea2a6e0c38","observation_id":"8b067369-f4a1-41b0-8240-1d9f39b73375","resolution":{"observed_at":"2026-05-15T03:59:47.650503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:04:01.362787Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"59f0aeab-27fb-4d5b-a0d3-ddbd0bbd92d8","year":2022},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:e4b947be6e64d7154ee82d032b691cf63f501fe507eb0d51e39a0fb623ac319f","observation_id":"53ea582e-0153-4b8c-ad25-f86a72722762","resolution":{"observed_at":"2026-05-15T03:59:47.598543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llave: Large language and vision embedding models with hardness-weighted contrastive learning","venue":null,"work_id":"86c31ce8-b851-43b6-8930-5e0f05017bfc","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:a01a49695bfa1b50ce76c793010645bd1689b40e34a20f6e32297faecab1a9b8","observation_id":"172de98b-cec0-4fb6-a8ab-e5474d3aaed5","resolution":{"observed_at":"2026-05-15T03:59:47.564439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00405","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2511.00405 , year=","venue":null,"work_id":"f5b544f0-5c22-440f-a8f4-115d0414a51e","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:c6dd0a1079c024c57c2959f9113f7bb53073b6d49c7e45582712e2d8bb066d72","observation_id":"2d20370a-6f3c-4ca1-b10f-0a4df1dc1923","resolution":{"observed_at":"2026-05-15T02:53:33.610275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nv-embed: Improved techniques for training llms as generalist embedding models","venue":null,"work_id":"6a4942c5-d7fc-4a89-862e-ae17205f49f8","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:38d5bb32030dc4c53bc7dd404bfea39a183393a736a8252265b09fa10450e70d","observation_id":"27772d70-64f0-4b92-b333-4f37453b81e0","resolution":{"observed_at":"2026-05-15T03:59:47.570183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"ddf03a68-4544-4e2a-86dd-aba153e47813","year":2020},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:598f332402eba1317e496f6b35886c285e8103f8b4ae40c9fd410611847b0ca7","observation_id":"7c55fd41-6d7d-4067-b70b-f541a8ba9599","resolution":{"observed_at":"2026-05-15T03:59:47.663216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"9d31c32b-3bb4-4c84-bc7b-8fd34bcc91e4","year":2023},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:6bbb2384bf84e05b63e37d469f000335c969db7131924fddc5afe92bfe086f88","observation_id":"b8ec17a7-4ed5-45de-8d2d-951bcfe8d1ef","resolution":{"observed_at":"2026-05-15T03:59:47.656404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-embed: Universal multimodal retrieval with multimodal llms","venue":null,"work_id":"da668463-5cc6-45cf-afaf-901b2028b379","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:0e35e337c3f590016afa749bea83f5816c79a403a56ca3345a1a03d569a4834d","observation_id":"7820e316-f812-4cb0-af06-1b8e88d78800","resolution":{"observed_at":"2026-05-15T03:59:48.293336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning guided embeddings: Leveraging mllm reasoning for improved multimodal retrieval.arXiv preprint arXiv:2511.16150, 2025a","venue":null,"work_id":"08f8b4b5-a452-4a53-8736-f24ab600d442","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:4a20f3c8db41775407090d9e583d7b5ed82215474e974c205ae144780aeb118b","observation_id":"90618f00-1002-4306-8f97-d57f97f28423","resolution":{"observed_at":"2026-05-15T02:53:33.613684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"ec0a9bdd-8553-4dd1-8dba-ea817865b765","year":2023},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:9030a6919d14a8d7c14e7cd6d444cc83212d55af04f0d022245aad5ab6d3eca3","observation_id":"22cc78b9-ade5-430f-8089-07b9cd8217b0","resolution":{"observed_at":"2026-05-15T03:59:47.521297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:13:35.700428Z","title":"Lamra: Large multimodal model as your advanced retrieval assistant","venue":null,"work_id":"7a5762f9-bec8-4b4f-a9b0-63134b505522","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:e0fa4ecb09916fe273c8750dbee48220623de76fea7a49ef12470e461c07403a","observation_id":"f2b3302f-c83e-4bb9-9bb9-e1470ed0f58d","resolution":{"observed_at":"2026-05-15T03:59:47.546804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlm2vec-v2: Advancing multimodal embedding for videos, images, and visual documents.Transactions on Machine Learning Research","venue":null,"work_id":"8df38adf-318f-471e-a5e1-2b77d59c1fa0","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:12e5e342082cca8b2db5dee5caa584eed71f58e1848531b88acb4d5d74db590f","observation_id":"bf140399-66ac-4dd8-b1e3-dc555b67bee1","resolution":{"observed_at":"2026-05-15T03:59:47.533510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mteb: Massive text embedding benchmark","venue":null,"work_id":"85010eb6-63df-4d61-a935-a4615e0dda0a","year":2023},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:961c6ce196ff6bc314d7b16e0c396abadb979577dfc721ce033dcf3839972888","observation_id":"7dec594e-9711-436f-9a7a-fc61c71f2de6","resolution":{"observed_at":"2026-05-15T03:59:47.488914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vladva: Discriminative fine-tuning of lvlms","venue":null,"work_id":"961dd334-4632-49ba-93a0-b691787fb71c","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:d3d9a253cd622f05c9f9a2e96ae9f8102a39801f28b72e48877552c220c31adf","observation_id":"f775eba8-d4f0-4432-a150-44943d056710","resolution":{"observed_at":"2026-05-15T03:59:47.494114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"794cd6c3-c2d3-4f4a-a518-fb41eb4aafcf","year":2021},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:7048a30c5437ff06a964e0036c31476ffca14a0be171a438e37dec30a9b399f5","observation_id":"bb206138-b18b-4a66-8360-34b9b6206aea","resolution":{"observed_at":"2026-05-15T03:59:47.529126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"87ddbe51-9fe4-4b65-a398-37f2d2a897f1","year":2020},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:674ec89c837b21ab5e6299144377d810aff2174e5bfc78ff43e6d84efc37f3ad","observation_id":"3d8133bb-2658-49a1-b1a8-686d3b852be5","resolution":{"observed_at":"2026-05-15T03:59:47.479475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:6ce43a45cbc0bbb74a18721df7c2a7d8a74afa8c2212d561e9185479bdc0aafa","observation_id":"757f8968-967f-4c29-a2a3-252cf2bd40c1","resolution":{"observed_at":"2026-05-15T02:53:33.603874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, Luke Zettlemoyer, and Tao Yu","venue":null,"work_id":"d612b465-1b94-429b-b63f-af89670e6211","year":2023},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:de6d3826933610c03599337de6e0829cdc0e26a7a5ba635a0252b7adba2a1aab","observation_id":"85f17632-76b2-4724-93ea-09451092bffc","resolution":{"observed_at":"2026-05-15T03:59:48.282994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:82a5abbaa933a58fc17c6d453eeee0c15b8d168a85620109231c0536bf1fec67","observation_id":"8bc26bd1-8c86-4ce7-b1a9-0b05849ae7f8","resolution":{"observed_at":"2026-05-15T02:53:33.580487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":"2212.03533","doi":"10.48550/arxiv.2212.03533","metadata_source":"pith","pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","venue":"cs.CL","work_id":"789cc674-467e-4f23-bb50-05c79fe8c4c2","year":2022},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:e43c59e04ae84eb50ddb6908cb820e15b451c4eefa91a4cfbf95da8d98f8de83","observation_id":"a06c2e40-b8e6-41f8-934d-a382f565b79a","resolution":{"observed_at":"2026-05-15T02:53:33.600217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving text embeddings with large language models","venue":null,"work_id":"42b1efe9-fb71-4d5f-9b1c-c482e009e921","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:3e159b9fd62c847078062415464bc72a4ba5db1ab64d8aa8c24d62f63a9a43a5","observation_id":"3e391284-0470-486c-bc79-a579880df57c","resolution":{"observed_at":"2026-05-15T03:59:48.266541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:95d430c074f9f7c17e1e573aa4bf795a8340f2c1c7092e0aa0d53e2c07111746","observation_id":"ebe631c6-5aa0-40e7-afea-907fc4ea5f7d","resolution":{"observed_at":"2026-05-15T02:53:33.577662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chi, Fei Xia, Quoc Le, and Denny Zhou","venue":null,"work_id":"a9a06bfe-7500-40df-ba89-4256669a3854","year":2022},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:75d17483ee1bedd3d4894104feb9e4d4d6c4656b0f93b3c6659209e22103f1ec","observation_id":"34e63aaa-94ee-4414-a698-afd43ccfc5ed","resolution":{"observed_at":"2026-05-15T03:59:48.270504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cafe: Unifying representation and generation with contrastive-autoregressive finetuning","venue":null,"work_id":"24e9f37b-870f-4f8a-b7fb-966634c3c514","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:913965957b9e76b60abbe7ad9e44954c32401e2a97e8c2dd4739051cf9da8613","observation_id":"e7129446-75d7-4c23-9a26-1a6bb699f922","resolution":{"observed_at":"2026-05-15T03:59:47.461203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":"0332f896-db21-4a85-aed2-33a55061ab99","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:e819f2d2b3b1a8d9bed48f503666d2fd6d2ead24dcd63aff4cb47e42e570e97b","observation_id":"4f3b7b09-ed5a-4b8d-af1f-4f3417d2b966","resolution":{"observed_at":"2026-05-15T03:59:47.466795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient surgery for multi-task learning","venue":null,"work_id":"31e6197d-8313-409a-96f7-a1d5a67cf701","year":2020},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:06a03838eef4d1d8c00367e991eecd061c6f26f23a71747bce9a2cae6879358a","observation_id":"637e55fb-c38b-4171-9d01-648dc1e5cd25","resolution":{"observed_at":"2026-05-15T03:59:47.473299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"d67d2c11-585b-4793-b856-c5d327677d84","year":2023},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:784356fe67179aeaad1f826e3230d47b4f76dc6df1f1616b8a8749173c419088","observation_id":"33c1b78a-bf01-4b73-9cc9-8f5f9d76b865","resolution":{"observed_at":"2026-05-15T03:59:47.809767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hauptmann, Yonatan Bisk, and Yiming Yang","venue":null,"work_id":"a8521278-e2a8-4f5d-a78d-21c9a84d4f38","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:8540b8e3a9d6b1fe5da612f5cbe6e127bfe0a0685f7f6677f14c3ced2e531a75","observation_id":"1c230e21-1155-4bc8-99b6-5a18b2dfed93","resolution":{"observed_at":"2026-05-15T03:59:47.483846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging modalities: Improving universal multimodal retrieval by multimodal large language models","venue":null,"work_id":"b4e9cef0-c44f-49d2-b5a4-49cfa27545d0","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:a2905d86a4abad28d6b910a0bb9a9cb2420bbee5144a941ae320314e16f25d73","observation_id":"4ed72dd8-0c61-4dbe-9ffd-e1f44cc25ef9","resolution":{"observed_at":"2026-05-15T03:59:47.551142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"think\" field completely empty (","venue":null,"work_id":"db3f7a04-fbf8-4925-a4b2-fea892bffdf1","year":2025},"citing_paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T02:51:39.142437Z"},"links":{"citing_paper":"/paper/2605.14448"},"observation_digest":"sha256:6be6325ee5b5bdd4c740cb0b210f5712b8ac172b61c5c6989d1d0cdc2b0d977a","observation_id":"56230514-a7eb-4d62-9193-f769326d580a","resolution":{"observed_at":"2026-05-15T03:59:47.455293Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.14448","last_updated":"2026-05-14T06:41:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T06:41:53Z","title":"Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":31},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2605.14448."}