{"as_of":"2026-08-12T09:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e13aac5704c997bf6cc3e2ef357073f85485144a27486abe85f23f24d18e37d4","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:05:31.866869Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:30:52.768388Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T23:20:53.347635Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"cited_work":{"arxiv_id":"2506.06144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06144","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clamr: Contex- tualized late-interaction for multimodal content retrieval","venue":null,"work_id":"b5a92801-9338-4b95-bd79-7dac67a82509","year":2025},"citing_paper":{"arxiv_id":"2604.05834","last_updated":"2026-05-07T07:23:06Z","snapshot_observed_at":"2026-08-11T17:01:09.809683Z","submitted_at":"2026-04-07T13:03:30Z","title":"Hidden in the Multiplicative Interaction: Uncovering Fragility in Multimodal Contrastive Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T19:12:07.548447Z"},"links":{"cited_paper":"/paper/2506.06144","citing_paper":"/paper/2604.05834"},"observation_digest":"sha256:09c3a27a0c0ece6af27c326d6116295f9dd2b329a7ca62df0b0b87b18bf46fce","observation_id":"1c39de2c-01db-44ed-a743-64a7eb788bcd","resolution":{"observed_at":"2026-05-10T23:20:53.354526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06144","snapshot_observed_at":"2026-08-11T00:30:52.768388Z","title":"arXiv preprint arXiv:2506.06144 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07663","last_updated":"2026-08-07T18:00:02Z","snapshot_observed_at":"2026-08-12T09:13:38.713971Z","submitted_at":"2026-08-07T18:00:02Z","title":"Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T00:30:52.768388Z"},"links":{"cited_paper":"/paper/2506.06144","citing_paper":"/paper/2608.07663"},"observation_digest":"sha256:3c1b683029cfb5695597abfd608b5980626a0c1986f08d960a73adeaeb70a568","observation_id":"b51f727c-9452-4602-b6d9-fa49ca61b69a","resolution":{"observed_at":"2026-08-11T00:30:52.768388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06144/citation-record","integrity":"/paper/2506.06144/integrity","json":"/paper/2506.06144/citation-record.json","paper":"/paper/2506.06144"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.634670Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.634670Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:47d4865ccb10efc33476c34ec74c42326de8496ef11a4c5df24315be96726f07","observation_id":"19dd6684-388b-4cb7-be7d-caf1c71fb844","resolution":{"observed_at":"2026-08-07T06:05:31.634670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.729244Z","title":"Vlmo: Unified vision- language pre-training with mixture-of-modality-experts","venue":null,"work_id":"3c1e6a46-6b34-411e-bfb5-f7e3df9acd85","year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.644806Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:94455cf91d3b2c886e0429ee2880ede05489ce2be7186b9b308ad8d66b6bd787","observation_id":"9c47f90b-1e70-4dbe-9359-ec944a84271d","resolution":{"observed_at":"2026-08-07T06:05:32.732933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.709757Z","title":"Valor: Vision-audio-language omni-perception pretraining model and dataset, 2023","venue":null,"work_id":"206dcf2d-fc83-40da-9b1e-2d2bee7cd0a4","year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.652579Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:606034db7a3a95fa96979ca1781bf122e3536d6a2745136078f92f8e9aa438a1","observation_id":"4d14f39b-27d1-4e85-af09-9a0b17dcb282","resolution":{"observed_at":"2026-08-07T06:05:32.713163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.698394Z","title":"V AST: A vision-audio-subtitle-text omni-modality foundation model and dataset","venue":null,"work_id":"2e78a4c1-23d9-4fbf-a2f1-7e3e5c963c97","year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.656440Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:83abe52f0fd7de5cbe5c03ee8ac80248c0870d959f0c7f7e2e1d48cda871fda4","observation_id":"204d3d2f-313a-435e-bdbf-f9d933524ab9","resolution":{"observed_at":"2026-08-07T06:05:32.702081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.688726Z","title":"PaLI: A jointly-scaled multilingual language-image model","venue":null,"work_id":"bfdc11c6-87fc-4722-813f-efff4fb3b325","year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.661364Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:221a970837bfcbcae4d94bcaeb580ecedfaec8c0641e53bd18b8da5082efcd9d","observation_id":"4e6e1dea-47dc-4f43-9209-8bdd96927bd8","resolution":{"observed_at":"2026-08-07T06:05:32.691985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.679381Z","title":"M3docrag: Multi- modal retrieval is what you need for multi-page multi-document understanding, 2024","venue":null,"work_id":"335ef3b1-bdea-4032-9f5c-6540934807c5","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.666238Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:51d65dbdb7d4292ceeb106e5b1cdc2d2400fb251009679cf22e71a64aa3eb57d","observation_id":"4041aeb2-69d3-403c-9bbd-41e128cb652d","resolution":{"observed_at":"2026-08-07T06:05:32.682596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.669461Z","title":"Jacolbertv2.5: Optimising multi-vector retrievers to create state-of-the-art japanese retrievers with constrained resources, 2024","venue":null,"work_id":"601e99c6-bc12-4b50-a8b6-8403c52f2832","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.675998Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:b31a4a95c665eebaa924d3aff6e5c7c03c292a00f4f25eec9fd0d16e67474d6a","observation_id":"c196a0ea-c869-4dbc-8144-f7bd9a7b07ff","resolution":{"observed_at":"2026-08-07T06:05:32.672817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.680329Z","title":"Cormack, Charles L A Clarke, and Stefan Buettcher","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.680329Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:0d3cfbf9c45c1da48efb160bef724d961530369a7cd3d3007c3927f3fc8e945a","observation_id":"823aed3b-6806-41b2-87b7-e11f5308cda9","resolution":{"observed_at":"2026-08-07T06:05:31.680329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-07T06:05:31.684465Z","title":"Qlora: Efficient finetuning of quantized llms.arXiv preprint arXiv:2305.14314, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.684465Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:40a5141defd76db3a02d1f052665c2e70823bd1adf3ba7bd4de28889a44f8d5d","observation_id":"fdb88050-ddff-42c2-a84a-9587fc3bd8b6","resolution":{"observed_at":"2026-08-07T06:05:31.684465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.659492Z","title":"Tibshirani.An Introduction to the Bootstrap","venue":null,"work_id":"edc010b8-2cff-4eb5-b2df-6a3cc8afddcd","year":1993},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.689461Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:0743f6a2e5181c589b56973dcde59439c9c484ca1ef5eac742ecb39192d4a547","observation_id":"e94752d0-2164-4e0b-b8ee-8b410a9fdcc2","resolution":{"observed_at":"2026-08-07T06:05:32.662854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.694040Z","title":"A hybrid model for multilingual ocr","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.694040Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:9ff9a685bcc4c26ceb29e3447a6fd349a1378007f3de7dfa59cc88f55b2bba8a","observation_id":"503b32ec-c227-4ad7-83b1-328a0819f599","resolution":{"observed_at":"2026-08-07T06:05:31.694040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.648489Z","title":"Colpali: Efficient document retrieval with vision language models","venue":null,"work_id":"31098870-3b06-457e-a7bc-3aebd1e0d053","year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.698596Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:0b4f4b6fda0836beb308fc1f068f9d8f5432a6d0ae7a285be383a7903679d0c1","observation_id":"03718175-bbd6-463d-ac4a-df5eb644d7bc","resolution":{"observed_at":"2026-08-07T06:05:32.652851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T06:05:31.703431Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.703431Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:9d04d81f7fb944ca8b0db4132e1c6248241fc58814ad9f971df56582d0aaa5e9","observation_id":"a61972d4-f41b-4aed-9ad7-4321c77f102a","resolution":{"observed_at":"2026-08-07T06:05:31.703431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.708822Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.708822Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:25e3c6b7496f09cca5e82cdd00d52128d38c1d3b15860562221bfca09a2e3ead","observation_id":"16671a50-c346-45eb-bcab-944ba321d299","resolution":{"observed_at":"2026-08-07T06:05:31.708822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.713608Z","title":"Cumulated gain-based evaluation of ir techniques.ACM Trans","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.713608Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:03b9884634c4f724811bd50d0a8dc261800a00ab46bad0fc92e203a7140ff890","observation_id":"507fc0cc-77dc-41f6-819b-9aa209ddced5","resolution":{"observed_at":"2026-08-07T06:05:31.713608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.631942Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"aa579397-d696-4523-819f-35fe1a2b19a1","year":2021},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.718360Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:09710c2433abd7d5caa9896de9265ff3dc5de6b2f88a465d4f9f793612388a1f","observation_id":"552d9585-d1f9-4858-9c82-fde725678c36","resolution":{"observed_at":"2026-08-07T06:05:32.635323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-07T06:05:31.723331Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.723331Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:d5176323dd4b04326a8494a78bad2305c1271ecd785986abc9b063443bd39611","observation_id":"2fb790ac-e2f2-40a2-bf1c-aebbb741db7a","resolution":{"observed_at":"2026-08-07T06:05:31.723331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.728907Z","title":"Dense passage retrieval for open-domain question answering","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.728907Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:ba27dd2011c2c7c75df3027ae2848301d50a74d23e5a518f8e18de30b6835754","observation_id":"7ad71b70-7828-4bcd-926a-111f73edcdc4","resolution":{"observed_at":"2026-08-07T06:05:31.728907Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.734527Z","title":"Colbert: Efficient and effective passage search via con- textualized late interaction over bert","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.734527Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:3198963ef448bbeb703881ffc11591f1f3b43a0ed76dc29e2b76272417d1fea2","observation_id":"5d801cd2-d676-4a75-ba06-a2f17672d1ac","resolution":{"observed_at":"2026-08-07T06:05:31.734527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11619","last_updated":"2025-02-10T17:26:40Z","snapshot_observed_at":"2026-08-09T02:44:18.942418Z","submitted_at":"2024-10-15T13:56:34Z","title":"MultiVENT 2.0: A Massive Multilingual Benchmark for Event-Centric Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11619","snapshot_observed_at":"2026-08-07T06:05:31.738189Z","title":"Multivent 2.0: A massive multilingual benchmark for event-centric video retrieval, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.738189Z"},"links":{"cited_paper":"/paper/2410.11619","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:a6d81af0b0b323bba5d058c347c3c0bdb7d9a2c714268b603caa7e88a09a1b35","observation_id":"65563c93-0fa7-45b7-bbe9-24eb6fa33d41","resolution":{"observed_at":"2026-08-07T06:05:31.738189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.742958Z","title":"Learning to rank for information retrieval.Found","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.742958Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:84a5ab6e485b79ddf91b9eda2735fac5e613f75a4221e057629c3c68906a4ca3","observation_id":"7ba335fd-29dc-4963-95c2-4718223f64d4","resolution":{"observed_at":"2026-08-07T06:05:31.742958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-10T14:43:16.360554Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-07T06:05:31.747047Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.747047Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:268e482aa964b0d7b329f59db193c105a2f5776fd9270003e9013818d61a0dbe","observation_id":"4a36bfaa-22be-4fb5-92c1-7335d9074463","resolution":{"observed_at":"2026-08-07T06:05:31.747047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.751704Z","title":"Handwritten optical character recognition (ocr): A comprehensive systematic literature review (slr).IEEE Access, 8: 142642–142668, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.751704Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:705df2552b3d5ab491882ac014285a160f97b6211998fc9e25610eb9039686ba","observation_id":"3a544e91-f00c-4ccf-963a-beedaf9bccc3","resolution":{"observed_at":"2026-08-07T06:05:31.751704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.621356Z","title":"Vladva: Discriminative fine-tuning of lvlms,","venue":null,"work_id":"f0211c3b-0cfe-495c-a1f1-6f894478b8f3","year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.755787Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:1a6e2680b8ac31ce6c908ea5c450cc308a2e6abfea4b617e1630eadbe48a2a79","observation_id":"3363841f-0da7-4353-aa11-8fee73981574","resolution":{"observed_at":"2026-08-07T06:05:32.624648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.764683Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.764683Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:b0d4639eedd382b07acb0c2505283e673a52c36ae5e4c9532c678afb9f73f26e","observation_id":"58b2133a-98ee-49e3-921d-dad0b7892035","resolution":{"observed_at":"2026-08-07T06:05:31.764683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04378","last_updated":"2025-05-08T19:16:29Z","snapshot_observed_at":"2026-08-11T22:16:48.221162Z","submitted_at":"2024-12-05T17:54:27Z","title":"VladVA: Discriminative Fine-tuning of LVLMs","version":3},"cited_work":{"arxiv_id":"2412.04378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04378","snapshot_observed_at":"2026-08-07T06:05:32.153318Z","title":"VladVA: Discriminative Fine-tuning of LVLMs","venue":"cs.CV","work_id":"42eb6bcf-dc23-4aa6-b716-37fcd4104581","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.760413Z"},"links":{"cited_paper":"/paper/2412.04378","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:4c0be1996cace13f3124ad88e79779b702767e64ce26dd4f935797f22ee7bd5b","observation_id":"642bb0b5-4a42-48eb-aa70-618792b5bc56","resolution":{"observed_at":"2026-08-07T06:05:32.158935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19009","last_updated":"2025-03-24T17:51:29Z","snapshot_observed_at":"2026-08-11T02:11:49.600432Z","submitted_at":"2025-03-24T17:51:29Z","title":"Video-ColBERT: Contextualized Late Interaction for Text-to-Video Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19009","snapshot_observed_at":"2026-08-07T06:05:31.776301Z","title":"de Melo, Benjamin Van Durme, and Rama Chellappa","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.776301Z"},"links":{"cited_paper":"/paper/2503.19009","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:34950babb1214a3a1830b6f59f041b2a12ddc0cd346105f8f1bd50705e5346d5","observation_id":"5c79f5b3-dc2d-496f-8114-a8704e143b80","resolution":{"observed_at":"2026-08-07T06:05:31.776301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T06:05:31.780127Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.780127Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:b796da2df6e81771eda8de1ca653ec4dfe8b873156d688c7a72e5e948a097513","observation_id":"5c85e58a-1f3e-4e94-a994-50e76e1fc131","resolution":{"observed_at":"2026-08-07T06:05:31.780127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T06:05:31.772749Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.772749Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:3e689c5733d933e15b85dc8d9ce589afbb10825f6f31ffcfea1be65de2a305f7","observation_id":"63cd450c-52ea-467c-b862-0b91c26bfd4f","resolution":{"observed_at":"2026-08-07T06:05:31.772749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.790322Z","title":"ColBERTv2: Effective and efficient retrieval via lightweight late interaction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.790322Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:6422f6fdcccadf4fe00f7f0646cfe0e52c29a7c6fd69fec713be6b0bdac15929","observation_id":"1ae11b3e-74b7-4d9c-a018-5a43742991c4","resolution":{"observed_at":"2026-08-07T06:05:31.790322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.795910Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.795910Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:685e8f50b690de33113462c2ea5ce7eebb69633a10455044cd763bbaff75695d","observation_id":"d37da703-0756-46f2-b5ff-e95065c779c1","resolution":{"observed_at":"2026-08-07T06:05:31.795910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20698","last_updated":"2025-05-09T15:18:56Z","snapshot_observed_at":"2026-08-07T16:35:03.898190Z","submitted_at":"2025-03-26T16:28:04Z","title":"MMMORRF: Multimodal Multilingual Modularized Reciprocal Rank Fusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20698","snapshot_observed_at":"2026-08-07T06:05:31.784566Z","title":"Mmmorrf: Multimodal multilingual modularized reciprocal rank fusion, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.784566Z"},"links":{"cited_paper":"/paper/2503.20698","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:16ed42e6f99e315b7e87429c17dd92e83f424e61563effd09c5cfb4a4d6787d3","observation_id":"2a0a17ba-f607-48f0-887f-96847c25dff2","resolution":{"observed_at":"2026-08-07T06:05:31.784566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T06:05:31.804178Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.804178Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:1acbbf35870125d33a1038ff88416ee4a05e07736fd188c7bfd4c6f27348c4a8","observation_id":"3036bb25-e930-48d7-bee1-519b5b577769","resolution":{"observed_at":"2026-08-07T06:05:31.804178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.811569Z","title":"BEIR: A heterogeneous benchmark for zero-shot evaluation of information retrieval models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.811569Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:5125110aa408b172386256ed170d62a5aa17cf997f7aa3df96bbbfb0027f929a","observation_id":"326d5b02-42de-418b-bea9-d24b4bf7571a","resolution":{"observed_at":"2026-08-07T06:05:31.811569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.598549Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":"9c18e021-9736-4976-9cb7-e2d8704ca058","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.800337Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:1b138c1a60b0d71b417f5027d800d7effc635bed0e78a2e7a82e5d90580be3ee","observation_id":"4bcb1f75-7ef4-4d63-beb6-aa3633bf30c1","resolution":{"observed_at":"2026-08-07T06:05:32.601741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.582488Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":"f5e63be7-458e-414c-a987-f8217df8ecb9","year":2020},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.819442Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:e415c291c1cb7d5d1298faa842704d7f7850815437203b045ad7539753d58b60","observation_id":"77fa6841-8759-45b8-aff8-227fbedaaf7e","resolution":{"observed_at":"2026-08-07T06:05:32.586001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-10T11:56:12.145224Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-07T06:05:31.825064Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos.arXiv preprint arXiv:2405.19209, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.825064Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:afaa392436e38176c79b5a5cc1ddb240150025441180fc7307fb4972670ee54f","observation_id":"bae2896b-f6e0-4548-b8bc-34a2e87c3ace","resolution":{"observed_at":"2026-08-07T06:05:31.825064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T06:05:31.815340Z","title":"Representation learning with contrastive predictive coding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.815340Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:24bf0fb4a2061590c0c6f7b63187a0997483330eec76fd32c70596defea4aa49","observation_id":"6f2d055e-5f99-4982-aa01-344b2833129c","resolution":{"observed_at":"2026-08-07T06:05:31.815340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.565598Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"eb14d027-10af-49a0-aff5-086babb88f25","year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.833276Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:a8b2a0313a8ce4bcf52f7c914749184cea2838f8deb594a6012b0bd6651763e9","observation_id":"88bb1e5a-a138-4970-8b01-4361cc5500b2","resolution":{"observed_at":"2026-08-07T06:05:32.569152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T06:05:31.843978Z","title":"Qwen2.5-omni technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.843978Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:c6b8fa5d5d1387ecbaa24a78df1b28c826959ca1b1a76af5fe44363110977519","observation_id":"868f1be1-500e-496a-b354-79f63cfaeca3","resolution":{"observed_at":"2026-08-07T06:05:31.843978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.829176Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.829176Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:764c617527059683205a170b2b5a7494204a0031579de921e820b857d0206423","observation_id":"d7dda32d-cafc-4d71-9d8f-2e263aedc925","resolution":{"observed_at":"2026-08-07T06:05:31.829176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20734","last_updated":"2026-05-18T05:53:24Z","snapshot_observed_at":"2026-07-06T21:16:27.689435Z","submitted_at":"2025-04-29T13:18:58Z","title":"UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20734","snapshot_observed_at":"2026-08-07T06:05:31.852256Z","title":"Uni- versalrag: Retrieval-augmented generation over multiple corpora with diverse modalities and granularities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.852256Z"},"links":{"cited_paper":"/paper/2504.20734","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:561010e88dd10b6b4ab20270ab60d5ce814a4c28b2da02e78b9495ad7c84304b","observation_id":"91c94b0e-fd37-4767-bc11-35a9a63c640d","resolution":{"observed_at":"2026-08-07T06:05:31.852256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.533894Z","title":"CREAM: Coarse-to-fine retrieval and multi- modal efficient tuning for document VQA","venue":null,"work_id":"be7ebf59-bcdd-435c-b5cd-585453a36a33","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.856797Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:177f6bf1de9cacc6f18b470db6dffa744af3a85cff63d9b411c11ae2fa18326b","observation_id":"2677d8dd-e083-4e7c-9b36-385150f719b7","resolution":{"observed_at":"2026-08-07T06:05:32.537696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.522991Z","title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment,","venue":null,"work_id":"8b630115-ebb8-4b87-8eb0-82f67a453914","year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.861838Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:b042a09582cccc06229a4d076d4b4f2e308f3237a37cb466374f6709df37cea7","observation_id":"cf2fcc13-053f-43f6-a2b5-69eea1c8d835","resolution":{"observed_at":"2026-08-07T06:05:32.526800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.545087Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"f4f0dc79-1848-49ee-b6a2-d9718cebed63","year":2016},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.847733Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:1da87279b2f6e60ede3e49f94c582085e18399c7b78c0e62b128c3f31f71fcbd","observation_id":"f2675d97-12d0-44d6-b24c-22b115211bfc","resolution":{"observed_at":"2026-08-07T06:05:32.548489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-07T06:05:31.866869Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.866869Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:1ec3d7539d83d458947a536d9a68676b0b5fe74dd05102931950dc20cd9e9dbf","observation_id":"42fd1618-52b1-4a1d-8bde-291cbfa58eaf","resolution":{"observed_at":"2026-08-07T06:05:31.866869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.719808Z","title":null,"venue":null,"work_id":"78abcf77-6280-4ab4-a0ff-e54700612505","year":2022},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.648707Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:9d21643fa9cc2fab340f69eea369530746fda956893a72dbbea3013c8914595d","observation_id":"79d1128f-70a1-45c3-bf22-9e356735e2a4","resolution":{"observed_at":"2026-08-07T06:05:32.722824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.555540Z","title":null,"venue":null,"work_id":"1ab5fb42-c70b-4f16-877f-aea0059d1fe3","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.839371Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:ca39b82417db2519927bd68c0a3c49ec41319dcdfcd33b31493e6b43d9182e94","observation_id":"245a8727-c197-4289-ba3c-9bed0af1a4b6","resolution":{"observed_at":"2026-08-07T06:05:32.558569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T06:05:31.640938Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.640938Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:6469629d27859f462b8832fd8e83b8f97dd6a41e489984f21c8651c263e7d603","observation_id":"739bd388-8da6-4992-be2b-18cddfdd5aac","resolution":{"observed_at":"2026-08-07T06:05:31.640938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T09:05:23.257309Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 2 inbound Pith citation observations for arXiv:2506.06144."}