Pith. sign in

Paper Citation Record · LEDGER

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.04302.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.04302 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T20:16:34.534847Z

measured 44 of 44 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

44 of 44 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved41
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 90e525e9-c911-4328-8b70-a47174a6dd66 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.384643Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.384643Z digest=sha256:c9e49c6e89bb34f3fd486d7a62a2b053cd323500c98bbe1c2266654e4fb8ca8f

Observation 4e682979-f303-4655-b98c-24f72a54a037 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.388393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.388393Z digest=sha256:37c3924bfc9edd21a9488e3e25f7391bba109a12a804bd3a658c2b8fbfb8496e

Observation 0f2bfdb1-5068-4b29-be5b-870da079cc2d · outbound

This paper cites Chen and William B.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Chen and William B

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T20:16:35.104578Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.391706Z digest=sha256:6126a17be42454358da0382bfdac8cc7166a63b24cce4d855df691711d6c5ec7

Observation a7d1e4bd-17d0-4489-930c-6456b1bfe081 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.095184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.395440Z digest=sha256:5ed247659c4e4e44200bc96c80dac3f821a19f652913822afaa1a8c3896eab6f

Observation 2970c550-7d5a-40d3-af60-fceb9b8a81b4 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.086217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.399584Z digest=sha256:5d32d61903164e9ca22df9dfe0f538d6975b6e15bece0aceb5e5b7fbff55d321

Observation 1582c9de-4f47-4d4a-8780-68c4ea6c95a6 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.076467Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.402917Z digest=sha256:c254f844c60600fd1004f451d84667f8bb7f07e5c72de8a95d2f3f78123f1bb6

Observation a3f21455-f719-443b-b591-f809e8fcb211 · outbound

This paper cites Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.407013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.407013Z digest=sha256:6373d22480c606365d116e9d56d9ba22eec06c1c64aed4cda84213f0af2437ae

Observation 753642d1-50af-464c-bab4-1dbbf9911e8d · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.067015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.410609Z digest=sha256:fc41355dc0bc079c6043c9337799a2e9f7493c1ff68304d21ed017b91d0c7bf8

Observation 4e8b7751-3cab-4e9c-99a7-fcdc69b33bf6 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.057546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.413771Z digest=sha256:612f108bc852e5751ee6889d239bd82c124190ea7e7125df2b50e84646c05dba

Observation 8a56f043-1a1d-424c-b117-8fd3bc998e03 · outbound

This paper cites KaLM-Embedding: Superior Training Data Brings A Stronger Embedding Model.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models KaLM-Embedding: Superior Training Data Brings A Stronger Embedding Model

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.420783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.420783Z digest=sha256:faad76b593ee9f95b9e6a1e936e133798375fb943e0ab6f7d96213308dcfaa81

Observation 62aedf90-4082-49ee-a8cf-ed397a9707f1 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.038685Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.424459Z digest=sha256:5ed9ea9da36e8e7f5c07647fe3604af72536fc86553e1cafd38e53b58fc7cf40

Observation 019bf947-3c2d-4f9a-a848-4d6e6bd4dfc0 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.028386Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.428250Z digest=sha256:5a6c6a317a2d0140ee63996e32d85ec89aca1833302cce5fd16004235cf3dd15

Observation d71e7e95-8a7d-4cc2-b0a1-5d27b15878c0 · outbound

This paper cites NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.431149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.431149Z digest=sha256:a8af650a881158e45073aa31b4c293bd4b09c29a1c31cf04b45a2c5465cd729f

Observation 3831fa8c-bf59-40f4-8171-172052cb4d29 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.018077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.434606Z digest=sha256:4af62c4695922c1c738e3b797a98079f0091d9d89f0e3e690393c9a3d1b516ed

Observation 7bad7fbf-c2d1-4e61-9f9f-4fdd4728a3ee · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models VideoChat: Chat-Centric Video Understanding

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.437738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.437738Z digest=sha256:882af0905df5433cc8b895a6ccfc91e4ffd1a59ddc0395aa8a3ff40d38645ed5

Observation a617dda4-f763-4c75-84bd-f36af7609cbb · outbound

This paper cites MVBench: A Comprehensive Multi-modal Video Understanding Benchmark.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models MVBench: A Comprehensive Multi-modal Video Understanding Benchmark

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.442248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.442248Z digest=sha256:a96c3adc7411eb3977ef22807af1785c029205fd3eb66c6ade64052a927308de

Observation c2dd8dab-8c8d-41b1-a819-aae22ea875c6 · outbound

This paper cites Towards General Text Embeddings with Multi-stage Contrastive Learning.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Towards General Text Embeddings with Multi-stage Contrastive Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.445759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.445759Z digest=sha256:404fc4006d286ebeb7a6e243cc206b185c32476c179c3dfcfd798d67bfa6a454

Observation 889c4ed5-d568-4b95-9361-65fcc4896386 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.449441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.449441Z digest=sha256:8f4ecd8447e433a2430ea5c6baf27d3f4f1f5f41b6f3d79edacd062dd2c3679f

Observation b467bf61-ccd9-4622-bc0d-5a605a726cc7 · outbound

This paper cites G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.452692Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.452692Z digest=sha256:48f84658f39fcc3537860e4052f954698e87a27b77e961b6017a8b2f929dd6cd

Observation c1a17fd2-de85-469d-80e4-623e86192b12 · outbound

This paper cites MTEB: Massive Text Embedding Benchmark.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models MTEB: Massive Text Embedding Benchmark

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.456111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.456111Z digest=sha256:8407b99b58e1946f8d379f123a68bd127f80d69fc9463243fd9b8c5c14e6335e

Observation 507ddfc6-018c-4dad-a926-47cd89f360e5 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.002669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.459488Z digest=sha256:31a3e40a77916386fcf8dbba23c6b7daa7dd194c7d8c198cf164f243abb65b09

Observation 8e850048-92e3-4996-93b0-6887b42a6d0d · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.992472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.462356Z digest=sha256:076dee5a147cda5729afac8a0750097ccc179626f0f35fb6b530ddd5d3f9b8bd

Observation b69efeb4-e38f-409a-9cd4-4175dc29d9cc · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.982682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.465238Z digest=sha256:d5479559cdbef88a521e9f52b471f1f9ec9148c37e533f131a150935a9b96045

Observation a96b9b52-63ca-4bae-a291-4e8dc2f7bad5 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.973646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.468308Z digest=sha256:e13e41faa45060eb6ca75006c36d0a2f2994531a4b7b805ba1d6e08439acd72a

Observation 8c17c894-8ce3-49cd-8f47-08d5f941c46d · outbound

This paper cites LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.471457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.471457Z digest=sha256:8c95122b1553df75c35e8db84576b51309322f055e5d095fe744263f56d92e09

Observation 771885ca-b742-45d0-a498-9af0ca2f7ee1 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.964283Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.474698Z digest=sha256:bea1bb38bd3bad89b59960f669dd2c846f0d15075a25bece0b0f6ef52b6a3444

Observation 73fa8f2e-070a-432e-8175-c93a6b3a08b2 · outbound

This paper cites Learning Video Representations using Contrastive Bidirectional Transformer.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Learning Video Representations using Contrastive Bidirectional Transformer

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.478560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.478560Z digest=sha256:9080a6bc69fa83e5610dadd10696352c976d7f348a6112f6044c6d28b7b2bac6

Observation 0f6d5388-38ec-4119-a6ee-04a42b624e94 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.481893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.481893Z digest=sha256:4368a1eb9b9d8170108f471da4d5617b0e69d234457a6daa5adeff48a0b794f0

Observation 0fa63ce4-1d95-4a3b-9e06-517f3a94d643 · outbound

This paper cites Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.488639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.488639Z digest=sha256:ab9c95e15f4a30aa34e21a24bcc981901b2d499b8fbe1b5930de25c70553edf9

Observation d70a72fd-307e-41a1-a376-8e986d791e13 · outbound

This paper cites G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.491879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.491879Z digest=sha256:4a4db69efa17421c477dfd168bc27e84d7db37993a9ee845055e7bfdb54ad576

Observation 689f95e0-4559-4c78-b7d5-3a11add0247e · outbound

This paper cites Lawrence Zitnick, and Devi Parikh.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Lawrence Zitnick, and Devi Parikh

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T20:16:34.948925Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.495285Z digest=sha256:d2c81ba2a8ed5998177042fd9c81cb9d38eb737253e1032ff7890a04e7250031

Observation 2b055535-333b-46f3-842e-8ed682e17685 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.937718Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.499179Z digest=sha256:0d1a069a07ce35ae1f342fb12f618fc27bc174a5943347f5cad3d8bb25017f6f

Observation e54ea5e1-88ee-4922-9c2b-4b77e1e5fece · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 33

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.927429Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.502196Z digest=sha256:27bf128a51ffcfad8a86e3766cfbb37e773397468704a06cbd94af70cded85f7

Observation d072fc63-4471-401d-bf6e-e8000cacb45b · outbound

This paper cites LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.505752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.505752Z digest=sha256:07d15e61b4433cf0e08fbdc689dd94a349ef1a4901466136175aba7c141b287e

Observation 5b7356d2-bb7e-4cfa-a6dd-1917d7cbd8d4 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.915969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.509235Z digest=sha256:162a69fca0c783ef4c2e8549f97cc4aef30eb4bf52ad4680e355f80de2a4b5af

Observation 8f2f3108-e4f0-452b-b364-3f7e77b4f820 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.906687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.512146Z digest=sha256:9ac03c099f84667586b16293bb852448e5c9d92b74b21f8067c4bc60d7a09c1b

Observation e000a909-aa83-4292-8add-ad6365a077d3 · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.515394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.515394Z digest=sha256:24f65604a09c88fa026fa17d2abe5239171432f0ef643c3c74643d8cf45c892e

Observation ce66fc99-86aa-49a4-b4f6-8ba6306c0928 · outbound

This paper cites mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.519439Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.519439Z digest=sha256:4f3b569816c80daeca85aab2e5be9e91d26c8ce94e7f790770d209b4f0d33d3a

Observation 021e247e-457f-43cd-9895-70703f97fa2f · outbound

This paper cites VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.522728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.522728Z digest=sha256:66a5f98cdfe2d98b86aba160121f58a93a3758c259b9dcb5fb5276198c19c3cc

Observation b4ba473f-b6a0-47c2-ae54-75b5cb21f295 · outbound

This paper cites Weinberger, and Yoav Artzi.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Weinberger, and Yoav Artzi

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.526845Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.526845Z digest=sha256:a629050e80315fe1756331d7f2bc8d2a58705029f7e36b910bda3fcdaab78a67

Observation d3bb8d43-6a44-48f6-97ce-44bf046ab13d · outbound

This paper cites The Three Amigos.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models The Three Amigos

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T20:16:34.885101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.534847Z digest=sha256:99a443b415a2c0b0229f90fe8e311f08685692e970e13d4488fccf3d9cfd8722

Observation befd7d9a-3877-4b66-8cf0-7bd50b3d465f · outbound

This paper cites VideoBERT: A Joint Model for Video and Language Representation Learning.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models VideoBERT: A Joint Model for Video and Language Representation Learning

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.485103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.485103Z digest=sha256:a84a272b08acb76ee1fdef38dca785296898082048852863a0047d4791fb0e4e

Observation 8c6cc8b1-86bc-4485-b3ff-4f98c9eb1f1a · outbound

This paper cites InInternational Con- ference on Learning Representations.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models InInternational Con- ference on Learning Representations

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.530050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.530050Z digest=sha256:dda3ca9b0e69e0ca6d75d5d3adcc4a9d9bdd67f0aa8e1963e9885be628d104cf

Observation 2377a7b3-aeab-4418-b237-7c6ff0290edb · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 2022

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.048356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T20:16:34.417144Z digest=sha256:0dc976976bb57c487768adac243cc8ab8c63677bd7fe3cc1ae3a1a35a7eecaa3

Pith citing papers

No inbound Pith citation observations are available.