Pith. sign in

Paper Citation Record · LEDGER

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation

As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2502.01719.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.01719 v3

Coverage vector

measured 26 of 26 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T14:50:57.966778Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-02T04:57:35.897847Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-12T05:21:28.330245Z

Reference resolution

26 of 26 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c902011e-ed88-4d8a-a700-56eb392f4290 · outbound

This paper cites MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.885137Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.885137Z digest=sha256:050449f1568821055cd5b5a4fa4387adfde597a607a8f9cf117f1582a3c919e8

Observation b19a72e5-4a3b-45df-bf1b-31adeff16713 · outbound

This paper cites DALL-Eval: Probing the Reasoning Skills and Social Biases of Text-to-Image Generation Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation DALL-Eval: Probing the Reasoning Skills and Social Biases of Text-to-Image Generation Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.889185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.889185Z digest=sha256:a2a00f0b0b7b30f0d108879211aad7fb500fa7d7bc7131d355e99a52a1cc45f7

Observation e361d06b-a7f7-45e5-a823-d12ab4b841e1 · outbound

This paper cites Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.893552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.893552Z digest=sha256:4492266e0edfc9dd6ceab961ae5cb1fbbde00e457d0c2177d1970c79ccb87b47

Observation cf5f9fa4-6811-4749-9553-fe979dc78699 · outbound

This paper cites SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.897972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.897972Z digest=sha256:66eb4f623da2b0a150fb504656c79a0ba4721b88bdfd989e181bde8806b74d89

Observation 31da6ec9-f403-4622-8549-7666b9ed3bf4 · outbound

This paper cites VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.902010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.902010Z digest=sha256:f10352d443b5f5b84ab3bbd577086fa34b4a175b06b5257c9eb99903a7b7160a

Observation e7b1dff2-1328-498d-b9f6-64343387d609 · outbound

This paper cites Diffusion Reward: Learning Rewards via Conditional Video Diffusion.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Diffusion Reward: Learning Rewards via Conditional Video Diffusion

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.909565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.909565Z digest=sha256:162cc9cc163f29c46834603f72651abde86cbc1c455c56eb7df7795ba06597f7

Observation 940f8bf8-7f64-440a-b02a-2f8fe3a01b66 · outbound

This paper cites A Survey on Long Video Generation: Challenges, Methods, and Prospects.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation A Survey on Long Video Generation: Challenges, Methods, and Prospects

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.913295Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.913295Z digest=sha256:98358b33c2d99bcff1c77fa8ef5114544e8cb6d8c29986e51b6585f4e427135a

Observation 4b1e9b65-5473-4700-bd27-c909f8f839b9 · outbound

This paper cites GPT-4 Technical Report.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation GPT-4 Technical Report

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.917495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.917495Z digest=sha256:b229dd15b3f51353db7bdf92132b9e7b5c2092a16903d7f653428fe7d150194e

Observation 68b6ab1f-7e35-4b6d-9756-3c7500679f1e · outbound

This paper cites Make-A-Video: Text-to-Video Generation without Text-Video Data.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Make-A-Video: Text-to-Video Generation without Text-Video Data

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.928717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.928717Z digest=sha256:ba08ef56479e25e9fe4024ba44ed0ed4d11ad307eb80bf38a5f75dc7d0442173

Observation c6e343ae-abc6-4b30-8579-238b983a6dc2 · outbound

This paper cites Chameleon: Mixed-Modal Early-Fusion Foundation Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Chameleon: Mixed-Modal Early-Fusion Foundation Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.931994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.931994Z digest=sha256:2efc4ebc8d3106f8af9dbcf61a4a65d11eb0a943afd1b8ea48fb6477e67e9a7c

Observation 7298da64-b8ba-439c-b17d-a9718811fac6 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Gemini: A Family of Highly Capable Multimodal Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.935225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.935225Z digest=sha256:e9df8e9b0ed886fe0ef708a700b14568128f6c08d0ac7369f253c1ea2a6d3e8c

Observation 3355686f-75a9-4a76-ab65-d5a32a263c78 · outbound

This paper cites DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.942282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.942282Z digest=sha256:c89f41dc6b2b15d2a10857a4fe67540afa7eb7c089b2d71f4fbce3bafe2b217c

Observation d820e77e-2870-4205-b739-4e60b49df5cc · outbound

This paper cites VisionLLM: Large Language Model is also an Open-Ended Decoder for Vision-Centric Tasks.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation VisionLLM: Large Language Model is also an Open-Ended Decoder for Vision-Centric Tasks

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.945485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.945485Z digest=sha256:806942e5728d3bf467e7b358ff90913bb08a891c4aeec5d79a826e545f6cadb6

Observation 18de5102-b8ef-4bbe-9ebb-5082ecc8559a · outbound

This paper cites Show-o: One Single Transformer to Unify Multimodal Understanding and Generation.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Show-o: One Single Transformer to Unify Multimodal Understanding and Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.948739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.948739Z digest=sha256:8b6ba085a7034e28517e5cdb1fd2a21296a0040787de75c05e4ad702a209a4f4

Observation 543902d4-b4fd-450d-a4e2-9555554887b0 · outbound

This paper cites VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.952377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.952377Z digest=sha256:9a1ed67c9690bfd90da735282814bd49a1dec5e093aa732b5f2efa9890f24e07

Observation 808510b2-bf62-40ad-8c98-2d07349a852f · outbound

This paper cites Associating Objects with Transformers for Video Object Segmentation.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Associating Objects with Transformers for Video Object Segmentation

Reference 23

Resolution
metadata mismatch
local_arxiv, observed 2026-08-09T14:50:58.082909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T14:50:57.955826Z digest=sha256:748bc56324153a5e27ce954412c4f9c057d8e463b857758ed369f2eb69e4491c

Observation cb8b47de-5906-4be4-b685-a637e828abe3 · outbound

This paper cites GRAPE: Generalizing Robot Policy via Preference Alignment.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation GRAPE: Generalizing Robot Policy via Preference Alignment

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.959258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.959258Z digest=sha256:0120abe6b7536eca76af52ef834378377e8c8c601dd04ee592357c76d41b2995

Observation 012f479a-c891-47aa-87fa-3f77cbac2f10 · outbound

This paper cites Mixture-of-Experts with Expert Choice Routing.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Mixture-of-Experts with Expert Choice Routing

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.962595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.962595Z digest=sha256:e506fdf05a260d10678ee7c4d67c95230e5f38191d7bd4d29721b656d6c5a315

Observation f111550d-423f-451b-ba4f-9d6c8a80886c · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Fine-Tuning Language Models from Human Preferences

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.966778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.966778Z digest=sha256:7ee20a2c8578359b9e33d06c2f1d0d223b92953d3c9a3805c014a13b236ee66f

Observation df2e0476-f0a3-4523-bb94-080a5c9bdbc2 · outbound

This paper cites Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.924526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.924526Z digest=sha256:0ff61289763b97c5c6a10132894b2078e7105b6607c5e66d12e090dcb3caf7ea

Observation 511e3394-7d03-4e7e-bdbf-3c0957756164 · outbound

This paper cites Towards Accurate Generative Models of Video: A New Metric & Challenges.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Towards Accurate Generative Models of Video: A New Metric & Challenges

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.938692Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.938692Z digest=sha256:2cd3d13d9a7998d2eb9cef5fca6039410ae59e105c6624c2a9ebbb92b6e61018

Observation 81f87eac-27cf-4f26-89ab-aec9c2aeef4d · outbound

This paper cites FineGym: A Hierarchical Video Dataset for Fine-grained Action Understanding.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation FineGym: A Hierarchical Video Dataset for Fine-grained Action Understanding

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.920834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.920834Z digest=sha256:00640ac0197d4020cda2108318cbecae8a5417e0cd8a59d7df287304bfebff17

Observation cba47147-b9b0-4b7f-939c-1f90b209719d · outbound

This paper cites One TTS Alignment To Rule Them All.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation One TTS Alignment To Rule Them All

Reference 2021

Resolution
metadata mismatch
local_arxiv, observed 2026-08-09T14:50:58.284874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T14:50:57.871440Z digest=sha256:7fa4b2f0f92df76f8a5d69928db2ce0914408a0bc36c941e0b46a943c6962716

Observation ef73c384-81b3-48ff-bca4-fccd4f05615f · outbound

This paper cites CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.906100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.906100Z digest=sha256:5b1fc2d7707bd8bda1f32902b4ea58dc909d094e6b922552faf322b844229b1a

Observation 89b97d76-42fb-48ef-89f0-0a658a9913ee · outbound

This paper cites Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.876146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.876146Z digest=sha256:4a5edc928ae32ccbeb6fdf42c79194fe5a699a52894b28a7b895403fa477c239

Observation 10fa3c44-f736-4195-8948-87ab1bf63927 · outbound

This paper cites A Survey on Mixture of Experts in Large Language Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation A Survey on Mixture of Experts in Large Language Models

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.880468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.880468Z digest=sha256:95e559f3da66e0fdcebdf3aaf8eb9733bc38a7fdf56d89b8b85550d3d072a68c

Pith citing papers

Observation 28313f88-cbbb-403d-bfea-a7e042f23e29 · inbound

PhyGround: Benchmarking Physical Reasoning in Generative World Models cites this paper.

PhyGround: Benchmarking Physical Reasoning in Generative World Models MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-12T05:21:28.398672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-12T05:17:30.010064Z digest=sha256:77ed96f8a5eb14034cefbf20e775232dda6d9be1aafa8a567708df4606833191

Observation 425b4dc6-3fd3-4a6c-a61f-331fce530317 · inbound

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation cites this paper.

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-02T04:57:35.897847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T04:57:35.897847Z digest=sha256:a0fd42512b3f11dc24d6c8c0c69a22b86480753fc044fba5e564582562e21992