Pith. sign in

Paper Citation Record · LEDGER

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation

As of 9 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2502.01719.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.01719 v3

Coverage vector

measured 26 of 26 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T14:50:57.966778Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-02T04:57:35.897847Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-12T05:21:28.330245Z

Reference resolution

26 of 26 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c902011e-ed88-4d8a-a700-56eb392f4290 · outbound

This paper cites MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.885137Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.885137Z digest=sha256:d88b8c9239054e1dd9d2850571066a9e99f34358904fc0194cf23dc275075a02

Observation b19a72e5-4a3b-45df-bf1b-31adeff16713 · outbound

This paper cites DALL-Eval: Probing the Reasoning Skills and Social Biases of Text-to-Image Generation Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation DALL-Eval: Probing the Reasoning Skills and Social Biases of Text-to-Image Generation Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.889185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.889185Z digest=sha256:26858f80d439f1359caa2b6e605754b9b973b784e2666d898053372582faac82

Observation e361d06b-a7f7-45e5-a823-d12ab4b841e1 · outbound

This paper cites Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.893552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.893552Z digest=sha256:2d9681288669158cb19a4ed0f158efbfabf01690d0f4d71c86b464824a78fe3e

Observation cf5f9fa4-6811-4749-9553-fe979dc78699 · outbound

This paper cites SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.897972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.897972Z digest=sha256:376340f6e8f63d99380fe9973dc7c2cc455b785f0ab55706e76eeb671936245c

Observation 31da6ec9-f403-4622-8549-7666b9ed3bf4 · outbound

This paper cites VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.902010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.902010Z digest=sha256:cebd70931c841607ba1a89d6e7321a9fc5c1e100e2789f9796a890f511203ceb

Observation e7b1dff2-1328-498d-b9f6-64343387d609 · outbound

This paper cites Diffusion Reward: Learning Rewards via Conditional Video Diffusion.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Diffusion Reward: Learning Rewards via Conditional Video Diffusion

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.909565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.909565Z digest=sha256:509fa3084315174d383f5231377b74a0d758f6c558cf76f08c96786a39e2612f

Observation 940f8bf8-7f64-440a-b02a-2f8fe3a01b66 · outbound

This paper cites A Survey on Long Video Generation: Challenges, Methods, and Prospects.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation A Survey on Long Video Generation: Challenges, Methods, and Prospects

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.913295Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.913295Z digest=sha256:f5e70b4ff52057e12f0f24d1165780f4a39f0beb8951dc565a8bc741a73a8408

Observation 4b1e9b65-5473-4700-bd27-c909f8f839b9 · outbound

This paper cites GPT-4 Technical Report.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation GPT-4 Technical Report

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.917495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.917495Z digest=sha256:7654e57a55a03918fadd4973a352b32c0ac425d7c29435067d752f696526249d

Observation 68b6ab1f-7e35-4b6d-9756-3c7500679f1e · outbound

This paper cites Make-A-Video: Text-to-Video Generation without Text-Video Data.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Make-A-Video: Text-to-Video Generation without Text-Video Data

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.928717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.928717Z digest=sha256:ad62d85ed2c9c611c0a0c816c8503381d0278a5a22661f245737a44aa477c7e8

Observation c6e343ae-abc6-4b30-8579-238b983a6dc2 · outbound

This paper cites Chameleon: Mixed-Modal Early-Fusion Foundation Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Chameleon: Mixed-Modal Early-Fusion Foundation Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.931994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.931994Z digest=sha256:6fd510cd194524b423ae5486231eed9c79a3bf0eadffe76159c0a38c3d2f04a0

Observation 7298da64-b8ba-439c-b17d-a9718811fac6 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Gemini: A Family of Highly Capable Multimodal Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.935225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.935225Z digest=sha256:1345305bc822eba4537d7dcf9bb69d67da0d12bd9756f7250b9749ba2bec3593

Observation 3355686f-75a9-4a76-ab65-d5a32a263c78 · outbound

This paper cites DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.942282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.942282Z digest=sha256:133f28c52ae5f03117f6c2404add20e5249e757c4983b8085eec75018d2a6eca

Observation d820e77e-2870-4205-b739-4e60b49df5cc · outbound

This paper cites VisionLLM: Large Language Model is also an Open-Ended Decoder for Vision-Centric Tasks.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation VisionLLM: Large Language Model is also an Open-Ended Decoder for Vision-Centric Tasks

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.945485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.945485Z digest=sha256:89dac1c7d9c3cec8f3301bdad9661f899fd13fe22bd27be68f286f98b1ddebbb

Observation 18de5102-b8ef-4bbe-9ebb-5082ecc8559a · outbound

This paper cites Show-o: One Single Transformer to Unify Multimodal Understanding and Generation.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Show-o: One Single Transformer to Unify Multimodal Understanding and Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.948739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.948739Z digest=sha256:bb8d4aa17aaa52caeb4bbc8bd75be37f14571555d14473748f6796be6e4c91e5

Observation 543902d4-b4fd-450d-a4e2-9555554887b0 · outbound

This paper cites VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.952377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.952377Z digest=sha256:6ed66a11ca68f479cc46efc172dc88df69faadd14820376c7e86f63345d2527d

Observation 808510b2-bf62-40ad-8c98-2d07349a852f · outbound

This paper cites Associating Objects with Transformers for Video Object Segmentation.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Associating Objects with Transformers for Video Object Segmentation

Reference 23

Resolution
metadata mismatch
local_arxiv, observed 2026-08-09T14:50:58.082909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T14:50:57.955826Z digest=sha256:fa1bbc03f2da94da1982c1093573ee8a71d806b44f3338ad6d7067e6972921f3

Observation cb8b47de-5906-4be4-b685-a637e828abe3 · outbound

This paper cites GRAPE: Generalizing Robot Policy via Preference Alignment.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation GRAPE: Generalizing Robot Policy via Preference Alignment

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.959258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.959258Z digest=sha256:b5faedb8d3d6d7b8b5fe5ff0d343a920b62f15f2fe58209f6febfdbb84631a48

Observation 012f479a-c891-47aa-87fa-3f77cbac2f10 · outbound

This paper cites Mixture-of-Experts with Expert Choice Routing.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Mixture-of-Experts with Expert Choice Routing

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.962595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.962595Z digest=sha256:4124ee7daebac562668510985c7544515e0b473054e058437a660b5cefbd481b

Observation f111550d-423f-451b-ba4f-9d6c8a80886c · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Fine-Tuning Language Models from Human Preferences

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.966778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.966778Z digest=sha256:678ba254dfd35d669c6dbe8eab44fba51471ac941268a788c3373bde21701751

Observation df2e0476-f0a3-4523-bb94-080a5c9bdbc2 · outbound

This paper cites Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.924526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.924526Z digest=sha256:86f4e6ed5971c156743fa9b4293ab99e3235374a2820a0c713b26c0c7777ceaa

Observation 511e3394-7d03-4e7e-bdbf-3c0957756164 · outbound

This paper cites Towards Accurate Generative Models of Video: A New Metric & Challenges.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Towards Accurate Generative Models of Video: A New Metric & Challenges

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.938692Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.938692Z digest=sha256:9f7cb7690521ec2f4720099fa6344104c65eadcd7f891a4cb641a9d4064c407d

Observation 81f87eac-27cf-4f26-89ab-aec9c2aeef4d · outbound

This paper cites FineGym: A Hierarchical Video Dataset for Fine-grained Action Understanding.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation FineGym: A Hierarchical Video Dataset for Fine-grained Action Understanding

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.920834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.920834Z digest=sha256:041889a7c28565495e1fc72ad00c3776c5eb5d38b6683b7927b4f130882e6d72

Observation cba47147-b9b0-4b7f-939c-1f90b209719d · outbound

This paper cites One TTS Alignment To Rule Them All.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation One TTS Alignment To Rule Them All

Reference 2021

Resolution
metadata mismatch
local_arxiv, observed 2026-08-09T14:50:58.284874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T14:50:57.871440Z digest=sha256:459162c487643462afe0b2efdcbd8a6bdd15c8784ed412be84f470d947e1f235

Observation ef73c384-81b3-48ff-bca4-fccd4f05615f · outbound

This paper cites CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.906100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.906100Z digest=sha256:d74801050e0b7f6954163a9fd64d3ae979d87049db2ab919406bd393665efe78

Observation 89b97d76-42fb-48ef-89f0-0a658a9913ee · outbound

This paper cites Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.876146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.876146Z digest=sha256:5a35779707d96c4dcda3b55e8382c2cdf2927ddc8fc7103d8b1486c2482b753b

Observation 10fa3c44-f736-4195-8948-87ab1bf63927 · outbound

This paper cites A Survey on Mixture of Experts in Large Language Models.

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation A Survey on Mixture of Experts in Large Language Models

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-09T14:50:57.880468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:50:57.880468Z digest=sha256:78fdf45ab5ba04646da99efd5a9f09b39737414df8d120360a9df0ccca924cae

Pith citing papers

Observation 28313f88-cbbb-403d-bfea-a7e042f23e29 · inbound

PhyGround: Benchmarking Physical Reasoning in Generative World Models cites this paper.

PhyGround: Benchmarking Physical Reasoning in Generative World Models MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-12T05:21:28.398672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-12T05:17:30.010064Z digest=sha256:e3216af05615d6aa3a39c4b3ff1cdf822d0d8a5f59259e4755fcc0277def66b0

Observation 425b4dc6-3fd3-4a6c-a61f-331fce530317 · inbound

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation cites this paper.

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-02T04:57:35.897847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T04:57:35.897847Z digest=sha256:86dd4ec8c062a9396039d4fa9aec28723157deb7f80af369c00ca844925f24c1