Pith. sign in

Paper Citation Record · LEDGER

CyberV: Cybernetics for Test-time Scaling in Video Understanding

As of 10 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 4 inbound Pith citation observations for arXiv:2506.07971.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.07971 v1

Coverage vector

measured 66 of 66 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T05:26:47.320450Z

measured 70 of 70 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T02:11:48.455492Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T08:17:45.840937Z

Reference resolution

66 of 66 outbound references displayed

  • verified exact2
  • verified fuzzy14
  • unresolved49
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b7185dab-cc29-44f0-aed7-77af05663516 · outbound

This paper cites Critique-out-Loud Reward Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Critique-out-Loud Reward Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:46.991810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:46.991810Z digest=sha256:c80c756f9b52d0419babb7665b1b92d5728506f5a15de56254faea2d835d93c0

Observation 5e3845e7-e9b5-42bb-816b-bb375d6c6faf · outbound

This paper cites Claude Team.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Claude Team

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.518617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:46.997671Z digest=sha256:8755b4ac514811f18df29a0fa09c67d386bcffe96fbd30a911f54e2b70608b2c

Observation e740239e-8ac9-486c-9fa1-c8791206aeee · outbound

This paper cites An introduction to cybernetics.

CyberV: Cybernetics for Test-time Scaling in Video Understanding An introduction to cybernetics

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.003174Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.003174Z digest=sha256:723370e1085154307bd57eb93908bd07ead775456da0fe448a93b57f41c7e3aa

Observation 2929c73e-7163-4694-b270-508417fda755 · outbound

This paper cites Qwen Technical Report.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Qwen Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.008776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.008776Z digest=sha256:f5cf5c6390a0717b4bf62b38271e9874e5619e0714a8da18220a2adce839ce1a

Observation c4de9698-e180-4017-8a64-20932ec07567 · outbound

This paper cites Qwen2.5-VL Technical Report.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Qwen2.5-VL Technical Report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.014066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.014066Z digest=sha256:583f67bd8d145a22291ad5d51d31350424d54bcf26a2d6d3707bda3c3665bfe5

Observation 18dedfcc-cf37-4917-9de4-ba0fdaf51c54 · outbound

This paper cites Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.019699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.019699Z digest=sha256:80ab98279deed7036b8a58f9da4a4c08936ebe7883d819b517e4bae1b1eb0ed2

Observation 994a85ef-f28d-40c1-95b8-db86e8829a82 · outbound

This paper cites Large Language Monkeys: Scaling Inference Compute with Repeated Sampling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Large Language Monkeys: Scaling Inference Compute with Repeated Sampling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.025491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.025491Z digest=sha256:808ac9a73997aa2e55524c414b245a8a804f9eea98d5528f22ec222e69264177

Observation 58bd6a79-63cc-4f58-8fa3-bbd7fae87bb7 · outbound

This paper cites On the importance of being emergent.Constructivist Foundations, 5(2):89, March 2010.

CyberV: Cybernetics for Test-time Scaling in Video Understanding On the importance of being emergent.Constructivist Foundations, 5(2):89, March 2010

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.492129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.030997Z digest=sha256:2ccb99e9e47a555849055c60d108d2f46d3a1c52aa3b6e8fb8a453d74777b1b9

Observation 6c5ab84d-8850-40dd-9b20-a4b9d5966bee · outbound

This paper cites Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.036084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.036084Z digest=sha256:b1de61dcc6786e8578befff56ff0fc5da1755fb6e8a6ebd08264ea412881d707

Observation b4960047-268e-4d75-b7d9-b582d9ccbe2f · outbound

This paper cites How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.

CyberV: Cybernetics for Test-time Scaling in Video Understanding How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.041414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.041414Z digest=sha256:f34a06635501841e8bcaf57ddacb1f845735d46fc0d0310f23cc611b279ed0f9

Observation eba9dc51-6926-4f79-af91-9d81a4c118ce · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.046212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.046212Z digest=sha256:f0a5e204ccfb5d643d2b49bd457f0422d7a5398a835ca40b23d712dc3d0f65da

Observation bf7bc706-83ea-43bc-ae03-0ce04f6be90c · outbound

This paper cites VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.051059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.051059Z digest=sha256:8f045b0ad0bcb1149338014cda8479c05604b2d4fadaa69e959ed62324db43bc

Observation 6438f68a-91c3-4f0e-b688-9341f1f30ad5 · outbound

This paper cites Video-of-thought: step-by-step video reasoning from perception to cognition.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-of-thought: step-by-step video reasoning from perception to cognition

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.457539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.056082Z digest=sha256:72f20e4b603840bc248abb0aaee5a738188855999ae78f66163d6364f629b786

Observation f1438cd1-b6b3-4387-894d-4246da694cb6 · outbound

This paper cites Video-R1: Reinforcing Video Reasoning in MLLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-R1: Reinforcing Video Reasoning in MLLMs

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.060972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.060972Z digest=sha256:eace9d5aaf16230343cb9fb94d7e5f31db1a0cb792eb1748810c9510fef13d66

Observation f693478b-31f6-475c-856e-3a13988d1d50 · outbound

This paper cites Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.066169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.066169Z digest=sha256:fd19d5deeb459717f26fa02996b202cfcd2088a71a41d3aeb057ecaeeec0c81d

Observation cf788293-7850-47ac-bab6-645d0779f3b9 · outbound

This paper cites Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.442495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.071269Z digest=sha256:52b31b0e778012f8970154778355d4feef35d1090c9e21642e24c40e58a4fb17

Observation 747e27cb-f39e-420e-8639-33ce86441252 · outbound

This paper cites The boat/helmsman.

CyberV: Cybernetics for Test-time Scaling in Video Understanding The boat/helmsman

Reference 17

Resolution
verified exact
doi, observed 2026-08-07T05:26:47.424258Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.076321Z digest=sha256:79c12116d8779808134a8f88febd98b61952d82add4bcc2ab8cf998972220b45

Observation 11f49cd3-e5d7-4800-b667-df25200b3118 · outbound

This paper cites Stream of search (sos): Learning to search in language.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Stream of search (sos): Learning to search in language

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.427236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.081254Z digest=sha256:c8ecfc510b3f965d47d0e8a8aba36c67521ffedaa0d17d264b516d5800aa2d3e

Observation fdb91667-117e-485c-b3d7-bd685ac7f5c9 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.085969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.085969Z digest=sha256:0099b7d2372925a6f175ef2fca92c0003475f638203d974e4eccc405e230e57b

Observation 1e477a11-c3be-4f89-8374-03516e599b7e · outbound

This paper cites Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.091033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.091033Z digest=sha256:8496d872fe13f3420658d5a6ac5fdac99f27915d0b6e480796a668c4fae394e5

Observation 52664408-8232-4b51-b2a6-1494f9cc6290 · outbound

This paper cites Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.096138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.096138Z digest=sha256:6f02bb3f58823b9eb34d4bee057df608c8ab15c809909ceb90a182eb68da1ec4

Observation c4593a06-0e96-4413-bcfb-bf733a9b9095 · outbound

This paper cites WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.101151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.101151Z digest=sha256:f4f68480bb7017717fd3741697b690c27851878ac53e6002d03535e6cb29e770

Observation ae032cd7-8015-47c5-ab16-ab4aea6e38d8 · outbound

This paper cites Following clues, approaching the truth: Explainable micro-video rumor detection via chain-of-thought reasoning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Following clues, approaching the truth: Explainable micro-video rumor detection via chain-of-thought reasoning

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.411597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.106051Z digest=sha256:0669aad71feb48b3dc63fcb097f4573481b5b1d535fc30881772f193a18976a2

Observation 86481275-9056-4f32-9893-441e6d675a85 · outbound

This paper cites CoS: Chain-of-Shot Prompting for Long Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding CoS: Chain-of-Shot Prompting for Long Video Understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.111365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.111365Z digest=sha256:4303ef6ac73cf07ea83a216822441c5d75b03e331d7a752978bdfad9ef628e82

Observation 3afe48cc-0bfa-4fef-b495-e4872d0f038f · outbound

This paper cites Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.116523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.116523Z digest=sha256:db10c55f24353b05dbe0b55b67cec95448e968d79f7dd582662aa1e0a58bc0e5

Observation e8f6dcc4-cdb6-4b49-9c46-79f8f5a8da40 · outbound

This paper cites Neural Networks with Recurrent Generative Feedback.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Neural Networks with Recurrent Generative Feedback

Reference 26

Resolution
metadata mismatch
local_arxiv, observed 2026-08-07T05:26:47.407547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.121891Z digest=sha256:9b50f98bf9174ab3cfc828868ff196587e0f313c1a647e1199690b65841eca5c

Observation 0f4d2b99-c812-4e5e-8f72-6dee08f56bee · outbound

This paper cites Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.126961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.126961Z digest=sha256:c09e86b79c299f53b5fd4be7d89e922b700eb61c7de988477135a3ab7bf00e3b

Observation e179b3d8-d236-4c49-a55c-6fc28c022fd3 · outbound

This paper cites A Simple Model of Inference Scaling Laws.

CyberV: Cybernetics for Test-time Scaling in Video Understanding A Simple Model of Inference Scaling Laws

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.132278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.132278Z digest=sha256:3b407aa9a59d9a7e8d767020970e5b11531a426fda7bcf1961da4009c28a5c39

Observation 851b920e-39c9-4bc9-b8b4-ddee8a6e5fc0 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

CyberV: Cybernetics for Test-time Scaling in Video Understanding LLaVA-OneVision: Easy Visual Task Transfer

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.137280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.137280Z digest=sha256:d0d88353c96eb0f4ec765800ccf77eb393daf582a099f239bcda3a946aaeec33

Observation b92b4578-1639-44c9-8c4e-488ab0c0a9d5 · outbound

This paper cites Aria: An Open Multimodal Native Mixture-of-Experts Model.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Aria: An Open Multimodal Native Mixture-of-Experts Model

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.142398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.142398Z digest=sha256:6e7b8980bb2ec122966d29ce6498ce13b8db34a5399fba9cd59de33f6c604af2

Observation 013a7f46-5688-41ee-8cbc-19d60450485c · outbound

This paper cites Mvbench: A comprehensive multi-modal video understanding benchmark.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Mvbench: A comprehensive multi-modal video understanding benchmark

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.148333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.148333Z digest=sha256:8300e6f553aa046635dc99352df7c47a7058c9a4a747e970181f6f0447a1d403

Observation ae133fc9-d4c1-43ea-8968-351acf771948 · outbound

This paper cites Mvbench: A comprehensive multi-modal video understanding benchmark.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Mvbench: A comprehensive multi-modal video understanding benchmark

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.152919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.152919Z digest=sha256:ced78c90982c66e3837ebdb4e066488f225b5f5a37dfe0c979e7b8d63a34d977

Observation af25d190-2708-432b-b466-11303fba6d59 · outbound

This paper cites VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.157304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.157304Z digest=sha256:21d5fcae2905f44404afaf6ba1a07bbf69bcecc8b2a9c7e37415050736caf32a

Observation ba96c21b-1485-4d4c-a140-b80e1b4c14e3 · outbound

This paper cites Let’s verify step by step.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Let’s verify step by step

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.162872Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.162872Z digest=sha256:55c7d947d5d18923a81a802d6a5e8b2ae9b7b8ba2ccd137d1197a7debcf112e3

Observation cd4414fc-f965-40d8-988c-edcd08c27348 · outbound

This paper cites Vila: On pre-training for visual language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Vila: On pre-training for visual language models

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.364823Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.167582Z digest=sha256:52ec111d46011ffbe6719524419eff8c85f9ea3804870df84439d3f8a7b34873

Observation 70bd4eff-189c-4e66-ba8b-fcf6c0b35422 · outbound

This paper cites Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.172225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.172225Z digest=sha256:9fa528acf9d64b60d283b49d38a305994204b03978c1f79cc7ae9cb3ff033c36

Observation 8f9db7db-44f9-475e-9bfc-ce67c36f08ea · outbound

This paper cites Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.176832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.176832Z digest=sha256:079e20935d1f749ce3ad8dbe99d0bbe4fa5c8c722f5b5ee3019322405a0280d9

Observation 5caae8b8-9813-4dcc-bd72-5340ec991c81 · outbound

This paper cites MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.181794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.181794Z digest=sha256:f91cdf7a1d99748e0ffa8edb9862a6a49fb16b0446f02767a3770a02da820462

Observation 50ab3f98-e34b-4872-8763-610baf0a67b7 · outbound

This paper cites McCulloch and Walter Pitts.

CyberV: Cybernetics for Test-time Scaling in Video Understanding McCulloch and Walter Pitts

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.186636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.186636Z digest=sha256:ff6fd72cc00719e1992c8ec53e2e8f71c637442ea82f26ce306203d0d4660492

Observation cb5e8886-3922-4cf0-987d-c1b25fd2cdf1 · outbound

This paper cites s1: Simple test-time scaling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding s1: Simple test-time scaling

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.191423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.191423Z digest=sha256:edbc0be30717ac8c9c47de8038e8fdb51ec0b1822ad44811f6cb6301374dcb6f

Observation 72efaefc-21fd-4b76-99fe-2c3972bdbaef · outbound

This paper cites Hello gpt4-o.https://openai.com/index/hello-gpt-4o/, 2024.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Hello gpt4-o.https://openai.com/index/hello-gpt-4o/, 2024

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.348109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.196230Z digest=sha256:82ba548a281c2f1393973d31038f645b81a6c064c035152134e9fdbfba0d966a

Observation 22e546a7-2917-49a5-8cf7-7d55f3900988 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Direct preference optimization: Your language model is secretly a reward model

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.201026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.201026Z digest=sha256:3f9495918d8debeacfa262719c631fd1fac70947bcf2237d3735eb1c66aca636

Observation b049d93d-4725-4e24-8888-2c87fa20c840 · outbound

This paper cites Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.205836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.205836Z digest=sha256:1df9c1f622ac9b6a02c79a302ed6660a256edb98e7a32a627d85613c7ec5e2ab

Observation e4785098-977e-4d34-b28f-be95bb55213d · outbound

This paper cites Proximal Policy Optimization Algorithms.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Proximal Policy Optimization Algorithms

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.210761Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.210761Z digest=sha256:da103301c6e21a9940ac452d02c97fbb64f867242ef25309d0161c3e2cdd40a5

Observation 325e25aa-5e79-44e0-979d-8720389223f2 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.215800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.215800Z digest=sha256:6e66651f1fe9c6c59529f9f5206dc0694c69c148666d2613685318b79d855a3b

Observation 236dae6e-f37c-4689-a97e-850002edef3b · outbound

This paper cites Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.220900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.220900Z digest=sha256:c920153144c9d86861867bf89882bfa7dbc1947ce6deeb9fd2e83f19b20ea7ac

Observation e951b058-651e-41cb-82f6-f9ca968c09dd · outbound

This paper cites Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.226160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.226160Z digest=sha256:4c92bdb2131e40fad66e0c018f4d2966d0a25c266c4b50e5894c8e50098d0258

Observation 0df38b86-7c5b-4f31-af4f-94f8719d72c9 · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.231346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.231346Z digest=sha256:fe292991cf7610310938394268dc1a757b2dbc568a9f1e358f33fed281c9bac9

Observation 81506776-cb69-4f53-9508-b66c1acd9ec1 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.236163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.236163Z digest=sha256:952ee3731be0529f817cfc8a33f17a77ff2569b78d96ea81f19ee0a332be51d0

Observation 7e2787e1-62d6-4daf-9d48-12cc9422ec2c · outbound

This paper cites Solving math word problems with process- and outcome-based feedback.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Solving math word problems with process- and outcome-based feedback

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.241336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.241336Z digest=sha256:926d79b4ea3de391d1161fa744e8e217697921c20905a58ddc80c1eaa7863509

Observation 3437d662-c6b0-46cd-8d70-479da2f81a49 · outbound

This paper cites Cybernetics: Circular causal and feedback mechanisms in biological and social systems.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Cybernetics: Circular causal and feedback mechanisms in biological and social systems

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.322834Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.246193Z digest=sha256:3ef0ece8586a44534d5583f2296f22a3da6d0a62e76e25a348a69a937af5efe3

Observation 91d4ed42-b3c9-4384-8bf2-7cad3e7b3fa4 · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.250907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.250907Z digest=sha256:07056d3d12e49d5cc4a5978419013743d9c485a56b244dd27af4bd18b64c2e24

Observation f55b0907-0362-4df1-8774-85ba73fb327e · outbound

This paper cites Visionllm: Large language model is also an open-ended decoder for vision-centric tasks.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Visionllm: Large language model is also an open-ended decoder for vision-centric tasks

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.307116Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.256164Z digest=sha256:1cd94d21ce3548ff7a30fd6e2d96bb23eb2f3448aff4b22267763fa1dc9601b2

Observation 0ffe3b2b-39e2-4b0e-9b9e-e069d30f6c33 · outbound

This paper cites Self-consistency improves chain of thought reasoning in language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Self-consistency improves chain of thought reasoning in language models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.261813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.261813Z digest=sha256:fee0b9da2e821071159ec5d659216482b16c481b47c00eb891b19bbab6dd845c

Observation 61606932-3186-4d92-91fb-d4541afcc799 · outbound

This paper cites InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.266447Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.266447Z digest=sha256:932ae87549989218750726c3ad763139406561f6646e2a1fc62f3470236ee409

Observation 16060295-c0bd-46b4-a319-e377a229e929 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Chain-of-thought prompting elicits reasoning in large language models

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.281545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.271373Z digest=sha256:f2c1ef2ed77206330b6a8546df4cfc3fca2d6f5c879de0489f2457c9aab2a22f

Observation 49ed97e7-5fef-42f6-8de4-acd32a68c974 · outbound

This paper cites Cybernetics or Control and Communication in the Animal and the Machine.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Cybernetics or Control and Communication in the Animal and the Machine

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.265217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.275958Z digest=sha256:f53ea623f53f4f598578981369402521705e93e1da3787b5d5ff13de8ef6fdcc

Observation 0e4ced83-f7b3-4205-89b5-5186abd780c4 · outbound

This paper cites Controlmllm: Training-free visual prompt learning for multimodal large language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Controlmllm: Training-free visual prompt learning for multimodal large language models

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.249410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.280559Z digest=sha256:3f5634970da6d7e938cf5b97c577a0ebd6d122bdae94d10f4f3852d618ee4dec

Observation d98e0f41-98b9-4c0d-b213-7bde18df4df7 · outbound

This paper cites DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data.

CyberV: Cybernetics for Test-time Scaling in Video Understanding DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.285294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.285294Z digest=sha256:9d8b5a3cc5ecb37b3e7f48d3b2b0c18c2ed89fcd46c3adedf27cef1b3a2205ea

Observation 29ae9f45-2e00-4a5d-9cbd-fea763364b39 · outbound

This paper cites VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.290148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.290148Z digest=sha256:2439aaeba61d684e422dc4430473c5b54554c420ab99471f937fc24bd19f157d

Observation 2ebd99f9-284f-456e-9fb2-5a0f7fc30cb0 · outbound

This paper cites Video-llama: An instruction-tuned audio-visual language model for video understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-llama: An instruction-tuned audio-visual language model for video understanding

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.233970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.295054Z digest=sha256:25538fe7c55fcd0800708871ec939687cf27cb76fdbd923925f055c46286ad6f

Observation cf0663c6-07a0-424d-a475-16f65e101b6b · outbound

This paper cites Long Context Transfer from Language to Vision.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Long Context Transfer from Language to Vision

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.299651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.299651Z digest=sha256:cc26634777f6d6ef7ea7c67cc2fe0a865b300d66f0ec58a1765ceec3badfc52d

Observation d55a354c-3fae-4341-b0c8-0637b6366ea6 · outbound

This paper cites AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback.

CyberV: Cybernetics for Test-time Scaling in Video Understanding AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback

Reference 63

Resolution
verified exact
local_arxiv, observed 2026-08-07T05:26:47.371796Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T05:26:47.304566Z digest=sha256:156204b004bb9769dbddbe76ecf25bb49e3d5d658b97a9e3caeb29032deea487

Observation 6b93e37e-a4f1-4806-a581-13cf263521b9 · outbound

This paper cites TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.309529Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.309529Z digest=sha256:adaebad6bbf11c0164879bfaae46d13b25524a80ea8d98879e0613d52bbe6cf1

Observation 0ac43119-00d2-4316-80ae-1ac7c5cda771 · outbound

This paper cites LLaVA-Video: Video Instruction Tuning With Synthetic Data.

CyberV: Cybernetics for Test-time Scaling in Video Understanding LLaVA-Video: Video Instruction Tuning With Synthetic Data

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.315568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.315568Z digest=sha256:af11fcf1e7a8b029c479d4f0b5ddaec4c0381c86a155b3397a817655cbb36a50

Observation 482ffa6f-a7bc-4d60-aff8-32ef23cb0176 · outbound

This paper cites InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.320450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.320450Z digest=sha256:271f08eb6994e474e7732fa86ff3473fe01f7af095cce845f963e9d2f3c78992

Pith citing papers

Observation eae3f730-7ef9-40ac-8040-03d74213e13a · inbound

Towards One-to-Many Temporal Grounding cites this paper.

Towards One-to-Many Temporal Grounding CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-07-02T12:16:57.682594Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-06-28T02:11:48.455492Z digest=sha256:add5ada9af47ded4c44ce2a84e7ec867ff7159ef229587b169fb853dac2c1eca

Observation 74dd834b-6366-4786-b43c-4902ac52591b · inbound

Watch, Remember, Reason: Human-View Video Understanding with MLLMs cites this paper.

Watch, Remember, Reason: Human-View Video Understanding with MLLMs CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 229

Resolution
verified exact
arxiv_id, observed 2026-07-02T17:27:15.514528Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-27T22:00:28.350003Z digest=sha256:05d5ad4b249d13f89fc1213cc77d2512a2e44f69ed5ab507cbd41ce56ad16f6b

Observation 13131be7-d41c-4a63-b60c-6d48758620dd · inbound

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning cites this paper.

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 61

Resolution
verified exact
arxiv_id, observed 2026-07-02T21:37:25.298267Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-06-27T19:36:57.231932Z digest=sha256:3bb7e455453fd988548f791cdcde3734351db45c6331f09346b56fb8bc079807

Observation bec2ef43-3501-4268-ade0-ea680fe68fe0 · inbound

AVIS: Adaptive Test-Time Scaling for Vision-Language Models cites this paper.

AVIS: Adaptive Test-Time Scaling for Vision-Language Models CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-07-03T08:17:45.842398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-27T10:47:41.183211Z digest=sha256:e8a271f7ae66d4ded3f00d8ede247dffd7ab347df5f66bc2a24e4373c6fa0aca