{"as_of":"2026-08-09T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40c0fb93cfcbee2dfd880e60c8e17ede4eb2e4d3f7a43bb5af5a29f022905ba0","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:26:47.320450Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T02:11:48.455492Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T08:17:45.840937Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07971","snapshot_observed_at":"2026-07-03T08:17:45.840937Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding.arXiv preprint arXiv:2506.07971, 2025","venue":null,"work_id":"e071dfb1-d529-4453-a51c-aa0401f03ea3","year":2025},"citing_paper":{"arxiv_id":"2606.06294","last_updated":"2026-06-21T07:27:04Z","snapshot_observed_at":"2026-08-04T09:48:32.503414Z","submitted_at":"2026-06-04T15:31:22Z","title":"Towards One-to-Many Temporal Grounding","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T02:11:48.455492Z"},"links":{"cited_paper":"/paper/2506.07971","citing_paper":"/paper/2606.06294"},"observation_digest":"sha256:add5ada9af47ded4c44ce2a84e7ec867ff7159ef229587b169fb853dac2c1eca","observation_id":"eae3f730-7ef9-40ac-8040-03d74213e13a","resolution":{"observed_at":"2026-07-02T12:16:57.682594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07971","snapshot_observed_at":"2026-07-03T08:17:45.840937Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding.arXiv preprint arXiv:2506.07971, 2025","venue":null,"work_id":"e071dfb1-d529-4453-a51c-aa0401f03ea3","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":229,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.07971","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:05d5ad4b249d13f89fc1213cc77d2512a2e44f69ed5ab507cbd41ce56ad16f6b","observation_id":"74dd834b-6366-4786-b43c-4902ac52591b","resolution":{"observed_at":"2026-07-02T17:27:15.514528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07971","snapshot_observed_at":"2026-07-03T08:17:45.840937Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding.arXiv preprint arXiv:2506.07971, 2025","venue":null,"work_id":"e071dfb1-d529-4453-a51c-aa0401f03ea3","year":2025},"citing_paper":{"arxiv_id":"2606.08231","last_updated":"2026-06-06T15:39:29Z","snapshot_observed_at":"2026-08-07T16:58:05.550639Z","submitted_at":"2026-06-06T15:39:29Z","title":"Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-27T19:36:57.231932Z"},"links":{"cited_paper":"/paper/2506.07971","citing_paper":"/paper/2606.08231"},"observation_digest":"sha256:3bb7e455453fd988548f791cdcde3734351db45c6331f09346b56fb8bc079807","observation_id":"13131be7-d41c-4a63-b60c-6d48758620dd","resolution":{"observed_at":"2026-07-02T21:37:25.298267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07971","snapshot_observed_at":"2026-07-03T08:17:45.840937Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding.arXiv preprint arXiv:2506.07971, 2025","venue":null,"work_id":"e071dfb1-d529-4453-a51c-aa0401f03ea3","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2506.07971","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:e8a271f7ae66d4ded3f00d8ede247dffd7ab347df5f66bc2a24e4373c6fa0aca","observation_id":"bec2ef43-3501-4268-ade0-ea680fe68fe0","resolution":{"observed_at":"2026-07-03T08:17:45.842398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07971/citation-record","integrity":"/paper/2506.07971/integrity","json":"/paper/2506.07971/citation-record.json","paper":"/paper/2506.07971"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T05:26:46.991810Z","title":"Critique-out-loud reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:46.991810Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:afe472ff3d0e3b6319c2fc1d8d653e514f62cbfc87bb34318be9027e117ecc8c","observation_id":"b7185dab-cc29-44f0-aed7-77af05663516","resolution":{"observed_at":"2026-08-07T05:26:46.991810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.513565Z","title":"Claude Team","venue":null,"work_id":"396d1223-7a96-47bf-af0a-902241789584","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:46.997671Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:8755b4ac514811f18df29a0fa09c67d386bcffe96fbd30a911f54e2b70608b2c","observation_id":"5e3845e7-e9b5-42bb-816b-bb375d6c6faf","resolution":{"observed_at":"2026-08-07T05:26:48.518617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.003174Z","title":"An introduction to cybernetics","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.003174Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:723370e1085154307bd57eb93908bd07ead775456da0fe448a93b57f41c7e3aa","observation_id":"e740239e-8ac9-486c-9fa1-c8791206aeee","resolution":{"observed_at":"2026-08-07T05:26:47.003174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T05:26:47.008776Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.008776Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:c3fd3da0653d2950307a9e15f593152cb33b56e1f9065aac9e09f0e99f62941b","observation_id":"2929c73e-7163-4694-b270-508417fda755","resolution":{"observed_at":"2026-08-07T05:26:47.008776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:26:47.014066Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.014066Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:583f67bd8d145a22291ad5d51d31350424d54bcf26a2d6d3707bda3c3665bfe5","observation_id":"c4de9698-e180-4017-8a64-20932ec07567","resolution":{"observed_at":"2026-08-07T05:26:47.014066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09078","last_updated":"2025-04-01T12:48:43Z","snapshot_observed_at":"2026-08-08T09:53:22.230954Z","submitted_at":"2024-12-12T09:01:18Z","title":"Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09078","snapshot_observed_at":"2026-08-07T05:26:47.019699Z","title":"Forest-of-thought: Scaling test-time compute for enhancing llm reasoning.arXiv preprint arXiv:2412.09078, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.019699Z"},"links":{"cited_paper":"/paper/2412.09078","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:80ab98279deed7036b8a58f9da4a4c08936ebe7883d819b517e4bae1b1eb0ed2","observation_id":"18dedfcc-cf37-4917-9de4-ba0fdaf51c54","resolution":{"observed_at":"2026-08-07T05:26:47.019699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T05:26:47.025491Z","title":"Large language monkeys: Scaling inference compute with repeated sampling.arXiv preprint arXiv:2407.21787, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.025491Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:808ac9a73997aa2e55524c414b245a8a804f9eea98d5528f22ec222e69264177","observation_id":"994a85ef-f28d-40c1-95b8-db86e8829a82","resolution":{"observed_at":"2026-08-07T05:26:47.025491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.487272Z","title":"On the importance of being emergent.Constructivist Foundations, 5(2):89, March 2010","venue":null,"work_id":"dfd59503-dbe0-4b84-ac42-b8be23169e39","year":2010},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.030997Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:2ccb99e9e47a555849055c60d108d2f46d3a1c52aa3b6e8fb8a453d74777b1b9","observation_id":"58bd6a79-63cc-4f58-8fa3-bbd7fae87bb7","resolution":{"observed_at":"2026-08-07T05:26:48.492129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T05:26:47.036084Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.036084Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:b1de61dcc6786e8578befff56ff0fc5da1755fb6e8a6ebd08264ea412881d707","observation_id":"6c5ab84d-8850-40dd-9b20-a4b9d5966bee","resolution":{"observed_at":"2026-08-07T05:26:47.036084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.041414Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.041414Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:f34a06635501841e8bcaf57ddacb1f845735d46fc0d0310f23cc611b279ed0f9","observation_id":"b4960047-268e-4d75-b7d9-b582d9ccbe2f","resolution":{"observed_at":"2026-08-07T05:26:47.041414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.046212Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.046212Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:f0a5e204ccfb5d643d2b49bd457f0422d7a5398a835ca40b23d712dc3d0f65da","observation_id":"eba9dc51-6926-4f79-af91-9d81a4c118ce","resolution":{"observed_at":"2026-08-07T05:26:47.046212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T05:26:47.051059Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.051059Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:8f045b0ad0bcb1149338014cda8479c05604b2d4fadaa69e959ed62324db43bc","observation_id":"bf7bc706-83ea-43bc-ae03-0ce04f6be90c","resolution":{"observed_at":"2026-08-07T05:26:47.051059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.452669Z","title":"Video-of-thought: step-by-step video reasoning from perception to cognition","venue":null,"work_id":"109052a3-9811-444f-998b-4335a1ff5285","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.056082Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:72f20e4b603840bc248abb0aaee5a738188855999ae78f66163d6364f629b786","observation_id":"6438f68a-91c3-4f0e-b688-9341f1f30ad5","resolution":{"observed_at":"2026-08-07T05:26:48.457539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T05:26:47.060972Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.060972Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:eace9d5aaf16230343cb9fb94d7e5f31db1a0cb792eb1748810c9510fef13d66","observation_id":"f1438cd1-b6b3-4387-894d-4246da694cb6","resolution":{"observed_at":"2026-08-07T05:26:47.060972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14257","last_updated":"2025-02-08T12:50:42Z","snapshot_observed_at":"2026-07-06T19:53:52.079055Z","submitted_at":"2024-11-21T16:05:58Z","title":"Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14257","snapshot_observed_at":"2026-08-07T05:26:47.066169Z","title":"Do i know this entity? knowledge awareness and hallucinations in language models.arXiv preprint arXiv:2411.14257, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.066169Z"},"links":{"cited_paper":"/paper/2411.14257","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:fd19d5deeb459717f26fa02996b202cfcd2088a71a41d3aeb057ecaeeec0c81d","observation_id":"f693478b-31f6-475c-856e-3a13988d1d50","resolution":{"observed_at":"2026-08-07T05:26:47.066169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.437698Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"8d956698-e3ca-4fe0-beed-efacbc30bf3f","year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.071269Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:52b31b0e778012f8970154778355d4feef35d1090c9e21642e24c40e58a4fb17","observation_id":"cf788293-7850-47ac-bab6-645d0779f3b9","resolution":{"observed_at":"2026-08-07T05:26:48.442495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1386/tear.5.1.15_1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.418992Z","title":"The boat/helmsman","venue":null,"work_id":"eaf639fa-7144-4b20-b4a5-7f8f16e21f6c","year":2007},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.076321Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:79c12116d8779808134a8f88febd98b61952d82add4bcc2ab8cf998972220b45","observation_id":"747e27cb-f39e-420e-8639-33ce86441252","resolution":{"observed_at":"2026-08-07T05:26:47.424258Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.421990Z","title":"Stream of search (sos): Learning to search in language","venue":null,"work_id":"13ef0c34-6caf-41c6-a3fb-ecbb39e395c4","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.081254Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:c8ecfc510b3f965d47d0e8a8aba36c67521ffedaa0d17d264b516d5800aa2d3e","observation_id":"11f49cd3-e5d7-4800-b667-df25200b3118","resolution":{"observed_at":"2026-08-07T05:26:48.427236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:26:47.085969Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.085969Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:0099b7d2372925a6f175ef2fca92c0003475f638203d974e4eccc405e230e57b","observation_id":"fdb91667-117e-485c-b3d7-bd685ac7f5c9","resolution":{"observed_at":"2026-08-07T05:26:47.085969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13139","last_updated":"2025-05-17T13:22:07Z","snapshot_observed_at":"2026-08-08T12:55:17.970927Z","submitted_at":"2025-03-17T13:07:34Z","title":"Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13139","snapshot_observed_at":"2026-08-07T05:26:47.091033Z","title":"Logic-in-frames: Dynamic keyframe search via visual semantic-logical verification for long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.091033Z"},"links":{"cited_paper":"/paper/2503.13139","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:8496d872fe13f3420658d5a6ac5fdac99f27915d0b6e480796a668c4fae394e5","observation_id":"1e477a11-c3be-4f89-8374-03516e599b7e","resolution":{"observed_at":"2026-08-07T05:26:47.091033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10441","last_updated":"2024-10-16T09:45:06Z","snapshot_observed_at":"2026-08-04T03:48:44.723741Z","submitted_at":"2024-10-14T12:35:12Z","title":"Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10441","snapshot_observed_at":"2026-08-07T05:26:47.096138Z","title":"Free video-llm: Prompt-guided visual perception for efficient training-free video llms.arXiv preprint arXiv:2410.10441, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.096138Z"},"links":{"cited_paper":"/paper/2410.10441","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:6f02bb3f58823b9eb34d4bee057df608c8ab15c809909ceb90a182eb68da1ec4","observation_id":"52664408-8232-4b51-b2a6-1494f9cc6290","resolution":{"observed_at":"2026-08-07T05:26:47.096138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-07T05:26:47.101151Z","title":"Worldsense: Evaluating real-world omnimodal understanding for multimodal llms.arXiv preprint arXiv:2502.04326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.101151Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:f4f68480bb7017717fd3741697b690c27851878ac53e6002d03535e6cb29e770","observation_id":"c4593a06-0e96-4413-bcfb-bf733a9b9095","resolution":{"observed_at":"2026-08-07T05:26:47.101151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.406490Z","title":"Following clues, approaching the truth: Explainable micro-video rumor detection via chain-of-thought reasoning","venue":null,"work_id":"5a12a03c-22c9-4768-8ead-d6f30a61f5fb","year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.106051Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:0669aad71feb48b3dc63fcb097f4573481b5b1d535fc30881772f193a18976a2","observation_id":"ae032cd7-8015-47c5-ab16-ab4aea6e38d8","resolution":{"observed_at":"2026-08-07T05:26:48.411597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-08T15:25:00.286848Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-07T05:26:47.111365Z","title":"Cos: Chain-of-shot prompting for long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.111365Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:4303ef6ac73cf07ea83a216822441c5d75b03e331d7a752978bdfad9ef628e82","observation_id":"86481275-9056-4f32-9893-441e6d675a85","resolution":{"observed_at":"2026-08-07T05:26:47.111365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-07T05:26:47.116523Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline professional videos.arXiv preprint arXiv:2501.13826, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.116523Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:db10c55f24353b05dbe0b55b67cec95448e968d79f7dd582662aa1e0a58bc0e5","observation_id":"3afe48cc-0bfa-4fef-b495-e4872d0f038f","resolution":{"observed_at":"2026-08-07T05:26:47.116523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.09200","last_updated":"2020-11-10T08:29:39Z","snapshot_observed_at":"2026-08-08T11:53:55.068850Z","submitted_at":"2020-07-17T19:32:48Z","title":"Neural Networks with Recurrent Generative Feedback","version":2},"cited_work":{"arxiv_id":"2007.09200","doi":"10.48550/arxiv.2007.09200","metadata_source":"pith","pith_arxiv_id":"2007.09200","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"Neural Networks with Recurrent Generative Feedback","venue":"cs.LG","work_id":"485c1916-fa83-4fc3-9f9c-bb8576437bf4","year":2020},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.121891Z"},"links":{"cited_paper":"/paper/2007.09200","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:9b50f98bf9174ab3cfc828868ff196587e0f313c1a647e1199690b65841eca5c","observation_id":"e8f6dcc4-cdb6-4b49-9c46-79f8f5a8da40","resolution":{"observed_at":"2026-08-07T05:26:47.407547Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05615","last_updated":"2024-05-09T08:23:20Z","snapshot_observed_at":"2026-08-07T04:07:58.370340Z","submitted_at":"2024-05-09T08:23:20Z","title":"Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05615","snapshot_observed_at":"2026-08-07T05:26:47.126961Z","title":"Memory-space visual prompting for efficient vision-language fine-tuning.arXiv preprint arXiv:2405.05615, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.126961Z"},"links":{"cited_paper":"/paper/2405.05615","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:c09e86b79c299f53b5fd4be7d89e922b700eb61c7de988477135a3ab7bf00e3b","observation_id":"0f4d2b99-c812-4e5e-8f72-6dee08f56bee","resolution":{"observed_at":"2026-08-07T05:26:47.126961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16377","last_updated":"2024-12-07T22:50:41Z","snapshot_observed_at":"2026-08-05T11:33:45.483902Z","submitted_at":"2024-10-21T18:00:06Z","title":"A Simple Model of Inference Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16377","snapshot_observed_at":"2026-08-07T05:26:47.132278Z","title":"A simple model of inference scaling laws.arXiv preprint arXiv:2410.16377, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.132278Z"},"links":{"cited_paper":"/paper/2410.16377","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:3b407aa9a59d9a7e8d767020970e5b11531a426fda7bcf1961da4009c28a5c39","observation_id":"e179b3d8-d236-4c49-a55c-6fc28c022fd3","resolution":{"observed_at":"2026-08-07T05:26:47.132278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:26:47.137280Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.137280Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:d0d88353c96eb0f4ec765800ccf77eb393daf582a099f239bcda3a946aaeec33","observation_id":"851b920e-39c9-4bc9-b8b4-ddee8a6e5fc0","resolution":{"observed_at":"2026-08-07T05:26:47.137280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T05:26:47.142398Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.142398Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:6e7b8980bb2ec122966d29ce6498ce13b8db34a5399fba9cd59de33f6c604af2","observation_id":"b92b4578-1639-44c9-8c4e-488ab0c0a9d5","resolution":{"observed_at":"2026-08-07T05:26:47.142398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.148333Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.148333Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:8300e6f553aa046635dc99352df7c47a7058c9a4a747e970181f6f0447a1d403","observation_id":"013a7f46-5688-41ee-8cbc-19d60450485c","resolution":{"observed_at":"2026-08-07T05:26:47.148333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.152919Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.152919Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:ced78c90982c66e3837ebdb4e066488f225b5f5a37dfe0c979e7b8d63a34d977","observation_id":"ae133fc9-d4c1-43ea-8968-351acf771948","resolution":{"observed_at":"2026-08-07T05:26:47.152919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T05:26:47.157304Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.157304Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:21d5fcae2905f44404afaf6ba1a07bbf69bcecc8b2a9c7e37415050736caf32a","observation_id":"af25d190-2708-432b-b466-11303fba6d59","resolution":{"observed_at":"2026-08-07T05:26:47.157304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.162872Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.162872Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:55c7d947d5d18923a81a802d6a5e8b2ae9b7b8ba2ccd137d1197a7debcf112e3","observation_id":"ba96c21b-1485-4d4c-a140-b80e1b4c14e3","resolution":{"observed_at":"2026-08-07T05:26:47.162872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.359398Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"290858f8-7df1-4715-9f35-21a033072097","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.167582Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:52ec111d46011ffbe6719524419eff8c85f9ea3804870df84439d3f8a7b34873","observation_id":"cd4414fc-f965-40d8-988c-edcd08c27348","resolution":{"observed_at":"2026-08-07T05:26:48.364823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-08T18:40:06.157350Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T05:26:47.172225Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.172225Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:9fa528acf9d64b60d283b49d38a305994204b03978c1f79cc7ae9cb3ff033c36","observation_id":"70bd4eff-189c-4e66-ba8b-fcf6c0b35422","resolution":{"observed_at":"2026-08-07T05:26:47.172225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T05:26:47.176832Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models.arXiv preprint arXiv:2403.03003, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.176832Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:079e20935d1f749ce3ad8dbe99d0bbe4fa5c8c722f5b5ee3019322405a0280d9","observation_id":"8f9db7db-44f9-475e-9bfc-ce67c36f08ea","resolution":{"observed_at":"2026-08-07T05:26:47.176832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20502","last_updated":"2025-03-30T03:54:36Z","snapshot_observed_at":"2026-08-07T16:35:40.970337Z","submitted_at":"2025-03-26T12:42:37Z","title":"MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20502","snapshot_observed_at":"2026-08-07T05:26:47.181794Z","title":"Mllm-selector: Necessity and diversity-driven high-value data selection for enhanced visual instruction tuning.arXiv preprint arXiv:2503.20502, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.181794Z"},"links":{"cited_paper":"/paper/2503.20502","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:f91cdf7a1d99748e0ffa8edb9862a6a49fb16b0446f02767a3770a02da820462","observation_id":"5caae8b8-9813-4dcc-bd72-5340ec991c81","resolution":{"observed_at":"2026-08-07T05:26:47.181794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.186636Z","title":"McCulloch and Walter Pitts","venue":null,"work_id":null,"year":1943},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.186636Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:ff6fd72cc00719e1992c8ec53e2e8f71c637442ea82f26ce306203d0d4660492","observation_id":"50ab3f98-e34b-4872-8763-610baf0a67b7","resolution":{"observed_at":"2026-08-07T05:26:47.186636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T05:26:47.191423Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.191423Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:edbc0be30717ac8c9c47de8038e8fdb51ec0b1822ad44811f6cb6301374dcb6f","observation_id":"cb5e8886-3922-4cf0-987d-c1b25fd2cdf1","resolution":{"observed_at":"2026-08-07T05:26:47.191423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.343179Z","title":"Hello gpt4-o.https://openai.com/index/hello-gpt-4o/, 2024","venue":null,"work_id":"c2c5a76f-cb26-425b-9e91-a1c688382774","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.196230Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:82ba548a281c2f1393973d31038f645b81a6c064c035152134e9fdbfba0d966a","observation_id":"72efaefc-21fd-4b76-99fe-2c3972bdbaef","resolution":{"observed_at":"2026-08-07T05:26:48.348109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.201026Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.201026Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:3f9495918d8debeacfa262719c631fd1fac70947bcf2237d3735eb1c66aca636","observation_id":"22e546a7-2917-49a5-8cf7-7d55f3900988","resolution":{"observed_at":"2026-08-07T05:26:47.201026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-03T16:12:52.104741Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-07T05:26:47.205836Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts.arXiv preprint arXiv:2501.04322, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.205836Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:1df9c1f622ac9b6a02c79a302ed6660a256edb98e7a32a627d85613c7ec5e2ab","observation_id":"b049d93d-4725-4e24-8888-2c87fa20c840","resolution":{"observed_at":"2026-08-07T05:26:47.205836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:26:47.210761Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.210761Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:da103301c6e21a9940ac452d02c97fbb64f867242ef25309d0161c3e2cdd40a5","observation_id":"e4785098-977e-4d34-b28f-be95bb55213d","resolution":{"observed_at":"2026-08-07T05:26:47.210761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:26:47.215800Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.215800Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:6e66651f1fe9c6c59529f9f5206dc0694c69c148666d2613685318b79d855a3b","observation_id":"325e25aa-5e79-44e0-979d-8720389223f2","resolution":{"observed_at":"2026-08-07T05:26:47.215800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.220900Z","title":"Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.220900Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:c920153144c9d86861867bf89882bfa7dbc1947ce6deeb9fd2e83f19b20ea7ac","observation_id":"236dae6e-f37c-4689-a97e-850002edef3b","resolution":{"observed_at":"2026-08-07T05:26:47.220900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T05:26:47.226160Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.226160Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:4c92bdb2131e40fad66e0c018f4d2966d0a25c266c4b50e5894c8e50098d0258","observation_id":"e951b058-651e-41cb-82f6-f9ca968c09dd","resolution":{"observed_at":"2026-08-07T05:26:47.226160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T05:26:47.231346Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.231346Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:fe292991cf7610310938394268dc1a757b2dbc568a9f1e358f33fed281c9bac9","observation_id":"0df38b86-7c5b-4f31-af4f-94f8719d72c9","resolution":{"observed_at":"2026-08-07T05:26:47.231346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:26:47.236163Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.236163Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:952ee3731be0529f817cfc8a33f17a77ff2569b78d96ea81f19ee0a332be51d0","observation_id":"81506776-cb69-4f53-9508-b66c1acd9ec1","resolution":{"observed_at":"2026-08-07T05:26:47.236163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T05:26:47.241336Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.241336Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:926d79b4ea3de391d1161fa744e8e217697921c20905a58ddc80c1eaa7863509","observation_id":"7e2787e1-62d6-4daf-9d48-12cc9422ec2c","resolution":{"observed_at":"2026-08-07T05:26:47.241336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.317468Z","title":"Cybernetics: Circular causal and feedback mechanisms in biological and social systems","venue":null,"work_id":"9f046296-4424-4434-acf9-024cb7844ec6","year":1952},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.246193Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:3ef0ece8586a44534d5583f2296f22a3da6d0a62e76e25a348a69a937af5efe3","observation_id":"3437d662-c6b0-46cd-8d70-479da2f81a49","resolution":{"observed_at":"2026-08-07T05:26:48.322834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:26:47.250907Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.250907Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:07056d3d12e49d5cc4a5978419013743d9c485a56b244dd27af4bd18b64c2e24","observation_id":"91d4ed42-b3c9-4384-8bf2-7cad3e7b3fa4","resolution":{"observed_at":"2026-08-07T05:26:47.250907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.302286Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks","venue":null,"work_id":"040476b3-48a7-49d4-9698-c57ebbbeccfb","year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.256164Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:1cd94d21ce3548ff7a30fd6e2d96bb23eb2f3448aff4b22267763fa1dc9601b2","observation_id":"f55b0907-0362-4df1-8774-85ba73fb327e","resolution":{"observed_at":"2026-08-07T05:26:48.307116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.261813Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.261813Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:fee0b9da2e821071159ec5d659216482b16c481b47c00eb891b19bbab6dd845c","observation_id":"0ffe3b2b-39e2-4b0e-9b9e-e069d30f6c33","resolution":{"observed_at":"2026-08-07T05:26:47.261813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T05:26:47.266447Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.266447Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:932ae87549989218750726c3ad763139406561f6646e2a1fc62f3470236ee409","observation_id":"61606932-3186-4d92-91fb-d4541afcc799","resolution":{"observed_at":"2026-08-07T05:26:47.266447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.276223Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"e3278dd9-0f44-4090-acf2-cb065770bbef","year":2022},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.271373Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:f2c1ef2ed77206330b6a8546df4cfc3fca2d6f5c879de0489f2457c9aab2a22f","observation_id":"16060295-c0bd-46b4-a319-e377a229e929","resolution":{"observed_at":"2026-08-07T05:26:48.281545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.260113Z","title":"Cybernetics or Control and Communication in the Animal and the Machine","venue":null,"work_id":"2b5e3fda-176b-4abb-a433-cc9180c541a0","year":1948},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.275958Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:f53ea623f53f4f598578981369402521705e93e1da3787b5d5ff13de8ef6fdcc","observation_id":"49ed97e7-5fef-42f6-8de4-acd32a68c974","resolution":{"observed_at":"2026-08-07T05:26:48.265217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.244432Z","title":"Controlmllm: Training-free visual prompt learning for multimodal large language models","venue":null,"work_id":"5ad7873e-68ad-4e61-a86b-59bb111a00cd","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.280559Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:3f5634970da6d7e938cf5b97c577a0ebd6d122bdae94d10f4f3852d618ee4dec","observation_id":"0e4ced83-f7b3-4205-89b5-5186abd780c4","resolution":{"observed_at":"2026-08-07T05:26:48.249410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14333","last_updated":"2024-05-23T09:03:42Z","snapshot_observed_at":"2026-07-06T18:18:25.746022Z","submitted_at":"2024-05-23T09:03:42Z","title":"DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14333","snapshot_observed_at":"2026-08-07T05:26:47.285294Z","title":"Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data.arXiv preprint arXiv:2405.14333, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.285294Z"},"links":{"cited_paper":"/paper/2405.14333","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:9d8b5a3cc5ecb37b3e7f48d3b2b0c18c2ed89fcd46c3adedf27cef1b3a2205ea","observation_id":"d98e0f41-98b9-4c0d-b213-7bde18df4df7","resolution":{"observed_at":"2026-08-07T05:26:47.285294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T05:26:47.290148Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.290148Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:2439aaeba61d684e422dc4430473c5b54554c420ab99471f937fc24bd19f157d","observation_id":"29ae9f45-2e00-4a5d-9cbd-fea763364b39","resolution":{"observed_at":"2026-08-07T05:26:47.290148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.229366Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":"a4c27394-cc32-4201-8bfa-53128adad2af","year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.295054Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:25538fe7c55fcd0800708871ec939687cf27cb76fdbd923925f055c46286ad6f","observation_id":"2ebd99f9-284f-456e-9fb2-5a0f7fc30cb0","resolution":{"observed_at":"2026-08-07T05:26:48.233970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T05:26:47.299651Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.299651Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:cc26634777f6d6ef7ea7c67cc2fe0a865b300d66f0ec58a1765ceec3badfc52d","observation_id":"cf0663c6-07a0-424d-a475-16f65e101b6b","resolution":{"observed_at":"2026-08-07T05:26:47.299651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17176","last_updated":"2024-05-03T08:24:12Z","snapshot_observed_at":"2026-08-02T19:09:39.899901Z","submitted_at":"2023-09-29T12:16:19Z","title":"AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback","version":3},"cited_work":{"arxiv_id":"2309.17176","doi":"10.48550/arxiv.2309.17176","metadata_source":"pith","pith_arxiv_id":"2309.17176","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback","venue":"cs.AI","work_id":"f3784c90-8c5b-4f30-bcfc-11bfc95a7ddc","year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.304566Z"},"links":{"cited_paper":"/paper/2309.17176","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:156204b004bb9769dbddbe76ecf25bb49e3d5d658b97a9e3caeb29032deea487","observation_id":"d55a354c-3fae-4341-b0c8-0637b6366ea6","resolution":{"observed_at":"2026-08-07T05:26:47.371796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09641","last_updated":"2025-04-13T16:32:49Z","snapshot_observed_at":"2026-08-08T07:14:04.916356Z","submitted_at":"2025-04-13T16:32:49Z","title":"TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09641","snapshot_observed_at":"2026-08-07T05:26:47.309529Z","title":"Tinyllava-video-r1: Towards smaller lmms for video reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.309529Z"},"links":{"cited_paper":"/paper/2504.09641","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:adaebad6bbf11c0164879bfaae46d13b25524a80ea8d98879e0613d52bbe6cf1","observation_id":"6b93e37e-a4f1-4806-a581-13cf263521b9","resolution":{"observed_at":"2026-08-07T05:26:47.309529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T05:26:47.315568Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.315568Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:af11fcf1e7a8b029c479d4f0b5ddaec4c0381c86a155b3397a817655cbb36a50","observation_id":"0ac43119-00d2-4316-80ae-1ac7c5cda771","resolution":{"observed_at":"2026-08-07T05:26:47.315568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T05:26:47.320450Z","title":"Add key frames","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.320450Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:271f08eb6994e474e7732fa86ff3473fe01f7af095cce845f963e9d2f3c78992","observation_id":"482ffa6f-a7bc-4d60-aff8-32ef23cb0176","resolution":{"observed_at":"2026-08-07T05:26:47.320450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 4 inbound Pith citation observations for arXiv:2506.07971."}