{"as_of":"2026-08-17T12:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8568125e1fe72fe769680e01ac58b567791a234beb39897528327e52b18cb955","coverage":[{"denominator":145,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:47:12.490079Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:42:52.030381Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T02:52:20.802634Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"cited_work":{"arxiv_id":"2412.19326","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19326","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task preference optimization: Improving multimodal large language models with vision task alignment","venue":null,"work_id":"90adeb70-7a41-48c6-8e9e-e8346533501e","year":2024},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2412.19326","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:2bcbcbcf87443dfb8f03a8777d9856dabf548d6126977419fb118dce1bae2d0d","observation_id":"d9d4332a-5f1e-483f-a493-4b5634d2952e","resolution":{"observed_at":"2026-05-17T02:52:20.806469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"cited_work":{"arxiv_id":"2412.19326","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19326","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task preference optimization: Improving multimodal large language models with vision task alignment","venue":null,"work_id":"90adeb70-7a41-48c6-8e9e-e8346533501e","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2412.19326","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:3461e62b36616323daf6d5e3f86482d65420be28b26eca931ad7e5e37147d989","observation_id":"38640935-a25c-466a-b623-b70ebbdb310d","resolution":{"observed_at":"2026-05-15T20:56:07.724355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19326","snapshot_observed_at":"2026-08-16T05:42:52.030381Z","title":"Task preference optimization: Improving mul- timodal large language models with vision task alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20041","last_updated":"2025-07-22T09:34:45Z","snapshot_observed_at":"2026-08-16T22:24:19.016739Z","submitted_at":"2025-04-28T17:59:54Z","title":"Learning Streaming Video Representation via Multitask Training","version":2},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-16T05:42:52.030381Z"},"links":{"cited_paper":"/paper/2412.19326","citing_paper":"/paper/2504.20041"},"observation_digest":"sha256:bf9e2ebe674f2ccbd01f33edbfe22df76ec1c2b51006a1935d8656feee3033d3","observation_id":"67b175ad-b4c1-464b-a995-9d3420cc360a","resolution":{"observed_at":"2026-08-16T05:42:52.030381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19326","snapshot_observed_at":"2026-08-15T19:00:53.763494Z","title":"Task preference optimization: Improving multimodal large language models with vision task alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.763494Z"},"links":{"cited_paper":"/paper/2412.19326","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:4a671eca8ea5bff89099e4792f6b1a605a2b2210ad16b3327d73af67490d2680","observation_id":"14bcbbf9-5db4-4c97-b06d-1947d947e93e","resolution":{"observed_at":"2026-08-15T19:00:53.763494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19326","snapshot_observed_at":"2026-08-05T23:32:18.017165Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:18.017165Z"},"links":{"cited_paper":"/paper/2412.19326","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:2af3f65f79c2300493ab148b31e836cf30b3d01cdf472c4caee9fa6b7dff307c","observation_id":"a6be8cda-4407-4ef7-acbc-29899c8ec6c1","resolution":{"observed_at":"2026-08-05T23:32:18.017165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.19326/citation-record","integrity":"/paper/2412.19326/integrity","json":"/paper/2412.19326/citation-record.json","paper":"/paper/2412.19326"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T00:47:12.038424Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.038424Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:33de175ee505ad6676cba0b853126396073b10c8387e0f1f522f114a7ddd2c72","observation_id":"9dcb825f-4a07-478f-a8e6-852011335249","resolution":{"observed_at":"2026-08-11T00:47:12.038424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-11T00:47:12.043981Z","title":"Openflamingo: An open- source framework for training large autoregressive vision- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.043981Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c3665509e168821108a590c1ea5d3b921955167820a15dec548b7895b554eccd","observation_id":"762f1c23-3290-47f3-8dc5-755aefd961c1","resolution":{"observed_at":"2026-08-11T00:47:12.043981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T00:47:12.049215Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.049215Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:122c1a75c33d308bd2eadce7c5ba9bb198af24b73d7964346cae2ce5ccd622d1","observation_id":"efa4fd45-a338-41c0-b712-a49a9d2a9a93","resolution":{"observed_at":"2026-08-11T00:47:12.049215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19603","last_updated":"2024-09-29T07:47:15Z","snapshot_observed_at":"2026-08-17T09:27:54.598658Z","submitted_at":"2024-09-29T07:47:15Z","title":"One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19603","snapshot_observed_at":"2026-08-11T00:47:12.054302Z","title":"One token to seg them all: Language in- structed reasoning segmentation in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.054302Z"},"links":{"cited_paper":"/paper/2409.19603","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:a280ddb09771aa9ee14d793ba26248a0e2a744149de5ee4a56bc576042ba05ae","observation_id":"67b764e6-ebbf-45d8-b686-1d2f6f81c332","resolution":{"observed_at":"2026-08-11T00:47:12.054302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.059072Z","title":"Fully-convolutional siamese networks for object tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.059072Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:749f7a0110158a921626b08c83e10b750047e90a64534b5bb2f80ebef865f320","observation_id":"f21a84f0-3855-42c1-9209-28ef34555fb3","resolution":{"observed_at":"2026-08-11T00:47:12.059072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.063969Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.063969Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:443f8439e33430bcf4f7553b0eea626542a3f45ba770a0ae7bc7baf68aa163d7","observation_id":"4a7d8b0f-fdfc-451a-88c0-57cdf44b2830","resolution":{"observed_at":"2026-08-11T00:47:12.063969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.068513Z","title":"Fengwu: Pushing the skillful global medium- range weather forecast beyond 10 days lead","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.068513Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:7d7b5ff4d05105df9f625d4c4195f35d25fd472913044f44c6e033156d6714b5","observation_id":"cb805870-40c4-4245-a772-0fb8138759ad","resolution":{"observed_at":"2026-08-11T00:47:12.068513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-11T00:47:12.073445Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.073445Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:ff76b04575ef479d2dcb923c8ff6703f0d19062a1fedb6a0bb37e5a2650ca74c","observation_id":"bd164ced-73d1-4608-84b4-3ec7f999f3a2","resolution":{"observed_at":"2026-08-11T00:47:12.073445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T00:47:12.078413Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.078413Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:e2a444bfc668c0639abd9802abc7e371c45af2a7a9a382ebdb414fc404475320","observation_id":"b6c2acca-666b-4c43-a27b-fc5c8a996300","resolution":{"observed_at":"2026-08-11T00:47:12.078413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.083108Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.083108Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:11df5907e29f42e3439a2758ca308dcc7b0f24321cb762bf9dedebf914a9f3f4","observation_id":"052ffdf0-131c-43b2-873f-1e6212d75485","resolution":{"observed_at":"2026-08-11T00:47:12.083108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T00:47:12.087492Z","title":"Sharegpt4video: Improving video under- standing and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.087492Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:65dfc8d5dcfc149f9c5e3e1e171df921bac7de831461a3141508c15253cbe1a2","observation_id":"6c4c4aab-e7c2-4666-a51d-e9e39f8c8b7a","resolution":{"observed_at":"2026-08-11T00:47:12.087492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.092084Z","title":"A simple framework for contrastive learn- ing of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.092084Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:12904910b82e5e44f7d3fa93f5fc81b0829f3fd6bdcc19d3b681e83830177a68","observation_id":"2d1d871c-f622-416a-a8cb-99956a10c789","resolution":{"observed_at":"2026-08-11T00:47:12.092084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.096385Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.096385Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:787106b7ad1c57540b365b22cdc495fe15fff70f0f2ae9efdb83c900ae018919","observation_id":"725111f0-c607-4934-aabc-5aae54cb1bef","resolution":{"observed_at":"2026-08-11T00:47:12.096385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08177","last_updated":"2024-02-23T02:22:36Z","snapshot_observed_at":"2026-08-16T18:14:14.086565Z","submitted_at":"2023-04-17T11:39:53Z","title":"Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08177","snapshot_observed_at":"2026-08-11T00:47:12.100651Z","title":"Efficient and ef- fective text encoding for chinese llama and alpaca","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.100651Z"},"links":{"cited_paper":"/paper/2304.08177","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:2c26f1d13da6f4b14ddfac054ab1be0c89a0719a170df68a7a7089d53bf307ec","observation_id":"96e0e322-71e4-4521-9393-77405d9a80ae","resolution":{"observed_at":"2026-08-11T00:47:12.100651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.104936Z","title":"Atom: Accurate tracking by overlap maximization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.104936Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:e67ed62b3d3d2534648ebcb45fe404adc33ba9c6fb96f8dd8f4f026c5884fcea","observation_id":"87b74af6-5723-46e1-863c-b056a89acf75","resolution":{"observed_at":"2026-08-11T00:47:12.104936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.108967Z","title":"A thousand frames in just a few words: Lingual description of videos through latent topics and sparse object stitching","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.108967Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:430b8c958d75576ecd86c740f96c545b97ef4270b7d42e89c6e221b2a4d0db59","observation_id":"56b2fe7b-5ba8-42ed-a39b-18312df4226e","resolution":{"observed_at":"2026-08-11T00:47:12.108967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.113554Z","title":"MeViS: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.113554Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:083b77871ebdd4f2eef1d8fb71affe3dcf49596f9aa79bb3d49eb14909474282","observation_id":"00310f74-8531-48f9-9c63-14b0144895d4","resolution":{"observed_at":"2026-08-11T00:47:12.113554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-16T05:38:56.513422Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-11T00:47:12.117807Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and compre- hension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.117807Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:17cde102a4289df84ae13c91f00d6bfbccb9932644417ab2f1073cf62eed2954","observation_id":"1840cf52-86e3-452e-8ca4-4fdc90c06e0f","resolution":{"observed_at":"2026-08-11T00:47:12.117807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.122233Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.122233Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:5e8f0ec9885e08d31a5c3d064a7672a3643d78723bbc25add9e35846a2a3a7cf","observation_id":"da3f08b3-c0d2-4455-a27d-9daa61268863","resolution":{"observed_at":"2026-08-11T00:47:12.122233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.126482Z","title":"Lasot: A high-quality benchmark for large-scale sin- gle object tracking","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.126482Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:f3cd1743b99bc4e5ae1b2e039b6f936200eb7f0d5a2c1f41ab57cfbdef228919","observation_id":"c1215d70-ce8b-46aa-b293-e19a678c0ff2","resolution":{"observed_at":"2026-08-11T00:47:12.126482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-11T00:47:12.130622Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.130622Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:a5e762cacc06426d4a408a401fb2ec1a3152c6b4bae3441e5b362bd8ccaac662","observation_id":"527dba99-44c9-4d31-a891-4e245b4bf354","resolution":{"observed_at":"2026-08-11T00:47:12.130622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.134927Z","title":"An empirical study of end-to-end video-language transformers with masked vi- sual modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.134927Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:20696dd13462c72ea1ddc55038d2a6676377476dd22f6a9d39ee35438ce932af","observation_id":"e6eb339c-e42c-414f-af2a-c9450e2702c8","resolution":{"observed_at":"2026-08-11T00:47:12.134927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.139026Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.139026Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:9539a9de95596410035d8fc49ff04ac81c3c6ccf953b8609acdc6429ff8c4cb5","observation_id":"3374056e-b088-4018-b786-f7c624f794a8","resolution":{"observed_at":"2026-08-11T00:47:12.139026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.143090Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.143090Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:da967e5c5c8c6b90dfd6f8630f9490cd4271275e1f59d40d7b5c0ff7880e496d","observation_id":"a8c44783-2dfe-4ecd-b387-d1d18ecdbc36","resolution":{"observed_at":"2026-08-11T00:47:12.143090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.147570Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.147570Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:00b0d7bb845126075bc1a733ca52254c582ced6e29f3767765981a1686408da2","observation_id":"fa62e8f4-d0c9-4074-af60-e8cad2739f49","resolution":{"observed_at":"2026-08-11T00:47:12.147570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.151828Z","title":"Localizing mo- ments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.151828Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:07668b938e29cd3b70212d47ab7a9b4306b15c8e0e1e61f6d969644b5f200569","observation_id":"b2db24cf-c442-4e89-aca1-d867c3a2d165","resolution":{"observed_at":"2026-08-11T00:47:12.151828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.155987Z","title":"Lora: Low- rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.155987Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:f9f66b22d543437df12f626fc4d9c240e0445376badab26ec71bf7b8c34e3d66","observation_id":"4df2d7f4-754d-4078-a66e-3755084cec88","resolution":{"observed_at":"2026-08-11T00:47:12.155987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.160300Z","title":"Vtimellm: Empower llm to grasp video mo- ments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.160300Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:6e667d5a6edf41c8a49fe74cfd1658662d756481aa4abfdf1ca83daa06289ca6","observation_id":"1d862bc8-9fcb-48d3-90be-7c045f2f791c","resolution":{"observed_at":"2026-08-11T00:47:12.160300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.164547Z","title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.164547Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:50eeae58dcff91d01c0224c6a2da55d5e0a8f3ba59a328dc6cde6290f22cb5a6","observation_id":"174cdd31-72e7-49ff-ba71-2709e7ff8943","resolution":{"observed_at":"2026-08-11T00:47:12.164547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T00:47:12.168965Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.168965Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:38c325e23a3f476de88f954caac2e4d7ea0d2f81333f304257913db356b358a8","observation_id":"91aadbb5-b327-43ee-9673-e360eb89370d","resolution":{"observed_at":"2026-08-11T00:47:12.168965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.173790Z","title":"Sparse sharing relation network for panoptic driving perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.173790Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c3f36d1634a97af5cff0f8483673c533d489e2dc516f1ddeb4ef56e96a1914cd","observation_id":"4588e631-24e4-463b-abcb-8cbbfa43e80f","resolution":{"observed_at":"2026-08-11T00:47:12.173790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.178188Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.178188Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:68e9768ced22febc819817d7a05f7507f0b6dd78afd115af1430d9e4dbfcb6ff","observation_id":"ac1519dd-4912-4649-9aad-a73762a0f331","resolution":{"observed_at":"2026-08-11T00:47:12.178188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14622","last_updated":"2024-12-20T15:06:14Z","snapshot_observed_at":"2026-08-16T14:07:34.498797Z","submitted_at":"2024-03-21T17:59:35Z","title":"Language Repository for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14622","snapshot_observed_at":"2026-08-11T00:47:12.182626Z","title":"Language repository for long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.182626Z"},"links":{"cited_paper":"/paper/2403.14622","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:6d6e2f801b68afc79dab5bfa55add7cb52e12905020411170fecbc843b178e88","observation_id":"6a1416b0-dba8-4eb8-a22a-a93777d61210","resolution":{"observed_at":"2026-08-11T00:47:12.182626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.188728Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.188728Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:a086e2043e7491d26948689b6aa270ae89eeb419b67f5b56f135765b89ef5c90","observation_id":"d4a16e49-f30d-4f47-a61e-da87de2b95c4","resolution":{"observed_at":"2026-08-11T00:47:12.188728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.193172Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.193172Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:860e2a4bed83eb6d42bdd8de850f945b35b013920ab209a6bdc1c11a33742220","observation_id":"dc741ad8-f90d-4201-a667-e11909356d96","resolution":{"observed_at":"2026-08-11T00:47:12.193172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.197698Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.197698Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:0fcfc3f59bfff65765b69916095654a6d52fb0cd7093b61084c373e39810f9ad","observation_id":"4d1eee41-3aba-419b-84d6-b2f9c1ed9a02","resolution":{"observed_at":"2026-08-11T00:47:12.197698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.202060Z","title":"Lisa: Reasoning segmenta- tion via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.202060Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:f063c9ac6b5e1b6c71c474aa9b09b3a75464ea7fee16c2f4fea95dadd4da9cf4","observation_id":"483cf381-cdaa-4c04-a336-644dc5bcace0","resolution":{"observed_at":"2026-08-11T00:47:12.202060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.206802Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.206802Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:d1f8500968a65e9eeb2ad3139aecad272f054b28cb056b0f1e228efb150f2a36","observation_id":"9d4f8ff6-b2c6-4b46-b65d-83a55ae01d0b","resolution":{"observed_at":"2026-08-11T00:47:12.206802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.210658Z","title":"SiamRPN++: Evolution of siamese visual tracking with very deep networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.210658Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c34d98d17d6fa0fef1abae60b96ca1770216b52310801525789884e7e740e5ac","observation_id":"3e441280-5a69-4a81-9093-da47acfcb776","resolution":{"observed_at":"2026-08-11T00:47:12.210658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.214870Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.214870Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c0669518fa581b9a9cc54c9bb4029ea9d5197f9ca36d1f46b203f7b0139c1838","observation_id":"aa491ba9-b8ea-41c7-ab2e-59cbc3a38dcf","resolution":{"observed_at":"2026-08-11T00:47:12.214870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T00:47:12.224469Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.224469Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:4325995f25e27b6235e2ee21d09a2bd9ebb972ad41e844e5483802a6f66709f0","observation_id":"f8bebfc0-b866-4763-aef4-58a647a6b53c","resolution":{"observed_at":"2026-08-11T00:47:12.224469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-11T00:47:12.229444Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.229444Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:04d16e8bbc722a5ec1f316c5fb6f5cadf4f2a4b014ce74097a87a8682527b3fd","observation_id":"e0323e11-6fcc-49e0-be01-07331a41f31d","resolution":{"observed_at":"2026-08-11T00:47:12.229444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.234149Z","title":"Uni-perceiver v2: A generalist model for large-scale vision and vision-language tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.234149Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:770b30270744444f4e9a307d11c1d7ba3be7205478100afe04e1e197480a3ea7","observation_id":"b2b8dbfe-24e3-49e3-b60b-099c9887404e","resolution":{"observed_at":"2026-08-11T00:47:12.234149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.238446Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.238446Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c2a6754b6b74c5e59ee357cfa2df222f43236430f0f9f43c221fda3aa7faa6fd","observation_id":"a1dfefc3-b266-4371-bdd5-809b4224b1cc","resolution":{"observed_at":"2026-08-11T00:47:12.238446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-11T00:47:12.242711Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.242711Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:03ba7fd5aacb279af258ae82e05f751a7247ca277788c726fec96362fa21aaa6","observation_id":"bc44888b-8097-4936-ade0-db1a18d98b24","resolution":{"observed_at":"2026-08-11T00:47:12.242711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.247559Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.247559Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:96a0c492184e49e8d91cd8b5ffaaa98ef19e920f059df944695a5f69e9adf048","observation_id":"fad59bd5-0922-4de9-a41e-8df0a5f489eb","resolution":{"observed_at":"2026-08-11T00:47:12.247559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.252019Z","title":"Mvbench: A comprehensive multi-modal video under- standing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.252019Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:7d050183e8a34220c90d748454b71d6ed1bb02ad0d74bc650a5352b398edb989","observation_id":"bdc73eca-2634-4f3e-aa64-e621c3e803e8","resolution":{"observed_at":"2026-08-11T00:47:12.252019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T00:47:12.256747Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.256747Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c35534c153505ca08723bc65db39b4c718e0ca6f311a9ba65b0f3d3508f864cb","observation_id":"c13ec71b-bf5f-49dd-9338-dff9dac4361f","resolution":{"observed_at":"2026-08-11T00:47:12.256747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.262395Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.262395Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:a008c90c051520b5be61917002ff5e86e62bc6cddb22fce7d2df9591181af00f","observation_id":"9fcd10b2-ebe7-4196-aa91-09b95183cdb2","resolution":{"observed_at":"2026-08-11T00:47:12.262395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.266822Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.266822Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:2487074191dc21c1b2b003c07c99092d69ad2ed726ed75ce23dc4b91c43b697a","observation_id":"c7984272-a9f4-4441-b274-3554065941cf","resolution":{"observed_at":"2026-08-11T00:47:12.266822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.271112Z","title":"St-llm: Large language models are effective temporal learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.271112Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:39fc83e0275f49ab2a162040c4aa2e72add96745d74a648d5ef04e6c97c24b34","observation_id":"09c50c66-4d0c-4c60-b7f3-235b2c9d26a9","resolution":{"observed_at":"2026-08-11T00:47:12.271112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.275158Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.275158Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:d30d7b39999031f10a65238f158cb49181b7adbfba39da96eaf972c30df5d7a6","observation_id":"34c63680-e0c1-4889-8d82-48ce724812de","resolution":{"observed_at":"2026-08-11T00:47:12.275158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T00:47:12.278739Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.278739Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:8077cb6b1e788c5ec07fcff64de3dcfa4612d6aa3a9faafe1d2ed8d071532d2c","observation_id":"d809c351-6fd8-452c-a66d-568c620d301d","resolution":{"observed_at":"2026-08-11T00:47:12.278739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.283388Z","title":"Unified-io: A uni- fied model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.283388Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c33ef2fbfb96a9188002039d50b387a6e3170a38a158c42a98e68859a857b778","observation_id":"3defb2b0-6e33-438f-9072-c5d2d5a88ec6","resolution":{"observed_at":"2026-08-11T00:47:12.283388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-16T13:43:12.933116Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-11T00:47:12.288900Z","title":"Videogpt+: Integrating image and video en- coders for enhanced video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.288900Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:a550f2f11e998a20f4b9352be0928977589da1593f14edc92eae9307ef65d456","observation_id":"c1b178b1-1e35-4331-b275-62fea2903a2d","resolution":{"observed_at":"2026-08-11T00:47:12.288900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.293816Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.293816Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:95aa1bf1475cc86aebf9d5e56507bae2004ddcaaec9a9332f5260828fcfeb050","observation_id":"8c743a22-0b1a-42a3-9780-6b6493ba03e4","resolution":{"observed_at":"2026-08-11T00:47:12.293816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.298300Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.298300Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:fa7748e22307982c69a84c5d737a53820d5ebec318582337857a1cc98967db64","observation_id":"4a7162bd-a6bb-495a-b577-6d8d03ffcced","resolution":{"observed_at":"2026-08-11T00:47:12.298300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02718","last_updated":"2024-08-05T17:56:41Z","snapshot_observed_at":"2026-08-16T17:40:56.177453Z","submitted_at":"2024-08-05T17:56:41Z","title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02718","snapshot_observed_at":"2026-08-11T00:47:12.303561Z","title":"Mmiu: Multimodal multi-image understanding for evaluating large vision-language models.arXiv preprint arXiv:2408.02718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.303561Z"},"links":{"cited_paper":"/paper/2408.02718","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:8635d091c0b40826d7d8645a3bcaf4e60d9497077921c5ea3b0c94a1359caab1","observation_id":"1a20f7b7-3880-4f7d-9299-d3d699dc12bf","resolution":{"observed_at":"2026-08-11T00:47:12.303561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-16T14:43:08.760263Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-08-11T00:47:12.308118Z","title":"Correlation-guided query-dependency calibration in video representation learning for temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.308118Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:1918ee27de9adacf4347088429f20ce066261ef4da07de7602afd61bc138d99b","observation_id":"40e62f33-85da-4f3a-bd82-dc428f754b52","resolution":{"observed_at":"2026-08-11T00:47:12.308118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.312789Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.312789Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:373ac00bdb07eb474e820fa7703088abd9f745f3ecfb0e193d0666860ce39402","observation_id":"5b331ab6-7166-4a09-9665-0190eca0c328","resolution":{"observed_at":"2026-08-11T00:47:12.312789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.317196Z","title":"Queryd: A video dataset with high-quality text and audio narrations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.317196Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:79c9339691631279965b37284e72abd015a50a249671d35be355b1d37ade1137","observation_id":"9968bae1-ca09-491b-952f-6d6f168c4089","resolution":{"observed_at":"2026-08-11T00:47:12.317196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.322288Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.322288Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:d8210e3267c967d28f72abbe0e75da4db05f84d46556bce26773986d2d475baa","observation_id":"8d9cff8a-e079-4b2f-93f3-ed73883400ba","resolution":{"observed_at":"2026-08-11T00:47:12.322288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16009","last_updated":"2024-05-25T02:22:09Z","snapshot_observed_at":"2026-08-16T13:49:34.484002Z","submitted_at":"2024-05-25T02:22:09Z","title":"Streaming Long Video Understanding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16009","snapshot_observed_at":"2026-08-11T00:47:12.326508Z","title":"Streaming long video understanding with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.326508Z"},"links":{"cited_paper":"/paper/2405.16009","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:6b5eb7d3621aded0ed0e7d2ef5592d031443835ec77573e81061934ebd8e6d3e","observation_id":"39a8fa6e-9ea8-497c-b21c-8e2b8f6bf09d","resolution":{"observed_at":"2026-08-11T00:47:12.326508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.332811Z","title":"Chatvtg: Video temporal grounding via chat with video dialogue large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.332811Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:b348a7e94a6fad04ad1b63f5772de4bacf5cbc521f5582fa74bd8c3ceea2f74c","observation_id":"e2d36a86-b50a-4fac-938f-4371443238f7","resolution":{"observed_at":"2026-08-11T00:47:12.332811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.336988Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.336988Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:80b520c28109c90ece27acabd88d7df70a392c4c08f64b408367ccb7f2106095","observation_id":"c1701f76-a5c1-4331-9487-caf296513d44","resolution":{"observed_at":"2026-08-11T00:47:12.336988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.341269Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion param- eters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.341269Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:1ce46035941a97523578b59eb94e04ddd705d6a02529f6832af5a5f400641ace","observation_id":"59c7af4f-bccb-4e68-978c-8817061a0711","resolution":{"observed_at":"2026-08-11T00:47:12.341269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-11T00:47:12.345742Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.345742Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:fe07ff45f5f2e9478b0a806b24fa77f25dc16de002921bacf9d4db0b9483decb","observation_id":"6ac49e2a-8bd7-413c-bd64-1c43dcf8b128","resolution":{"observed_at":"2026-08-11T00:47:12.345742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.351149Z","title":"Ground- ing action descriptions in videos","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.351149Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:f25f70d9461dae75a151b8e9b87578c678f31da5649ca2cd0c84940f8a0751f3","observation_id":"b08a3b39-9ca2-4c34-80ee-5658aa397b2a","resolution":{"observed_at":"2026-08-11T00:47:12.351149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-16T14:37:48.062739Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-11T00:47:12.355668Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.355668Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:ba6a3b76c44b055cb650eb249342a640cb9d27c9a523d23a1e4fdb82ccfa3301","observation_id":"a3e98c36-3502-47d6-b542-48226d44bbbe","resolution":{"observed_at":"2026-08-11T00:47:12.355668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T00:47:12.360128Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.360128Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:409bff015cb2e1529378b1237b7c0bede8b40c566849b01bf21990f08e185b78","observation_id":"17dbad4b-7936-4613-9729-c3849276a502","resolution":{"observed_at":"2026-08-11T00:47:12.360128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.364501Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.364501Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:5d5618f1adb081eadef99d8fc063ab180d79a78f003c009a7791ba47bfc9a019","observation_id":"51259c39-5220-4606-bc20-07784baa90fb","resolution":{"observed_at":"2026-08-11T00:47:12.364501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08687","last_updated":"2022-02-24T18:57:20Z","snapshot_observed_at":"2026-08-16T17:41:22.741035Z","submitted_at":"2021-11-16T18:42:50Z","title":"INTERN: A New Learning Paradigm Towards General Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08687","snapshot_observed_at":"2026-08-11T00:47:12.369157Z","title":"Intern: A new learning paradigm towards general vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.369157Z"},"links":{"cited_paper":"/paper/2111.08687","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:6747cd9bd2531793c948471db40a6b2cf1d7e13c80c4733491b5075edf7f3ab3","observation_id":"f9bbda58-9867-4d77-ad12-18f39f3505bf","resolution":{"observed_at":"2026-08-11T00:47:12.369157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-11T00:47:12.373619Z","title":"Aligning large multi- modal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.373619Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:29efb9479f40b5893c7df9ded9ca7bb3767fc337e06b8076d2cc217a821f1c78","observation_id":"1644b85d-d3fe-450f-84e7-f25adc439ad4","resolution":{"observed_at":"2026-08-11T00:47:12.373619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T00:47:12.378201Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.378201Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:0150dc30414fb7063eb2016dc7ddd56bcedead641335ad062af82705f683f50b","observation_id":"34da1976-ea7c-4349-b3f2-78c89cec254b","resolution":{"observed_at":"2026-08-11T00:47:12.378201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.382579Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.382579Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:69cdff0a32dfa70a6f2944c8a62443868bc0879cc8646724852981fbfd9dc718","observation_id":"2fbe6ac4-4c09-4a10-a61d-1f7bc63deb60","resolution":{"observed_at":"2026-08-11T00:47:12.382579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-16T13:12:38.920225Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-11T00:47:12.387207Z","title":"Grounded-videollm: Sharpening fine-grained tem- poral grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.387207Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:aa33c3dc2c884c9ae94d234117014b63a1984bbea430a25011f8dec19b8c2c78","observation_id":"d3958667-486e-4e66-b164-d7e9e50dd5bd","resolution":{"observed_at":"2026-08-11T00:47:12.387207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.391944Z","title":"Temporal segment networks: Towards good practices for deep action recogni- tion","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.391944Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:7c0037dc9d862a7f63cb9f1a9d5ed8fbd6c051f2a1e5c6c39bbd821279175037","observation_id":"2112d1ed-6146-47f7-92ea-6bdcb1547a2c","resolution":{"observed_at":"2026-08-11T00:47:12.391944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.396143Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.396143Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:5dca70c24beddfe1d9945b96293bbf6765752300cf9eadffdc45ac850f670034","observation_id":"ec9bd1bd-44ba-4c59-a207-49c8d7f51987","resolution":{"observed_at":"2026-08-11T00:47:12.396143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.400268Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.400268Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c3fb658e925ba380a2ec6c7e2ccf864867f92af0ec3656e44eb653cd5c53c4ab","observation_id":"950ebfcc-fe51-4d1e-b994-3a6ba25d58ec","resolution":{"observed_at":"2026-08-11T00:47:12.400268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.404321Z","title":"Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.404321Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:fef9132fe6dc834d6f3cc98d6e78ba6edba1b3a660c0e964c5effe35e01955f8","observation_id":"74d4d335-58f0-4119-9d72-0528800240be","resolution":{"observed_at":"2026-08-11T00:47:12.404321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.408253Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.408253Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:2fcc0aea83259873db6095a94f8f00cec6b47fa0bcbd90c73570c6a74d66c9d9","observation_id":"e144cf75-68db-4d8c-8b1f-f2b7b0840a06","resolution":{"observed_at":"2026-08-11T00:47:12.408253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19474","last_updated":"2024-08-23T07:20:57Z","snapshot_observed_at":"2026-08-16T14:14:00.076855Z","submitted_at":"2024-02-29T18:59:17Z","title":"The All-Seeing Project V2: Towards General Relation Comprehension of the Open World","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19474","snapshot_observed_at":"2026-08-11T00:47:12.411857Z","title":"The all-seeing project v2: Towards general relation comprehension of the open world","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.411857Z"},"links":{"cited_paper":"/paper/2402.19474","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:a51d96e7965588b77a2871e616d205e3f07bb57396c3a269fd6c626597a6764a","observation_id":"5a475ba5-0bba-44a8-8f13-ad99d42f6da7","resolution":{"observed_at":"2026-08-11T00:47:12.411857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.415522Z","title":"Seggpt: Towards seg- menting everything in context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.415522Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:6bdd47e9ca70dccb0c5176a595b488a8b914e4eb77bb97253fd8b649f1aee9f8","observation_id":"7183b465-9ded-40cb-ac24-a0a124b62acc","resolution":{"observed_at":"2026-08-11T00:47:12.415522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.420144Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.420144Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:965ff5271e5aae06be4b0f2bd1dd079a8af3b912c13f9d71f1169702b3669d64","observation_id":"b9879015-eb3b-4f0e-92e7-a6d1a3500f8e","resolution":{"observed_at":"2026-08-11T00:47:12.420144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-08-17T03:13:20.368954Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-11T00:47:12.424055Z","title":"Hawkeye: Training video-text llms for grounding text in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.424055Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:4f8b949f23c09366bcde9af7a9488720ddae4c655b69defd673e2f955b3f3421","observation_id":"d1d2b970-e28e-4342-86a8-428ab4a2ecd2","resolution":{"observed_at":"2026-08-11T00:47:12.424055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.428352Z","title":"Onlinerefer: A simple online baseline for referring video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.428352Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:2b24dae4b8dfc390704937743abaab19a3475ed250d23f1d78a831d43820b5fb","observation_id":"f5828baf-26d0-4374-96a8-f28430e0b0e0","resolution":{"observed_at":"2026-08-11T00:47:12.428352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.432309Z","title":"Language as queries for referring video object seg- mentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.432309Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:626dd363c0a2f105ccef3368556a9f0ff36206c5567642595db2891737a68841","observation_id":"0fa3f08d-b539-4dd9-bfe4-2fd269787767","resolution":{"observed_at":"2026-08-11T00:47:12.432309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-16T13:43:39.938123Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-11T00:47:12.436431Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.436431Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:401d84dcb01a8a0565c3117f047f1e8c922bbc95ce5a6b7885c0c88c675a70d5","observation_id":"88ea1575-cc00-4422-b235-a431703f2c99","resolution":{"observed_at":"2026-08-11T00:47:12.436431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.440788Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.440788Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:2a8e6256b9ab1e186851b3148094cd86350f9115797df6a76be238925f8ad7a6","observation_id":"4ad712a8-de74-4069-91b1-a9578a193cfe","resolution":{"observed_at":"2026-08-11T00:47:12.440788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.445447Z","title":"Videoclip: Contrastive pre- training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.445447Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:347d5931ebd54bb9e348166df6dee2cd4bec57020b897bb29069ea825b612c90","observation_id":"3ddf5ce7-84dc-42d3-8609-cc57bdfe64fc","resolution":{"observed_at":"2026-08-11T00:47:12.445447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-11T00:47:12.450250Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.450250Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:bdd1a34fb1bf8a590ce3cb6fa7d61bec416ad1ec0c6088763ecbb889a05a99f7","observation_id":"b0326a83-5692-4b07-a186-e7fe06aba81e","resolution":{"observed_at":"2026-08-11T00:47:12.450250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.455596Z","title":"Siamfc++: Towards robust and accurate visual tracking with target estimation guidelines","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.455596Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:1d4ba9b3b4b2d840e3a0d7f2510e5d9694edd3e55f0133e33615d4f029f75e39","observation_id":"642dc38d-2816-4dc2-b509-2e43aa7a8eca","resolution":{"observed_at":"2026-08-11T00:47:12.455596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04979","last_updated":"2023-03-15T06:48:23Z","snapshot_observed_at":"2026-08-16T16:09:44.777322Z","submitted_at":"2022-12-09T16:39:09Z","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04979","snapshot_observed_at":"2026-08-11T00:47:12.459953Z","title":"Video-text mod- eling with zero-shot transfer from contrastive captioners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.459953Z"},"links":{"cited_paper":"/paper/2212.04979","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:24361f1befe3aeb3d8f35bac0a842935134c83e477b00cc34f890ac41127786e","observation_id":"33e06ae5-572b-4d9c-9a21-50afbc3fc684","resolution":{"observed_at":"2026-08-11T00:47:12.459953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.464454Z","title":"Zero-shot video question answering via frozen bidirectional language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.464454Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c9a55ddc42f5fa046ac69753364fce383dae4f31d548e29fcbbcfe1f60b79fed","observation_id":"52dcc8d0-e514-4265-abb9-3f22a5911a0d","resolution":{"observed_at":"2026-08-11T00:47:12.464454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.468728Z","title":"mplug-owl: Modularization empowers large lan- guage models with multimodality, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.468728Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:1cc31ca3882074492f30874e7afa5d2c84d46c0f7e8488a198d1dff00f074564","observation_id":"bb85984f-c062-49d6-aaa2-f2dfe3d3d98d","resolution":{"observed_at":"2026-08-11T00:47:12.468728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.473590Z","title":"Merlin: Empowering multimodal llms with foresight minds","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.473590Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:4fe2b8803396b30af0db2db6c897715e09ba1162bbfcf778c4987aa001ea91a8","observation_id":"13197f99-7de3-49ea-8b23-66128b57d23b","resolution":{"observed_at":"2026-08-11T00:47:12.473590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.478410Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.478410Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:6eb3a9d68955ff6841bb2337aa2de2e656fc71270205f296ca488017f277ea9a","observation_id":"c9399eb5-9bae-4a8a-b799-c04f20dd3c4f","resolution":{"observed_at":"2026-08-11T00:47:12.478410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.482453Z","title":"Mattnet: Modular at- tention network for referring expression comprehension","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.482453Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:02fa818792ddb955fc61d2db6e3eedaf4106b6cb8e7ebb5cf482cbfd6a256d56","observation_id":"8789c826-b9f5-461e-b2cf-73d5383661ee","resolution":{"observed_at":"2026-08-11T00:47:12.482453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.486338Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.486338Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:f16c2efce5c7c81df50bfbcda2ea11ad7c678e06b80cabbe309c1c5cdf048de7","observation_id":"bf830b6e-aec6-42a2-af31-67bb9de7d17f","resolution":{"observed_at":"2026-08-11T00:47:12.486338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:14.006602Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"a7a15065-5dbc-421b-96fb-f853d8dd45fb","year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.490079Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:24918d36ba864f9a3de6681ebe9784153e50b2adb82cb9049f00d79fff17e292","observation_id":"f6f89742-adc7-4844-b86d-f59213dfa980","resolution":{"observed_at":"2026-08-11T00:47:14.010847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":145},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 145 outbound references and 5 inbound Pith citation observations for arXiv:2412.19326."}