{"as_of":"2026-08-11T13:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78db140e6f02d6bf6866b8ee476a32bed3ad9356903340849888292d32317c4c","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:45:51.654456Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11155/citation-record","integrity":"/paper/2506.11155/integrity","json":"/paper/2506.11155/citation-record.json","paper":"/paper/2506.11155"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.545168Z","title":"The Verifier we used is Qwen2-VL-72B","venue":null,"work_id":"5db9f1de-530e-4064-a377-b44ac8bd8555","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.732140Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:2e424f59b508165bbf74c47110af42876e50207801988d6831a4b9771291caa5","observation_id":"1c60edfc-0cbb-4f35-89df-1696c8185719","resolution":{"observed_at":"2026-08-07T04:45:52.549246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.532579Z","title":"video caption","venue":null,"work_id":"00391cf7-4596-4ea7-b6c4-f285a47ce123","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.769808Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:2d0317a00cbbd849f515d96cb5bad0b36480e208cfc0a5b1c5a885e0ab2e0671","observation_id":"d0cb6278-ba63-4b33-bad5-f1403c087f6a","resolution":{"observed_at":"2026-08-07T04:45:52.536479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.490856Z","title":"The defination and examples of each category is described in Figure 10","venue":null,"work_id":"c156b085-3961-4e8c-8cda-0f413f1ea69b","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.897453Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:fc407942d970ee45386fcf3bf0d3dd4ada71673586d8a9915a60dabe14d8bb8e","observation_id":"08bb520d-f4a2-4e37-8030-ace8a2b4984e","resolution":{"observed_at":"2026-08-07T04:45:52.494812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.519163Z","title":"As shown in Figure 6, the Nature and Wildlife category has the highest number of videos, reaching 382, while the Arts and Creativity category has the fewest, with 57 videos","venue":null,"work_id":"faf2c1a7-a0ef-4dd4-8014-508b244fbd86","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.807483Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:70f12bc8edf5c32076b91b07d8803c2497b0169442167952c66b25a6cd6a5f09","observation_id":"43c230d3-60b0-4dda-8539-13f547e19a14","resolution":{"observed_at":"2026-08-07T04:45:52.523671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.124124Z","title":"For clarity, consider these examples: ## Example 1 ### Key Points {1","venue":null,"work_id":"433e3ae2-18fa-4e63-979c-3b3f19a86538","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.250419Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:4718b85406e07261b9680acb60d09c4af61e8ca7c6148f9870e65afa5665e7cf","observation_id":"0edb9973-083d-4661-9ce8-bb956e41b22e","resolution":{"observed_at":"2026-08-07T04:45:52.128104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-07T04:45:49.655855Z","title":"Advances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.655855Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:137665a99ceed81ea3df3396a6c4930e2536f02a58f557b0a3f7cd2b83557c12","observation_id":"aca6c052-7370-41b5-9be1-b61b192335c7","resolution":{"observed_at":"2026-08-07T04:45:49.655855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.505798Z","title":null,"venue":null,"work_id":"6c5f007b-7f9e-4840-bb14-026ac79e47d4","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.877197Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:ff5cc6dc364e9c7b459a2b8c5eb4aee74ee2157e72c819a2cb71ed7b217ceb24","observation_id":"e43c75bc-cef8-466e-b1e4-d6c27ddc085b","resolution":{"observed_at":"2026-08-07T04:45:52.510059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.477952Z","title":"Elaborate on the visual and narrative elements of the video in detail","venue":null,"work_id":"452923d3-f0a6-4f34-9f8a-38897acbd1f4","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.953882Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:ae21d7f4d440c40c8187f7588ecfe15a73718bad7b000dcce838d3f7a04423c5","observation_id":"9128212f-1432-4a17-a791-81d3712fea5c","resolution":{"observed_at":"2026-08-07T04:45:52.482137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.464280Z","title":"Reply to me with a precise yet detailed re- sponse","venue":null,"work_id":"648b04cd-d203-4fdc-936c-2999c564d8ce","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.986135Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:03d71286bbf5fef63170074cd14d8556aeba1f7960991949199ed04eeb6cdb7e","observation_id":"09dc07ac-d317-4bee-b07f-d469fb158832","resolution":{"observed_at":"2026-08-07T04:45:52.468746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.451852Z","title":null,"venue":null,"work_id":"47dd3e50-1e68-48d4-ad00-37ce75e0b62e","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.040106Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:bda2b574d5995c372e6e744b26d7d622c86be5e69d4a35ee79c2950aaf6fb994","observation_id":"aa5f7445-cd02-4a89-ade0-b30c3b04a451","resolution":{"observed_at":"2026-08-07T04:45:52.455747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.438336Z","title":"If you are not sure about something, do not include it in you response.\\n # Task\\n Describe the background, characters and the actions in the provided video.\\n”","venue":null,"work_id":"c0650393-250c-4abc-b40d-4e672ffadad3","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.063737Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:e8fb63697f1675fa714bb97df487ad8b4de05520eeb63b5cba1c30e2fc7eaac6","observation_id":"12594294-b8ea-45a0-8d77-a4ea5371fbf2","resolution":{"observed_at":"2026-08-07T04:45:52.442836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.425012Z","title":"Please describe the video in detail","venue":null,"work_id":"40892519-ec57-4fc1-a54c-9ef646f5e0d6","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.091040Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:f1dce0ddf577eb065726e6ff40d0b26d3bde1e88870645eb1ff363f7438c3288","observation_id":"09a987e6-3a93-4b05-93d3-bd4e4708cb89","resolution":{"observed_at":"2026-08-07T04:45:52.429147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.412914Z","title":null,"venue":null,"work_id":"28d7618b-b808-4573-8b77-50bc07a4af9f","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.113506Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:719212893b3db4d8d99423b127a7dfda33f08cd9b615579307b66bf3eeacf23d","observation_id":"612c6a12-7820-4ec1-8ee6-5fb423a35600","resolution":{"observed_at":"2026-08-07T04:45:52.416554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.400201Z","title":"Action Description Action description focuses on the specific behavior or activity that takes place in the video","venue":null,"work_id":"d1c0462f-ad94-4f70-b54f-477dbf531e18","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.157246Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:545f5e1cb74e8890eee49c75b19c112bb1d92167ffe4ec6777fea86ec4dec12f","observation_id":"8ff35304-bb11-4a01-a8a6-9a32d9b4da57","resolution":{"observed_at":"2026-08-07T04:45:52.404105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.388290Z","title":null,"venue":null,"work_id":"61f2ae0e-e092-4cc9-af31-4f2d683ab043","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.227646Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:88a43864f5718db689eb0b984cbe5695ec63dc77071637fe71646ef8bc255176","observation_id":"5e35b046-e14c-4907-a93c-8cf020039730","resolution":{"observed_at":"2026-08-07T04:45:52.391772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.375804Z","title":"Environment DescriptionEnvironment description covers the background and environmental features of the scene in the video","venue":null,"work_id":"18eaa95d-e801-4895-9574-8ab2208953b8","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.272752Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:7bbb04d8499405fffee582a07dbe9d8e4334098a9d961d17143be02b1b21215b","observation_id":"f6407169-11de-4a84-b3c8-456171823de0","resolution":{"observed_at":"2026-08-07T04:45:52.380039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.363038Z","title":null,"venue":null,"work_id":"2e19088d-5c0c-4dce-bf38-d17151ea854e","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.321552Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:77c60c28bf5ce88573376216e69f0cea607f334404dacd835d01382c941707a9","observation_id":"0a7688bf-5e33-47dc-8ebd-8049fa3c40e8","resolution":{"observed_at":"2026-08-07T04:45:52.367175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.349948Z","title":"Object Description Describes the features, characteristics, or details of inanimate objects or items present in the scene","venue":null,"work_id":"95591232-3ffa-4c83-840a-d4d8e1adbac1","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.384862Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:bdf3f2d3a6a33e9ac41dae88fc26f302e8ecedf9ed25566460cdaf88a89a7e61","observation_id":"1c4f6e0d-c3a7-4497-a5f7-082058f8b5ac","resolution":{"observed_at":"2026-08-07T04:45:52.353915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.336366Z","title":null,"venue":null,"work_id":"4ec956df-6c53-4156-a06f-68856ea9c4c9","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.433451Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:bdec325020b7f91b6646967e527759a33d208b6846504af081f388c4ff8202db","observation_id":"36aad59d-79c6-4bef-9b3c-afc83c6f062f","resolution":{"observed_at":"2026-08-07T04:45:52.340986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.322330Z","title":"Camera Movement Describes the camera angles, movements, framing, or other cinematographic techniques used in the scene","venue":null,"work_id":"2fd34523-2514-4e77-835b-73bc5dddc790","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.493367Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:5e1eaf3dec97b2a486b6f89424f3e64bb5e4db24e9bf271e69dcd4d29c518b34","observation_id":"e9a41f06-b236-4622-b32f-2204c25f501c","resolution":{"observed_at":"2026-08-07T04:45:52.327006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.308703Z","title":"Overall Description","venue":null,"work_id":"55c8fa73-e161-422b-8d09-d4bf22e5b05e","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.556622Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:acdb7a5d9849de46607f74767a1eb77a2496275f4b625fed9bc94d5e75cc7030","observation_id":"6d106cb3-23e4-4936-81ab-e38ff7579a41","resolution":{"observed_at":"2026-08-07T04:45:52.312951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.296136Z","title":null,"venue":null,"work_id":"3542a155-5be3-4c09-ba89-613f504a4cba","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.602919Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:5c5f8509bcf532f6d55ab47d68e246430e017daba03ac5a2a863ab59e6901828","observation_id":"e2c286b5-8623-4035-8ed6-1564be95773f","resolution":{"observed_at":"2026-08-07T04:45:52.299776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.283717Z","title":null,"venue":null,"work_id":"329aa8c1-897f-46b7-ae5a-98d8964e7d4d","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.648467Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:5616d79f54791c82c3bcadce46a199c8cd9ff3e4bcadb1787d79c8fee68485bf","observation_id":"44daad0e-240f-45f7-a52a-fefdb635de9b","resolution":{"observed_at":"2026-08-07T04:45:52.287434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.268949Z","title":null,"venue":null,"work_id":"e4f7e9b4-dc71-4250-aa48-3d206f314959","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.685906Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:6380dce85f2c9cb559603b08b31c3e11de0861b32da464beda4f438d5ec511d4","observation_id":"207efaf8-4853-479b-b148-e0c90cf7d968","resolution":{"observed_at":"2026-08-07T04:45:52.273193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.255216Z","title":"Judgment: [yes/no] Reason: [Brief explanation]","venue":null,"work_id":"2d48f047-35f0-42c7-9b12-c09231ee9de7","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.709361Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:938f3523835c3dfa1bbec84845373cff71f9ae967215a2807a29b1f842c672ab","observation_id":"5a01bb6c-ea31-42a4-b312-5f45cfd4fdf3","resolution":{"observed_at":"2026-08-07T04:45:52.259294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.242266Z","title":null,"venue":null,"work_id":"4ea08a4f-cadb-4992-b902-6c71acbfa2a5","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.751336Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:e6978ca6622b1897d841380b206bbc8c96b9fd44b244c794355032927829a48f","observation_id":"e7a52ff5-1705-41f0-bb08-4f714e14fd67","resolution":{"observed_at":"2026-08-07T04:45:52.246129Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.229125Z","title":"For clarity, consider these examples: ## Example 1 ### Video Description: The video showcases","venue":null,"work_id":"ea6be8a4-473d-4be3-a61e-efa9e8f4fbb9","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.820854Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:2c91d0bc6a1dd3a7551e084412a120202dd225e4cbfa0dcc472b67f0ddd1ed15","observation_id":"73134215-1d39-4897-8815-04b2c4f43b6b","resolution":{"observed_at":"2026-08-07T04:45:52.233155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.214913Z","title":"entailment","venue":null,"work_id":"017b3d59-4c26-435e-9ecf-3931c8e4e14e","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.866840Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:61068d48400b7ac49ac887a9761a540653c78ed87ff1177cb5ce158151f138a0","observation_id":"44eec224-6230-442b-a74a-18647b9d08b2","resolution":{"observed_at":"2026-08-07T04:45:52.219323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.200657Z","title":"contradiction","venue":null,"work_id":"da5ec721-624c-401c-b833-7febbcacfbf6","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.920062Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:45f95f7b16546462baa0027325d58f873dd0bc7ff97569c6bd891149565f9812","observation_id":"e3a218d6-bbb0-476d-936c-c61e9096d38d","resolution":{"observed_at":"2026-08-07T04:45:52.204952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.187795Z","title":"neutral","venue":null,"work_id":"79dcd76c-d38a-4827-ae98-9838b94e29ad","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.988196Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:53932626f466ec06fc8adadb3546474f12108478e8368e7c5d398eca42bbb818","observation_id":"deaf138a-b65f-4a5b-bfd3-379f268f0095","resolution":{"observed_at":"2026-08-07T04:45:52.191475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.175357Z","title":null,"venue":null,"work_id":"4c9f2b6e-2009-4277-b323-678d8617d5de","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.039572Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:668734e650015be7b2639d10f4e9c014c407a9fc1bbf71b847ba77a6d4fd5ec1","observation_id":"f04dc7e4-f631-4893-888d-c690782b4841","resolution":{"observed_at":"2026-08-07T04:45:52.179059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.162683Z","title":null,"venue":null,"work_id":"b8669745-a1c0-434a-8a3e-6f69d746f132","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.135838Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:65e32c3c76925210189d802932f75550e5b5549df80a1da0687de2e313bdf33b","observation_id":"2dead321-8060-4d48-b8fe-099d903d3c0e","resolution":{"observed_at":"2026-08-07T04:45:52.166708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.150188Z","title":null,"venue":null,"work_id":"81e97538-ead2-4723-be53-062e652987c0","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.205648Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:a3ef8a6854823f120e292feb6452be4e7e1df2fb6dc43e555b8441dd047cfe5c","observation_id":"bc4c0a8c-5d0a-4cda-b690-413ff0c6f458","resolution":{"observed_at":"2026-08-07T04:45:52.153967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.137624Z","title":null,"venue":null,"work_id":"1e36491e-1950-49b9-83fc-09e383d23377","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.226275Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:149553d8f2e448a089a1878ef1ac27bb7747a8befa623a28ccfa0d302f05e32d","observation_id":"6f322406-4ade-4809-85c7-01a3c1c5245d","resolution":{"observed_at":"2026-08-07T04:45:52.141384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.110759Z","title":"[No] Speculative","venue":null,"work_id":"b3c98dab-caea-48b9-a9bc-bea4780ae513","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.286328Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:112deae2a09447425ebe99f16edad9623de8c77c8204b860d50f01b33860d453","observation_id":"209f6f20-0529-436b-bd45-60bbf283b7a3","resolution":{"observed_at":"2026-08-07T04:45:52.114620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.096400Z","title":"</thought> tags","venue":null,"work_id":"770e729e-aea5-44bc-870f-61fe08740999","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.329282Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:8451a6e664d42a86f178bf6fb86d466981d4838ad0eb514b7ce96f768b8e71c3","observation_id":"4e58d046-f8ca-40fd-94a3-9631b7ad3b35","resolution":{"observed_at":"2026-08-07T04:45:52.101011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.082289Z","title":"Overall Description","venue":null,"work_id":"50c69f39-b842-48a5-8c60-98adba71d87f","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.449655Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:0ceebf292784edb61282c122bcae650c05946ff717dc5786177d6df330aff9e2","observation_id":"440f3780-deb9-417e-923a-65bd5d676425","resolution":{"observed_at":"2026-08-07T04:45:52.086183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.068402Z","title":"## Example Input and Output: ### Input: Overall Description: {overall_description} Observation: Vehicles Key Point: There is no existence of any vehicles in the video","venue":null,"work_id":"e7793373-d93f-449e-9a15-58e8846f7535","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.496957Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:e3bfe214a82bb8752e47b7830fa974d9c08027bb3642a5168b13900fe7be2435","observation_id":"ae45ca9a-7395-467c-9248-59acb4d784ae","resolution":{"observed_at":"2026-08-07T04:45:52.072730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.055236Z","title":null,"venue":null,"work_id":"07d0ed50-2b31-4c3f-a840-3962e1211981","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.561541Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:1444823e0b9158742cc43c2884aba2012b3d69bbd44a87ab5f2e0e78d57c57f0","observation_id":"ba2e7ca2-4f59-4f63-a9b4-b4249dfbf04d","resolution":{"observed_at":"2026-08-07T04:45:52.059285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.020891Z","title":null,"venue":null,"work_id":"dfa38569-2632-4c4e-bdd7-9eea27fcc1ae","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.625504Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:10377a6988902c85c5e5daa0d69f0ddfd260fb9bd9dfd25b7511c415d5f15bbf","observation_id":"943bbb7a-b0a6-4ed1-97dc-7efff2e687fe","resolution":{"observed_at":"2026-08-07T04:45:52.045858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:51.937413Z","title":"Precision / Recall / F1 Score","venue":null,"work_id":"9c9d2622-9c67-4b59-93a3-7f4459e08652","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.654456Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:4f7353bb19871ad965d744c632cf9f8a7ca5a704a2e47e6cb0be555e0efad780","observation_id":"5cd90b8e-b737-4cb4-9a01-69db871d2438","resolution":{"observed_at":"2026-08-07T04:45:51.968280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04752","last_updated":"2024-06-07T08:52:24Z","snapshot_observed_at":"2026-08-05T22:09:34.368887Z","submitted_at":"2024-06-07T08:52:24Z","title":"CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.04752","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04752","snapshot_observed_at":"2026-08-07T04:45:51.798794Z","title":"CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models","venue":"cs.CL","work_id":"92d94ded-350f-4990-b419-ac68ec223db2","year":2024},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.548866Z"},"links":{"cited_paper":"/paper/2406.04752","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:921fecc7d2310c17781340c17a58a389d9517d951c7e18b85524814e1e560f88","observation_id":"91c77bd8-51be-499e-a1b7-18721181226a","resolution":{"observed_at":"2026-08-07T04:45:51.840389Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-07T04:45:49.431685Z","title":"In Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.431685Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:f027cfa1c3d169d08bb39bee7fa062fbf71acbc3e307b72d5adaf984d2a73351","observation_id":"8cc72c16-a1b7-44d9-ba64-53bcd81e4d9c","resolution":{"observed_at":"2026-08-07T04:45:49.431685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15422","last_updated":"2024-03-04T16:55:15Z","snapshot_observed_at":"2026-08-09T15:48:17.743409Z","submitted_at":"2024-01-27T14:19:33Z","title":"A Survey on Data Augmentation in Large Model Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15422","snapshot_observed_at":"2026-08-07T04:45:49.695413Z","title":"Please describe the video in detail","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.695413Z"},"links":{"cited_paper":"/paper/2401.15422","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:3aade97cdfaf5652d24a3645819af692e01a4564f1ec44207f45e8aed2ef1f0f","observation_id":"8b0c2260-b588-4876-b0f3-809ab39e684f","resolution":{"observed_at":"2026-08-07T04:45:49.695413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13007","last_updated":"2023-03-20T11:39:47Z","snapshot_observed_at":"2026-08-10T18:54:22.431568Z","submitted_at":"2023-02-25T06:58:16Z","title":"AugGPT: Leveraging ChatGPT for Text Data Augmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13007","snapshot_observed_at":"2026-08-07T04:45:49.338985Z","title":"arXiv preprint abs:2302.13007","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.338985Z"},"links":{"cited_paper":"/paper/2302.13007","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:d7e1e6a65023f7214d437d06b8bcfba3fb6055505a02b65e564a167904361f18","observation_id":"d31a7ef3-db04-4ac8-b77b-04a581e6beb3","resolution":{"observed_at":"2026-08-07T04:45:49.338985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T04:45:49.619619Z","title":"arXiv preprint arXiv:2403.05530","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.619619Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:f6db0759287793fa336c914924b924f672df1a50709cb740fefa21c1afeefd9e","observation_id":"ad3cbeba-4fda-4f83-bb7d-6c5ec7d0dd94","resolution":{"observed_at":"2026-08-07T04:45:49.619619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03884","last_updated":"2026-06-03T08:00:13Z","snapshot_observed_at":"2026-08-05T23:18:17.400072Z","submitted_at":"2024-07-04T12:23:02Z","title":"ChatSOP: An SOP-Guided MCTS Planning Framework for Controllable LLM Dialogue Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03884","snapshot_observed_at":"2026-08-07T04:45:49.470142Z","title":"Preprint, arXiv:2407.03884","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.470142Z"},"links":{"cited_paper":"/paper/2407.03884","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:ab18780f946326552c9a917179448ae1713443a0679fde298ab911664a44154b","observation_id":"0b957b4d-0f0a-4132-b5a7-232ce234c2fb","resolution":{"observed_at":"2026-08-07T04:45:49.470142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T15:04:42.658103Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2506.11155."}