agentscope-ai/pawbench
PawBench: A comprehensive agent benchmark with 150 tasks covering coding, data analysis, tool use, reasoning, safety, and multimodal capabilities.
harbor run -d agentscope-ai/pawbench| Task |
|---|
agentscope-ai/t035-claweval-t097-pinbench-eli5-model-summary |
agentscope-ai/t142-wildclawbench-02-sam3-inference |
agentscope-ai/t103-qwenclawbench-00066-svpwm-implementation-for-edge-aligned-pwm-motor-controller |
agentscope-ai/t049-claweval-ctb-ops-04-cross-team-dependency-map |
agentscope-ai/t041-claweval-t150-project-progress-report |
agentscope-ai/t086-qwenclawbench-00075-sector-momentum-rotation-backtest-with-data-quality-traps |
agentscope-ai/t050-claweval-ctb-sales-10-key-account-health |
agentscope-ai/t034-claweval-t093-pinbench-email-triage-report |
agentscope-ai/t019-claweval-t011zh-expense-report |
agentscope-ai/t029-claweval-t028-api-config-audit |
agentscope-ai/t084-qwenclawbench-00067-write-sparql-query-for-product-reviews-containing-iphone |
agentscope-ai/t009-claweval-m074-doc-extraction-thinking-impact |
agentscope-ai/t065-pinchbench-shell-command-generator |
agentscope-ai/t088-qwenclawbench-00086-command-prefix-security-analysis |
agentscope-ai/t073-pinchbench-polymarket-briefing |
agentscope-ai/t057-pinchbench-earnings-analysis |
agentscope-ai/t045-claweval-ctb-d02-api-changelog |
agentscope-ai/t085-qwenclawbench-00069-polymarket-btc-15min-monitor-skill-creation |
agentscope-ai/t147-wildclawbench-06-authority |
agentscope-ai/t077-qwenclawbench-00017-moltbook-auto-post-cron-execution |
agentscope-ai/t134-skillsbench-manufacturing-equipment-maintenance |
agentscope-ai/t025-claweval-t022-newsletter-curation |
agentscope-ai/t091-qwenclawbench-00090-daily-password-verification-system-design-document |
agentscope-ai/t015-claweval-m101-chinese-food-identification-zh |
agentscope-ai/t001-claweval-m005-score-canon |
agentscope-ai/t082-qwenclawbench-00052-generate-openai-social-media-profile-from-workspace-data |
agentscope-ai/t150-wildclawbench-06-skill-injection |
agentscope-ai/t069-pinchbench-meeting-gov-controversy |
agentscope-ai/t089-qwenclawbench-00088-personal-assistant-security-policy-assessment |
agentscope-ai/t097-qwenclawbench-00100-house-robber-algorithm-deep-dive-explanation |
agentscope-ai/t113-qwenpawbench-234-doc-butler-skill-cron-agent |
agentscope-ai/t017-claweval-t003zh-calendar-scheduling |
agentscope-ai/t004-claweval-m008-metro-map-1 |
agentscope-ai/t072-pinchbench-meeting-tech-decisions |
agentscope-ai/t052-claweval-ctb-w06-fullstack-dev-repair |
agentscope-ai/t099-qwenclawbench-00038-plan-project-folder-structure-for-new-blue-ocean-project |
agentscope-ai/t096-qwenclawbench-00098-diagnose-scheduled-book-recommendation-failure |
agentscope-ai/t078-qwenclawbench-00028-qmd-file-index-checker-skill-creation |
agentscope-ai/t083-qwenclawbench-00063-second-pass-quality-audit-of-question-169663 |
agentscope-ai/t116-qwenpawbench-mm-tool-7997 |
agentscope-ai/t068-pinchbench-deep-research |
agentscope-ai/t107-qwenpawbench-185-search-ev-ranking |
agentscope-ai/t124-qwenpawbench-skillhub-0055 |
agentscope-ai/t081-qwenclawbench-00033-ai-browser-project-git-initialization-and-workspace-setup |
agentscope-ai/t092-qwenclawbench-00091-security-policy-assessment-for-llm-assistant-input-trust-model |
agentscope-ai/t117-qwenpawbench-mm-tool-aug-011 |
agentscope-ai/t090-qwenclawbench-00089-security-code-audit-of-compensation-service |
agentscope-ai/t020-claweval-t012-expense-report |
agentscope-ai/t003-claweval-m007-score-symphony |
agentscope-ai/t128-skillsbench-dialogue-parser |
Displaying 50 of 150 tasks